入门必读(5):选一个真正跑得动你 Wiki 的本地模型
Qwen3.5、Qwen3.6、Gemma 4、oMLX——哪个模型在你的硬件上跑得好,要付出什么代价。一份走向完全离线、又不牺牲可用性的实操指南。
三个理由,挑一个属于你的
认真用 Karpathy LLM Wiki 的人,迟早会考虑跑本地模型。理由通常只有三个,挑一个属于你的就行:
- 隐私。你的库里有真的不该出门的东西——记者的信源、律师的卷宗、签了保密协议的研究数据,或者一本你不想被任何 API 日志记录的私人日记。摄入时,每一条笔记、每一个名字都会被打包进 prompt,发到别人的服务器上。对大多数人这无所谓,但对上面这几类人,这是硬约束。
- 网络。你经常在飞机上、在信号糟糕的地方,或者公司防火墙干脆封了 API 出站。这些场景里,云端等于不存在。
- 成本。你是高频摄入的重度用户,每天几百上千次调用累计的账单,已经越过了”不如买张显卡”的那条线。
如果这三条对你都不是真约束,只是好奇,那也没关系——文末会老实告诉你什么时候本地不值得折腾。但只要有一条让你点头,就继续读下去。插件从第一天起就是为离线设计的:零遥测、无后端、不收集任何数据。自 v1.25.0 起,过去唯一把人推回云端的短板也补上了——完全本地的 PDF 摄入路径(oMLX + Markitdown + Baidu Unlimited-OCR,详见 实践指南(8):PDF 摄取)。现在,你真的可以做到一个字节都不出机器。
剩下的问题只有一个:你到底该下载什么,它能不能在你手里那台机器上跑起来。
先看硬件,别先看模型
大多数指南一上来就甩给你一张模型排行榜。这顺序是反的。模型能不能跑,几乎完全由你桌上那台机器决定,所以先从硬件开始。你属于下面三类中的哪一类:
你手里的机器是——
Mac(M1/M2/M3/M4 芯片)?
→ 最省心的一条路。统一内存在这里帮你很大的忙。看「Apple Silicon 篇」。
带独立 NVIDIA 显卡的 PC / 工作站?
→ 天花板是显存,不是系统内存,算账更严格。看「NVIDIA 篇」。
普通笔记本 / 台式机,没有像样的 GPU?
→ 能跑一个小模型,但先说实话:会很慢。看「只有 CPU 篇」再决定。
Apple Silicon 篇
普通 PC 上,模型权重必须塞进显卡那块又小又贵的专用显存。Apple Silicon 只有一块所有东西共享的大内存池,所以整台机器的内存都能给模型用。这就是为什么一台 64GB 的 Mac 能舒服跑起 27B 量化模型——换成 NVIDIA 你得插两张 3090;而 128GB 的 Mac Studio 能收下 70B 级别的模型,很多人以为那得上服务器。
几个粗略的上限,方便你对号入座:
| 芯片 | 统一内存 | 能舒服跑的 |
|---|---|---|
| M1 / M2 | 8–24 GB | 7B;压狠一点能上 13B |
| M3 | 8–36 GB | 13B 很稳;27B 得使点劲 |
| M4 | 16–48 GB | 27B,或有余量的 35B MoE |
| M4 Max | 36–128 GB | 70B 级别,包括大号 MoE |
有个记号你会绊到:35B-A3B 里的 “A3B” 指的是激活参数。它是 Mixture-of-Experts 模型——总参数 350 亿,但每个 token 只点亮 30 亿。所以它的运行成本接近一个 3B 小模型,答案质量却接近 27B。Qwen3.5 的 A3B / A10B 家族是这两年消费级本地推理最好的进展,也是一台笔记本能越级打怪的原因。
NVIDIA 篇
独立 NVIDIA 卡上,唯一算数的是卡上的显存。溢出可以借用系统内存,但吞吐量会断崖下跌,大约慢十倍,所以把显存数字当成一堵硬墙。
| 显存 | 跑得好的 |
|---|---|
| 8 GB(RTX 3060/4060) | 7B,仅此而已 |
| 12 GB(RTX 4070) | 13B 很稳 |
| 16 GB(RTX 4070 Ti Super) | 13B 有余量,挤一挤能上 27B |
| 24 GB(RTX 3090/4090) | 27B,或 35B-A3B MoE |
| 48 GB+(A6000 / 双 3090) | 70B 级别 |
一张 24GB 的 4090 是多数爱好者的甜区——它能舒服跑起让 Wiki 感觉顺手的那批模型。
只有 CPU 篇
完全没有 GPU?还是能跑一个小模型——Qwen3.5-7B 在重量化下,一台现代桌面 CPU 上大约每秒 3 个 token。偶尔查一条短问题、你又有耐心,勉强够用;但摄入一整个库会让你每个文件都等上几分钟,很难受。如果 CPU 是你唯一的选择,务实的做法是先拿十条笔记试试,要是等到抓狂,就让查询留在本地、把摄入推到云端(混合方案文末细说)。CPU 上跑全本地是”因为我能”,不是”因为它好用”。
2026 年中期,值得认真考虑的几个模型
模型发布很快,与其给你一张三个月就过期的长目录,不如列出眼下真正值得下载的几个。按”你最想要什么”来挑:
- 想要一个什么都能干、样样凑合的:Qwen3.5-13B(Q5_K_M)。这是我给几乎所有人的默认建议。约 10GB 下载,16GB 机器装得下,能稳定遵循 Wiki 的结构化输出提示,不会让你跟它较劲。从它开始基本不会错。
- 想要更好的聊天与推理质量:Qwen3.5-27B,或硬件吃得下 MoE 就上 35B-A3B。这一跳是能明显感觉到的——答案更连贯、实体抽取更利落、长查询也扛得住。有了 24GB 以上内存就值得。
- 偏爱谷歌系的调性:Gemma 4。结构化输出很稳,长 prompt 下仍能守住指令,这对宽查询很重要。规格从 26B 到 31B,还有一个小到离谱、却在分类类任务上意外能打的 E4B。
- 追求前沿推理、且硬件足够豪华:DeepSeek-V3。它是这里最强的开源推理与多语模型,原生长上下文,处理 CJK 混欧语的库尤其出色。代价是重——起步就要 64GB 统一内存——所以它属于大号 Mac Studio 或正经显卡机的选择,不是笔记本的。
- 最新的选项:Qwen3.6-27B,如果你想要最新的长文档抽取质量、又不介意当早期用户。它比 3.5 实地验证得少,但在又长又多的 Wiki 页面上更强。
Wiki 的 prompt 模板对 Qwen 的输出形态测试得最充分,这是它排在推荐首位的主要原因——你撞上格式错乱的概率更低。拿不准就选 Qwen3.5-13B。
挑四台真实机器,各配一套
抽象的推荐总隔靴搔痒,来点具体的。下面是四个人、四台机器,以及每台上合理的配法。
出差顾问——MacBook Pro,M4 Pro,48GB。 一台必须全程离线干活的路上机器,余量充足。摄入用一个较强的 27B,实体抽取更准;后台 lint 用轻一点的 13B;查询用 35B-A3B MoE,用接近 3B 的运行成本换接近 27B 的答案。三个任务同时驻留内存也不打架。推理服务用 LM Studio,最容易上手。
摄入:Qwen3.5-27B-Instruct(Q4_K_M, MLX)
Lint:Qwen3.5-13B-Instruct(Q5_K_M, MLX)
查询:Qwen3.5-35B-A3B(Q4, MLX)
服务:LM Studio(端口 1234)
隐私最大化者——Mac Studio,M4 Max,128GB。 有些笔记永远不会碰网络,而这台机器的硬件足以让离线毫无牺牲感。内存这么大,可以放飞:摄入上最新的 Qwen3.6 拿长上下文,查询上 122B-A10B MoE——激活 10B 的成本,接近前沿的答案。这台建议换 oMLX 而非 LM Studio:它是 Apple Silicon 原生服务,绕过跨平台开销,能明显榨出更多吞吐。
摄入:Qwen3.6-27B(Q4_K_M, MLX),256K 上下文
Lint:Qwen3.5-13B(Q5_K_M, MLX)
查询:Qwen3.5-122B-A10B(Q4, MLX)
服务:oMLX(Apple Silicon 原生,OpenAI 兼容)
装机爱好者——Linux,RTX 4090,24GB 显存。 显存是墙,24GB 装不下 27B 和 13B 同时驻留。所以策略是按需切换:摄入和 lint 共用 13B,查询时才换上 27B(少量卸载到 CPU)。嫌切换麻烦,全程一个 13B 走天下也完全可行,只是摄入达到同样质量会慢一点。推理服务用 Ollama,最省事。
摄入:Qwen3.5-13B(Q5_K_M, GGUF)
Lint:Qwen3.5-13B(Q5_K_M, GGUF)
查询:Qwen3.5-27B(Q4_K_M, GGUF),部分 CPU 卸载
服务:Ollama
轻薄本极简主义者——MacBook Air,M2,16GB。 三个任务共用一个模型,因为只装得下这么多。7B Q4 能跑,能在一台无风扇笔记本上离线回答问题,这本身已经很了不起。但对摄入质量要现实点:你会更常遇到”实体抽错了”需要手动修的情况。它能用——只是”真能用”的下限。
摄入:Qwen3.5-7B-Instruct(Q4_K_M)
Lint:Qwen3.5-7B-Instruct(Q4_K_M)
查询:Qwen3.5-7B-Instruct(Q4_K_M)
服务:Ollama
你能拉动的最大一根杠杆:按任务分模型
上面几套配置里你会注意到,摄入、lint、查询各用不同的模型。这不是强迫症,而是插件给你的一个很划算的能力:同时跑一个又快又便宜的模型做摄入,和一个又聪明又贵的模型做查询。
道理很朴素。摄入在每条新笔记上都要跑,成本一直在花,所以吞吐比聪明更重要;lint 按计划扫全库找矛盾和死链,要敏锐、也要便宜到能后台跑;查询是你直接盯着看的那一面,所以最好的模型放这里。给每个任务配一个尺寸合适的模型,而不是用一个万能模型,是你能拉动的最大一根”每块钱质量”(也是”每瓦质量”)的杠杆。
设置不用写代码:打开 Settings → Wiki → Model Scope,从 Unified 切到 Per-Task,就会出现三个独立下拉框——摄入、lint、查询各一个。留空的会回落到默认模型。跑一次 Test Connection,插件逐个探测每个模型,任一个连不上都会提醒你,省得你摄入到一半才发现打错了字。
一句话记住:如果你的硬件只养得起一个好模型,把它给查询。 那是你感知质量的地方,摄入和 lint 可以共用一个便宜的。想深入理解它为什么这么值,见 深入解析(3):为每个任务选对模型。
上下文长度:一个常见的高估
“长上下文”是很多人选模型时最看重的数字——256K 听起来比 128K 稳当多了。但值得先量一下:插件在一次普通查询里,到底喂给模型多少上下文?
通常还不到 10K token。
原因是插件不会把整个 Wiki 一股脑塞进 prompt。它先跑一次蒙特卡洛个性化 PageRank,按相关性给页面预排序,只把最相关的几页交给模型(机制见 深入解析(6):蒙特卡洛个性化 PageRank)。在一份真实的两千多页库上实测,prompt 规模大致是这样:
| 送进模型的页数 | 典型 prompt | 重查询时(p95) |
|---|---|---|
| 前 5 页 | 约 3,800 | 约 12,000 |
| 前 10 页 | 约 6,400 | 约 20,000 |
| 前 20 页 | 约 11,000 | 约 31,000 |
结论很实在:除非你天天做”把所有跟 X 有关的都总结一遍”这种宽查询,32K 上下文就绰绰有余。 一个宣称 128K、但过了 32K 就丢连贯性的模型,对这个场景完全够用;追一个 256K 窗口在这里买不到任何东西——预排序早把重活干完了。
真正值得留意的,是模型在宽查询把 prompt 顶长时会不会”崩”。有些模型在 50K token 处还能稳稳听话,有些过了 64K 就开始丢结构。Gemma 4 是这方面守得住的代表。把注意力花在这里,而不是那个头条数字上。
量化:说人话的版本
量化就是把模型权重压缩一下,用一点质量换体积和速度。你会看到 Q4_K_M、Q5_K_M、Q8_0 这类标签,但别想太多:
- Q5 是甜区。 体积压到原来三分之一左右,质量保住大约 97%。没有特别理由,就选 Q5_K_M。
- Q4 用在装不下时。 当降一档量化能让你在同样内存里塞进明显更大的模型,就退到 Q4——大模型的 Q4 通常胜过小模型的 Q5。
- Q8 用在内存有富余时。 收益递减,但如果你机器阔绰、想确保量化没吃掉任何质量,就用 Q8,然后别再想它。
在 Apple Silicon 上还多一个格式选择:MLX 还是 GGUF? 简单说,Apple Silicon 优先 MLX——它是苹果原生格式,调用芯片的专用矩阵硬件,在 M3/M4 上比 GGUF 快 20% 到 40%,v1.25.0 起已是 Mac 的默认推荐;NVIDIA 和 CPU 用 GGUF——通用格式,llama.cpp 打底,哪儿都能跑。MLX 标签写作 4bit 和 8bit,分别约等于 Q4 和 Q6,没有 5bit,所以 Mac 上装得下时就选 8bit。多数人最后落在这套配方:摄入和 lint 用 Q5,查询用 Q4,好在同样内存里塞下更大更聪明的查询模型。
什么时候该承认本地不够用了
不必假装本地永远是对的答案。有三个信号,一旦出现,就是时候考虑走混合方案(隐私敏感的部分留本地,吃力的部分交给云端)——别把它们埋进”以后再说”:
- 摄入慢到难受——每条笔记要等好几分钟。说明模型太小或压得太狠。要么换更大的本地模型,要么借助按任务设置,把摄入这一步推到云端,其余继续离线。
- 查询在细微事实上开始乱编。 如果 PPR 明明检索对了内容,模型却还在幻觉,那是推理能力到顶了。换更大的模型,或只把最后一步答案生成卸到云端,检索仍留本地。
- 多语言质量忽高忽低。 如果你的库是 CJK 混欧语,而本地模型偏英语中心,你会在答案里明显感觉到。想留在本地就换 DeepSeek-V3 这种强多语模型,否则这是个走混合的好理由。
最常见、也最优雅的混合模式是:摄入放本地(隐私最关键的一步不出门),查询走云端(质量最被感知的一步交给最强的脑子)。 有了按任务分模型,这只是改一个下拉框的事,不用重建。
明天早上,你具体该做什么
如果你从没跑过本地模型,下面是最小可行的第一步,照着做就行:
- 装一个推理服务。 Ollama 最省事、哪儿都能跑;想要 GUI 就用 LM Studio;在 Mac 上想榨干性能就装 oMLX。
- 拉一个入门模型。
ollama pull qwen3.5:13b——约 10GB,第一次跑最值得押的一个。 - 在插件里连上它。 Settings → Wiki Configuration → Provider → Ollama,插件会自动发现本地服务器。
- 跑一次 Test Connection。 几秒内应该通过。不通就是服务没启动或端口错了,先修这个。
- 摄入一条笔记,看结果。 实体抽对了吗?生成的链接合理吗?合理就配好了——拔掉网线,享受它。抽得潦草,就是该往上换一档 27B 的信号。
记住那条经验底线:7B Q4 是”真能用”的下限,再低你会花更多时间跟模型较劲而不是用 Wiki;13B Q5 是多数人的甜区;27B Q4 会让长上下文查询的质量肉眼可见地上一个台阶。先跑起来,再谈优化——那台你以为跑不动大模型的机器,很可能比你想的能干得多。
Apple Silicon 上完全离线的 PDF 栈,见 实践指南(8):PDF 摄取;想彻底搞懂按任务分模型为什么这么值,见 深入解析(3):为每个任务选对模型。