我看到不少人很好奇,本地部署大模型到底有什么意义。
他们说光买显卡都要不少钱,用这钱买 API Credits 能用很久;他们说本地模型速度慢、并发低、上下文也不能长,模型不能大、量化还要狠。
他们不认可「隐私问题」的说法,认为个人数据泄露给模型厂也不会有什么问题,也相信 OpenAI 和 Anthropic 这样的公司作出的「不拿用户数据进行训练」的承诺。即便是公司的合规需求,他们也认为可以和模型供应商去谈,比如美国官方和 Anthropic 的合作。
他们最终得出结论:除了自己折腾一下,或者搞研究,真的没有任何意义。
然而真的是这样吗?
模型的能力强弱是主观的
除了确定性任务,比如编程,你很难衡量模型的输出到底质量如何。即便是在编程领域,已经有这么多各式各样的榜单了,在实际使用当中,也依然有人不断在质疑某某模型是针对某些榜单做了特应性训练,而真实使用场景中其实效果并不好。
更不必说非确定性的使用场景了,比如当作聊天机器人,帮你分析问题、心理咨询、学习知识、情感陪伴、角色扮演……
不少人都还记得当年 OpenAI 在他们的 ChatGPT 里面用 GPT-5 系列全面取代 GPT-4o 的时候,大量用户表达了抗议和不满。相比于更先进的 GPT-5,他们更愿意使用 GPT-4o。
如果你在 2023年、2024年甚至 2025年,月付过20美元就为了在 ChatGPT 中使用 GPT-4 和 GPT-5 系列模型的话,你真的能感觉到 GPT-5, GPT-5.4,GPT-5.5 和现在 GPT-5.6 Sol 的区别吗?如果当年的 GPT-4o 就能满足你的需求,那是不是比它更先进的 GPT-5.6 Sol 其实需要在和你的交互中抑制自己的智能水平,才能让你觉得亲切和好用呢?
当然,这些模型的迭代,很可能增强的是特定任务和特定场景下的能力(比如 Agentic Coding),而不是和人类交互的能力。这方面甚至有可能是退化的。
这种主观感受是可以客观衡量的
LMArena(原名 Chatbot Arena,也常被称为 LMSYS Chatbot Arena)是一个极具权威性的开放式 AI 模型评估与对比平台。该项目最初由美国加州大学伯克利分校(UC Berkeley)的研究团队创立,现已发展为业界公认的大语言模型(LLM)「体感排行榜」。
它采用了盲测的形式(双盲对比):用户在平台上输入任意提示词(Prompt)后,系统会调用两个匿名的 AI 模型给出回答(例如 Model A 和 Model B)。用户在不知道模型身份的情况下,根据哪个回答更好进行投票,投完票后系统才会揭晓两个模型的真实名字。
最后的排行也是动态的。平台通过收集数千万次真实用户的盲测投票,利用类似国际象棋的 Elo 评分系统(Bradley-Terry 模型)计算出各个模型的实时胜率和排名。这被视为衡量各大模型真实使用体验的最直观标准之一。
并且它没有门槛,任何人都可以直接访问官方网站(LMArena 或国内镜像站等)免费体验市面上最顶级的模型并进行对比。
2026年7月22日,我摘出一些流行的模型和排名如下:
| 排名 | 排名区间 | 模型 | 得分 | 投票次数 |
|---|---|---|---|---|
| 50 | 38-59 | claude-sonnet-4-5-20250929 | 1455 \pm 3 | 80,720 |
| 52 | 38-71 | gemma-4-31b | 1451 \pm 8 | 5,880 |
| 57 | 43-70 | gpt-5.3-chat-latest | 1449 \pm 4 | 32,980 |
| 66 | 53-75 | gpt-4o-latest-20250326 | 1443 \pm 3 | 82,395 |
| 70 | 59-84 | deepseek-v4-flash-thinking | 1439 \pm 4 | 44,822 |
| 71 | 62-84 | gpt-5.1 | 1439 \pm 4 | 43,391 |
| 72 | 53-92 | gemma-4-26b-a4b | 1438 \pm 8 | 5,798 |
| 76 | 63-90 | deepseek-v4-flash | 1436 \pm 4 | 45,050 |
| 92 | 81-110 | deepseek-v3.2 | 1425 \pm 4 | 47,206 |
从这个表格不难看出,当两份来自 AI 的答复摆在一个人类的面前,31B 甚至 26B 级别的模型,也能凭实力让人类偏爱。
这份具体的榜单和具体的排名不重要,重要的是它背后的意义:模型的能力强弱,很多时候是主观的。
我去上班不需要开法拉利
必须承认,从 2017年 Google 搞出 Transformer 架构和注意力机制,到 GPT 打败 BERT,再到 2022年 GPT-3.5 以 ChatGPT 的身份横空出世、引爆这一轮的 AI 狂潮,再到 2025年 DeepSeek-R1 用开源的方式展现了和 ChatGPT 一样的可以推理的模型,并在年底用 DeepSeek-V3.2 引领了国内模型的热度,再到2026年各个前沿模型层出不穷,Fable 5,GPT-5.6 Sol,DeepSeek V4 和 Kimi K3,GLM 5.2 等等,模型的能力到底是进步了许多许多。
特别是 Agentic Coding, 和小龙虾那样的通用助理,这两个使用场景更是从无到有,再到潮流。
但是这是不是意味着我所有的需求都必须用 GLM 5.2,必须用 Kimi K3?我所有的编程需求都要求助于 Fable 5 和 GPT-5.6 Sol ?
不是的。当我在 GitHub Copilot 里面将模型选择设置为「自动」,我能看到我的需求大量流向了 GPT-5 mini,少量流向了 GPT-5.3-codex,更少量流向了 GPT-5.4。而我如果不刻意去看,根本不会注意到我的需求究竟是被哪个模型解决了。
这还是确定性非常强(对就是对,错就是错,答案是客观的)的编程使用场景。
在更通用的聊天场景中呢?我当年愿意花20美元来和 GPT-4o 聊天,后来依然花 20美元,但是和我聊天的对象换成了 GPT-5,是因为我的问题必须由更强的 GPT-5 才能解答吗?不,这仅仅是因为 ChatGPT 不再提供 GPT-4o 给我了。我的认知水平和知识储备虽然也在增长,但我敢说绝对没有这些模型进步得多、进步得快。
当我和 gemma-4-31b-it 这样的开源模型,也是可以轻易在消费级硬件上部署的模型聊天的时候,我能感觉到我的需求就到这里了。我可能还会有需要更强大的模型的时候,比如 Agentic Coding,但另一些我当年要花 20美元的需求,现在不需要了。
是的,现在的 GPT-5.6 Sol 就像那辆让人目眩神迷的法拉利。但是我就是去上个班而已,我不需要法拉利。
说回 Agentic Coding。如果一些可以用 Skill 的形式来复现的复杂操作也要每次都花钱去找强大模型的 API 来解决,你不会觉得亏吗?按照写清楚的操作步骤去执行,这种程度的智能,完全可以交给本地模型来做。简单的事情完全交给本地模型,复杂的事情让强大的云端模型去做,做好了给我写一份 Skill,下次我就不需要了。
再说,真正困难的事情,我依然可以去用 GPT-5.6 Sol,去用 GLM 5.2,去用 Kimi K3。我只是拥有了不必付费、不必联网、随叫随到的选择。
再说回开头提到的隐私。也许很多人觉得把聊天记录交给大厂无所谓,但当涉及到我个人的财务账单、真实生活场景中的心理分析,或者是我并不打算开源的核心代码时,我不希望任何「承诺不用于训练」的协议成为我唯一的护城河。如果智能够用,那能拥有它的时候,我为什么要租赁?
这是一种兴趣和爱好
除了「折腾」和「研究」,在消费级硬件上部署大模型也是一种兴趣和爱好。
当ChatGPT 和 DeepSeek 第一次引起国外和国内的 AI 狂潮的时候,这样的智能只会在算力农场中出现,普通人遥不可及。哪怕是研究机构、大学研究生院,也不再像之前那个时代一样,少量投资就能接触前沿科技。大语言模型的训练所需要的海量数据和更海量的算力,在 Nvidia 显卡对华限售的当下,足以成为一道难以跨越的门槛。
但事情变了。
2023年 Georgi Gerganov 看到 Meta 发布的 llama-65B 就有了「这玩意儿完全能在 Macbook 上跑起来」的想法,也正是这个想法,让我们现在有了 llama.cpp,和它衍生出的庞大社区,以及图形化软件 LM Studio。
我是在今年 Gemma-4 发布的时候才接触到本地模型的。我是震惊的。媲美当年 GPT-4o 的智能,跑在我自己的个人设备上?这才几年?我是在做梦吗?
当然不是,亲自体验之后就知道,这正是当今「科技平权」给普通人带来的红利。
你甚至不需要太昂贵的设备。5年前的 M1 Max Macbook Pro,你为了打游戏买的 3090显卡,或者更贵更先进的 5090显卡,完全可以用来跑这个规模的模型。更不必说社区里还有像 antirez (Redis 的作者)这样的大佬,让你能在自己的电脑里面跑起来 DeepSeek V4,甚至 GLM 5.2。
量化一定损伤智力吗?或者说,你的使用场景,真的对「量化」带来的那点损失敏感吗?你不试试怎么知道呢?
上下文一定短吗?要知道,2026年4月,DeepSeek V4 发布之前,它的前任,DeepSeek V3.2 也仅仅支持 128K 的上下文。而这个长度,在我上面提到的消费级硬件上部署,并不是异想天开、遥不可及。甚至单卡开满 256K 上下文的也大有人在。
而且你真的需要 128K 上下文吗?Agentic Coding 是消耗上下文最多的使用场景,但是 K-V Cache 可以在 SSD 里面做持久化。缓存命中率往往在 60% ~ 95% 之间,每一轮对话新增的上下文极少超过 65K。聊天就更不必说了,你能聊到 20K 就已经很牛逼了。算上长文的阅读理解,反复讨论,65K 也是绰绰有余。
我为什么知道?因为这真的是一种兴趣和爱好。常见的、流行的模型,我如数家珍。为了平衡体积和智力,我对不同的量化算法也颇有涉猎(这和当年接触 LeetCode 学习那些算法没什么区别)。欢迎移步消费级硬件本地部署 AI 模型指南查看更多。
这些知识和经验是真实的,也让我更能把握前沿模型的能力和宣传。就像我说的,我上班不需要开法拉利,但开着我的比亚迪,能让我更了解法拉利有多好。