本地部署大模型的意义

Tags: Notes
Published:2026-07-23 23:31

我看到不少人很好奇,本地部署大模型到底有什么意义。

他们说光买显卡都要不少钱,用这钱买 API Credits 能用很久;他们说本地模型速度慢、并发低、上下文也不能长,模型不能大、量化还要狠。

他们不认可「隐私问题」的说法,认为个人数据泄露给模型厂也不会有什么问题,也相信 OpenAI 和 Anthropic 这样的公司作出的「不拿用户数据进行训练」的承诺。即便是公司的合规需求,他们也认为可以和模型供应商去谈,比如美国官方和 Anthropic 的合作。

他们最终得出结论:除了自己折腾一下,或者搞研究,真的没有任何意义。

然而真的是这样吗?

模型的能力强弱是主观的

除了确定性任务,比如编程,你很难衡量模型的输出到底质量如何。即便是在编程领域,已经有这么多各式各样的榜单了,在实际使用当中,也依然有人不断在质疑某某模型是针对某些榜单做了特应性训练,而真实使用场景中其实效果并不好。

更不必说非确定性的使用场景了,比如当作聊天机器人,帮你分析问题、心理咨询、学习知识、情感陪伴、角色扮演……

不少人都还记得当年 OpenAI 在他们的 ChatGPT 里面用 GPT-5 系列全面取代 GPT-4o 的时候,大量用户表达了抗议和不满。相比于更先进的 GPT-5,他们更愿意使用 GPT-4o。

如果你在 2023年、2024年甚至 2025年,月付过20美元就为了在 ChatGPT 中使用 GPT-4 和 GPT-5 系列模型的话,你真的能感觉到 GPT-5, GPT-5.4,GPT-5.5 和现在 GPT-5.6 Sol 的区别吗?如果当年的 GPT-4o 就能满足你的需求,那是不是比它更先进的 GPT-5.6 Sol 其实需要在和你的交互中抑制自己的智能水平,才能让你觉得亲切和好用呢?

当然,这些模型的迭代,很可能增强的是特定任务和特定场景下的能力(比如 Agentic Coding),而不是和人类交互的能力。这方面甚至有可能是退化的。

这种主观感受是可以客观衡量的

LMArena(原名 Chatbot Arena,也常被称为 LMSYS Chatbot Arena)是一个极具权威性的开放式 AI 模型评估与对比平台。该项目最初由美国加州大学伯克利分校(UC Berkeley)的研究团队创立,现已发展为业界公认的大语言模型(LLM)「体感排行榜」。

它采用了盲测的形式(双盲对比):用户在平台上输入任意提示词(Prompt)后,系统会调用两个匿名的 AI 模型给出回答(例如 Model A 和 Model B)。用户在不知道模型身份的情况下,根据哪个回答更好进行投票,投完票后系统才会揭晓两个模型的真实名字。

最后的排行也是动态的。平台通过收集数千万次真实用户的盲测投票,利用类似国际象棋的 Elo 评分系统(Bradley-Terry 模型)计算出各个模型的实时胜率和排名。这被视为衡量各大模型真实使用体验的最直观标准之一。

并且它没有门槛,任何人都可以直接访问官方网站(LMArena 或国内镜像站等)免费体验市面上最顶级的模型并进行对比。

2026年7月22日,我摘出一些流行的模型和排名如下:

排名 排名区间 模型 得分 投票次数
50 38-59 claude-sonnet-4-5-20250929 1455 \pm 3 80,720
52 38-71 gemma-4-31b 1451 \pm 8 5,880
57 43-70 gpt-5.3-chat-latest 1449 \pm 4 32,980
66 53-75 gpt-4o-latest-20250326 1443 \pm 3 82,395
70 59-84 deepseek-v4-flash-thinking 1439 \pm 4 44,822
71 62-84 gpt-5.1 1439 \pm 4 43,391
72 53-92 gemma-4-26b-a4b 1438 \pm 8 5,798
76 63-90 deepseek-v4-flash 1436 \pm 4 45,050
92 81-110 deepseek-v3.2 1425 \pm 4 47,206

从这个表格不难看出,当两份来自 AI 的答复摆在一个人类的面前,31B 甚至 26B 级别的模型,也能凭实力让人类偏爱。

这份具体的榜单和具体的排名不重要,重要的是它背后的意义:模型的能力强弱,很多时候是主观的。

我去上班不需要开法拉利

必须承认,从 2017年 Google 搞出 Transformer 架构和注意力机制,到 GPT 打败 BERT,再到 2022年 GPT-3.5 以 ChatGPT 的身份横空出世、引爆这一轮的 AI 狂潮,再到 2025年 DeepSeek-R1 用开源的方式展现了和 ChatGPT 一样的可以推理的模型,并在年底用 DeepSeek-V3.2 引领了国内模型的热度,再到2026年各个前沿模型层出不穷,Fable 5,GPT-5.6 Sol,DeepSeek V4 和 Kimi K3,GLM 5.2 等等,模型的能力到底是进步了许多许多。

特别是 Agentic Coding, 和小龙虾那样的通用助理,这两个使用场景更是从无到有,再到潮流。

但是这是不是意味着我所有的需求都必须用 GLM 5.2,必须用 Kimi K3?我所有的编程需求都要求助于 Fable 5 和 GPT-5.6 Sol ?

不是的。当我在 GitHub Copilot 里面将模型选择设置为「自动」,我能看到我的需求大量流向了 GPT-5 mini,少量流向了 GPT-5.3-codex,更少量流向了 GPT-5.4。而我如果不刻意去看,根本不会注意到我的需求究竟是被哪个模型解决了。

这还是确定性非常强(对就是对,错就是错,答案是客观的)的编程使用场景。

在更通用的聊天场景中呢?我当年愿意花20美元来和 GPT-4o 聊天,后来依然花 20美元,但是和我聊天的对象换成了 GPT-5,是因为我的问题必须由更强的 GPT-5 才能解答吗?不,这仅仅是因为 ChatGPT 不再提供 GPT-4o 给我了。我的认知水平和知识储备虽然也在增长,但我敢说绝对没有这些模型进步得多、进步得快。

当我和 gemma-4-31b-it 这样的开源模型,也是可以轻易在消费级硬件上部署的模型聊天的时候,我能感觉到我的需求就到这里了。我可能还会有需要更强大的模型的时候,比如 Agentic Coding,但另一些我当年要花 20美元的需求,现在不需要了。

是的,现在的 GPT-5.6 Sol 就像那辆让人目眩神迷的法拉利。但是我就是去上个班而已,我不需要法拉利。

说回 Agentic Coding。如果一些可以用 Skill 的形式来复现的复杂操作也要每次都花钱去找强大模型的 API 来解决,你不会觉得亏吗?按照写清楚的操作步骤去执行,这种程度的智能,完全可以交给本地模型来做。简单的事情完全交给本地模型,复杂的事情让强大的云端模型去做,做好了给我写一份 Skill,下次我就不需要了。

再说,真正困难的事情,我依然可以去用 GPT-5.6 Sol,去用 GLM 5.2,去用 Kimi K3。我只是拥有了不必付费、不必联网、随叫随到的选择。

再说回开头提到的隐私。也许很多人觉得把聊天记录交给大厂无所谓,但当涉及到我个人的财务账单、真实生活场景中的心理分析,或者是我并不打算开源的核心代码时,我不希望任何「承诺不用于训练」的协议成为我唯一的护城河。如果智能够用,那能拥有它的时候,我为什么要租赁?

这是一种兴趣和爱好

除了「折腾」和「研究」,在消费级硬件上部署大模型也是一种兴趣和爱好。

当ChatGPT 和 DeepSeek 第一次引起国外和国内的 AI 狂潮的时候,这样的智能只会在算力农场中出现,普通人遥不可及。哪怕是研究机构、大学研究生院,也不再像之前那个时代一样,少量投资就能接触前沿科技。大语言模型的训练所需要的海量数据和更海量的算力,在 Nvidia 显卡对华限售的当下,足以成为一道难以跨越的门槛。

但事情变了。

2023年 Georgi Gerganov 看到 Meta 发布的 llama-65B 就有了「这玩意儿完全能在 Macbook 上跑起来」的想法,也正是这个想法,让我们现在有了 llama.cpp,和它衍生出的庞大社区,以及图形化软件 LM Studio。

我是在今年 Gemma-4 发布的时候才接触到本地模型的。我是震惊的。媲美当年 GPT-4o 的智能,跑在我自己的个人设备上?这才几年?我是在做梦吗?

当然不是,亲自体验之后就知道,这正是当今「科技平权」给普通人带来的红利。

你甚至不需要太昂贵的设备。5年前的 M1 Max Macbook Pro,你为了打游戏买的 3090显卡,或者更贵更先进的 5090显卡,完全可以用来跑这个规模的模型。更不必说社区里还有像 antirez (Redis 的作者)这样的大佬,让你能在自己的电脑里面跑起来 DeepSeek V4,甚至 GLM 5.2。

量化一定损伤智力吗?或者说,你的使用场景,真的对「量化」带来的那点损失敏感吗?你不试试怎么知道呢?

上下文一定短吗?要知道,2026年4月,DeepSeek V4 发布之前,它的前任,DeepSeek V3.2 也仅仅支持 128K 的上下文。而这个长度,在我上面提到的消费级硬件上部署,并不是异想天开、遥不可及。甚至单卡开满 256K 上下文的也大有人在。

而且你真的需要 128K 上下文吗?Agentic Coding 是消耗上下文最多的使用场景,但是 K-V Cache 可以在 SSD 里面做持久化。缓存命中率往往在 60% ~ 95% 之间,每一轮对话新增的上下文极少超过 65K。聊天就更不必说了,你能聊到 20K 就已经很牛逼了。算上长文的阅读理解,反复讨论,65K 也是绰绰有余。

我为什么知道?因为这真的是一种兴趣和爱好。常见的、流行的模型,我如数家珍。为了平衡体积和智力,我对不同的量化算法也颇有涉猎(这和当年接触 LeetCode 学习那些算法没什么区别)。欢迎移步消费级硬件本地部署 AI 模型指南查看更多。

这些知识和经验是真实的,也让我更能把握前沿模型的能力和宣传。就像我说的,我上班不需要开法拉利,但开着我的比亚迪,能让我更了解法拉利有多好。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注