给小白的本地模型避坑指南:别折腾了,先算账
本地模型热潮来袭,但你真的需要吗?本文从硬件配置、模型选择到软件实操,手把手教你算清成本账。显存决定一切,先跑通再买设备才是省钱王道。看完这篇,你就能判断本地模型是“真香”还是“智商税”。

最近全网都在聊“本地模型”,教程满天飞。作为一个做 AI 产品的,我换个角度给小白算笔账。不讲虚的,只讲三件事:怎么选模型、怎么算硬件、怎么配软件。看完这篇,你大概知道自己电脑能跑什么,该花多少钱,以及本地模型到底值不值得折腾。
一、先泼盆冷水:本地模型大概率不如云端
别被“本地”两个字骗了。
云端模型跑在机房里几千张专业显卡上,本地模型跑在你自己的电脑里。云端是庞然大物,本地是“缩小版”。缩小版能干什么?日常问答、翻译、总结、改写文案、简单代码。复杂推理、长篇深度写作、高难度编程,该用云端还得用云端。
成本算账:云端模型很便宜,本地模型要买硬件(英伟达显卡或 Mac),Token 成本远高于云端。
结论:本地模型是“备胎”,不是“正选”。大部分场景,云端模型是首选。
二、那为什么还有人折腾本地?
既然性能不如云端,成本还高,为什么还有人折腾?
主要是四个理由:
- 隐私:敏感数据不出本地,G 端、医疗、法律场景最刚需。
- 离线:没网也能用,出差、野外、断网环境不慌。
- 特殊玩法(无审查):云端模型有护栏,什么不让跑就是不让跑。本地模型文件在你手里,去护栏的版本可以跑一些“大家心知肚明”的东西(比如跑点“少儿不宜”的小说,或者生成一些云端不让过的图)。当然,法律红线不因为模型没护栏就消失。
- 可控:没有云端护栏的随时拦截,想怎么问怎么问。
三、硬件怎么配?(钱怎么花)
跑模型,CPU 快慢、硬盘大小都是次要的。决定性数字有三个:显存、带宽、系统内存。
显存(VRAM):决定模型多大能塞进去。Mac 统一内存,48G 约等于 33G 显存。
带宽:决定模型跑得多快(token/s)。显存大小决定容量,带宽决定速度。
系统内存(RAM):如果显存不够,模型会溢出到系统内存里。这时候你的 48G Mac 如果只剩 16G 可用内存,跑起来也会卡成 PPT。
算账公式:(可用显存 – 3GB) ÷ 0.6 = 你能跑的最大参数量(Q4 量化)。注:这个 -3GB 是为了给系统预留空间,0.6 是 Q4 量化下的体积系数,仅供参考。
举个例子:48G Mac:(33.6 – 3) ÷ 0.6 ≈ 51B。这个档位,翻译、总结、写方案、简单代码,体面。16G 电脑:(11 – 3) ÷ 0.6 ≈ 13B。日常问答、翻译、写周报够用。8G 电脑:(8 – 5) ÷ 0.6 ≈ 5B。能跑,但别嫌寒酸,足够体面。
一条铁律:同样的显存,装一个压缩过的大模型,胜过装一个不压缩的小模型。14B 压到 Q4 掉的那点智力,远远小于 7B 和 14B 之间的智力差距。先挑显存装得下的最大参数量,再用 Q4_K_M 压。顺序不能倒。
忠告:算完档位,有人一看只能跑 8B,觉得寒酸想先买机器。停一下。顺序反了。先用现有电脑跑通一个小模型,用上两个星期,确认自己真的会用、真的常用,再考虑掏钱。先买设备再培养习惯,是 99% 小白浪费钱的开始。
四、模型怎么挑?(名字怎么看)
打开模型下载页,你会看到一串名字:Qwen3-30B-A3B-Instruct 或 DeepSeek-R1-Distill-Qwen-14B。看着像乱码,其实是一套命名公式。
B(十亿):脑细胞数量。7B = 70 亿参数,30B = 300 亿参数。脑细胞越多,能记住的知识越多,但也越占地方。参数量决定了模型智力上限,也决定了你的电脑装不装得下。
后缀:Base(半成品,不选)、Instruct/Chat(成品,选这个)、Distill(蒸馏版,推理强,选这个)。
MoE(AxB):混合专家模型。30B-A3B 意思是专家团一共 300 亿参数,每次干活只动用 30 亿。性价比高。
选型原则(怎么考它)
别迷信综合排名,要看你的具体需求:
中文场景:无脑选 Qwen 系,中文能力在同尺寸里是最强的一档。
代码场景:找名字带 Coder 的。
推理场景:找带 R1、Thinking 的。
不知道选哪个,就选Q4_K_M。这是整个社区公认的甜点档位,质量和体积的最佳平衡。
五、去哪里下模型?(实操干货)
这是小白最头疼的问题。别去那些乱七八糟的论坛找,掌握这三个渠道就够了:
Hugging Face(全球最大):全球最大的开源模型社区。这里什么都有,从几亿参数的玩具到几百亿参数的巨兽。缺点是下载速度对国内用户不太友好,需要科学上网或者用代理。
ModelScope(魔搭社区):国内版 Hugging Face,由阿里牵头。优点是下载速度快,不用梯子,而且很多国内模型(如通义千问、Llama 中文版)都在这里。小白首选。
LM Studio 商店:如果你装了 LM Studio(后面会讲),它内置了一个商店。它会直接根据你的电脑显存,告诉你“这个模型你能不能跑”。这是最傻瓜、最不容易出错的方式。
六、软件与实操
LM Studio vs Ollama
两个软件干的是同一件事,底层引擎一样,速度没区别。
小白从 LM Studio 起步,图形界面,内置商店会提示你能不能跑。
Ollama更适合极客,通过命令行操作,方便把模型接进其他开发环境。
两个软件可以共存,互不干扰,按需选择即可。
七、玩出花(生图/视频)
本地不光能跑聊天模型,还能生成图片和视频。这是另一个世界,模型、软件、规矩全换了一套,但规矩还是那一条:显存决定一切。
生图模型分三档:文生图主流就三个系列,对应三个显存档位。显存够到哪档跑哪档。软件用ComfyUI,界面是“节点式”的,一个个方块用线连起来,像电路图。新手不用自己连,装好后加载别人做好的工作流文件,点一下运行就出图。生图对显卡挑剔远超文本模型,英伟达什么都能跑,Mac 能跑但慢,AMD 最折腾。
生视频:这现在是 AI 领域的“圣杯”,也是最大的坑。
开源界:阿里的 Wan 系列、腾讯的混元系列、智谱的 CogVideoX、以及 Stable Video Diffusion (SVD)。
闭源界:OpenAI 的 Sora、Runway 的 Gen-3/Gen-4、Pika 等。
现状:离好用还有距离。24GB 顶级显卡,生成 5 秒 720p 视频,要算大约 9 分钟。而且生视频是抽卡游戏,动作崩了、画面闪了重抽。抽五次才出一条能看的,就是 45 分钟换 5 秒钟。云端视频服务一两分钟出片。本地生视频目前的意义在尝鲜和学习,谈生产力还早。满足三条再入坑:24GB 以上英伟达显卡、玩熟了 ComfyUI、对着显卡吭哧吭哧算视频这件事本身让你感到快乐。差一条,都建议再等等。
八、总结
别先买设备再培养习惯。
除非特殊需求(隐私、离线、无审查),否则不建议花大价钱买机器跑本地。
大部分场景,云端模型是首选。
本文由 @产品不正经 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




