为什么开源模型都是 · 7B、9B、27B、32B?
本地部署模型时,你是否好奇过为什么参数总是7B、9B、27B、32B?这些数字并非随意,而是由显存限制、架构计算和行业默契共同决定的。本文带你拆解参数背后的三层逻辑,看懂开源模型的尺寸密码。

昨晚在本地部署模型,页面上一排名字:7B、9B、27B、32B……
我忽然愣住:为什么都是这些数字?
不是 6B,不是 10B,不是 25B,偏偏是 7、9、27、32。像是大家约好了一样。
01 显存划的线
第一个冒出来的念头:显存。
本地跑模型,最绕不开的就是显卡。8G、12G、16G、24G,市面上消费级显卡基本就这几档,而模型参数是要占显存的。1B 参数,FP16 精度大约 2GB;量化到 4bit,大约 0.5GB。
算一下大概就有感觉了:7B 量化后约 4GB,8G 卡能跑;9B 约 6GB,8G 卡也能跑;27B 量化完 17GB 上下,24G 卡能跑;32B 量化完 20GB 以上,就得 24G 起步、32G 才舒服。
我想着想着,哦,好像想通了——显存划了上限。但感觉还有地方不太对:能跑的区间这么宽,7B、8B、9B、10B 都能塞进 8G 卡,就算锁死在 24G 卡这条线上,26B、28B 也能塞进去,为什么偏偏是 7、9、27、32 这些数?

02 数字是算出来的
因为参数量不是拍脑袋定的,是算出来的。模型的“大脑”由很多层组成,每层有一定数量的神经元,这些数乘起来就是参数量。你调一调层数、调一调神经元数,出来的可能是 26.9B 这种数,对外取个整——27B。它是工程结果。

03 锚点与错开半格
可要是这样,又冒出个新问题:大家怎么都差不多大,但又不太一样?Llama 是 7B、13B、70B,千问换成了 9B、27B、35B,DeepSeek 又用 8B、14B、32B。同样是开源模型,为什么数字不统一?
差不多大,好理解——硬件是全世界统一的,大家都往“能塞进 24G 卡”这个甜点区挤,尺寸自然趋同。
不太一样,就有点意思了。
Meta 的 Llama 最早把 7B、13B、70B 做成了“经典锚点”,整个生态——量化工具、推理框架、教程、云厂商——都围着它转。后来者要么贴锚点(DeepSeek 用 8B/14B/32B,跟 Llama 3.1 的 8B 挨着),要么故意错开半格(千问 Qwen3.5 用 9B/27B/35B)。
错开半格有什么好处?既蹭了“接近经典尺寸”的生态便利,又显得“我是新一代,跟旧的不一样”。9B 听起来就比 8B 新,虽然只差 1 个 B。连 Google 的 Gemma 2 也早就在用 9B/27B——大家心照不宣地在“贴锚点”和“换新数字”之间找自己的位置。

所以现在回头看开头那个问题——为什么都是这些数字?答案就三层:
显卡划上线,架构算具体数字,行业默契定位置。你看到的 7B、9B、27B、32B,就是这么来的。
我是 产品不正经,AI产品经理,正经聊AI,也顺便聊点生活。
本文由 @产品不正经 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




