探针 10|大模型的「参数量」,可能在骗你

大模型的「参数量」,可能在骗你
你看 AI 新闻或排行榜,动不动就看到「某某模型几百亿参数」「千亿参数」。
参数越多越强,参数量就这样成了衡量模型的硬指标。但这里有个公开的秘密:标称的参数量,可能在骗你。号称几百亿、上千亿的大模型,每次回答你问题时,真正在干活的参数,可能只有一小撮。
为什么?因为很多大模型用了一招,叫 MoE。这篇就拆它。
先说普通模型:每个参数都上阵
先讲普通模型,行话叫 dense 模型(稠密模型)。
在 dense 模型里,每个 token(探针 2 讲过,模型处理的最小单位)进来,模型的所有参数都参与计算,一个不落。你问它一句话,它把全部参数从头到尾乘一遍,才吐出下一个字。
所以 dense 模型里,参数量 = 激活量:有多少参数,每次就烧多少算力。一个 75B(750 亿)参数的 dense 模型,每生成一个字都要跑约 750 亿次计算。
简单粗暴,也结实。问题是参数一多,就推不动了——千亿参数全算一遍,慢且贵。
MoE:换个思路,像医院分诊
MoE(混合专家,Mixture of Experts)换了个思路:干嘛让所有参数都上?
用医院打个比方。你去看病,不可能所有科室的医生一拥而上都来给你看——你胃疼,去消化内科就行,其他科室该干嘛干嘛。
MoE 一模一样。模型里摆着一堆「专家」,每个专家擅长不同的活儿;token 进来,先过一个「分诊台」,分诊台判断这个 token 该送给哪几个专家,只有被选中的专家干活,其他专家休息。
这就叫稀疏激活:不是全员上阵,是按需调用。

拆开看:专家、路由器、共享专家
把 MoE 这套拆开,核心就三个零件。
专家(experts):模型把某些层(负责消化信息的那部分)换成了很多个小小的子网络,每个子网络就是一个「专家」。训练时它们会自动分化——有的偏代码、有的偏数学、有的偏中文。一个模型里往往摆着几十上百个。
路由器(router):每个 token 进来,路由器给它算一遍——这个 token 跟每个专家的匹配度多高,然后选分数最高的几个(行话叫 top-k)。比如从 256 个专家里选 8 个最相关的。
共享专家(shared expert):除了被路由器选中的,还有一个「共享专家」永远参与,像全科医生,不管什么 token 都给它兜个底,保证基础能力不掉。
举个真实的数。GLM-5.2 这个模型,就是 256 个路由专家里每 token 选 8 个,再加 1 个共享专家——257 个专家里,每次只激活 9 个,差不多 3.5%。

想看路由器怎么挑?打开 MoE 路由 · 稀疏激活演示:256 个专家网格,选一种 token,看只有 top-8 + 共享被点亮,其余 96.5% 纹丝不动。
剩下 96.5% 的专家,在你这次提问里纹丝不动。
关键来了:参数量 ≠ 激活量
讲到这,「参数量骗人」的谜底就揭开了。
一个 MoE 模型,有两个完全不同的「大小」:
- 参数量(总参数):所有专家的参数加起来,代表模型的「知识容量」——它能装多少知识。
- 激活量(每 token 实际算的):每次推理真正用到的那些专家的参数,代表「推理算力」——跑一次要花多少算力。
dense 模型里,这俩相等。但 MoE 模型里,它们天差地别:参数量很大(容量像大模型),激活量很小(算力像小模型)。
还拿 GLM-5.2 说:总参数 753B(7530 亿,容量像个超大模型),但每次推理只激活一小撮——按专家个数算约 3.5%(按参数量算也是这个量级),算力消耗像个小模型。

所以「参数量」这个指标,在 MoE 时代会骗人:
- 两个都标「几百 B」的模型,一个是 dense、一个是 MoE,实际推理算力可能差几十倍。
- 选模型、估部署成本,光看标称参数量会被带沟里——一个 753B 的 MoE,跑起来可能比一个 70B 的 dense 还便宜。
为什么浅层 dense,深层才 MoE
再补一个细节:大模型不是每一层都用 MoE。
常见做法是「前几层 dense + 其余层 MoE」(比如 GLM-5.2 是前 3 层 dense,后面才换 MoE)。为什么?
浅层处理基础特征——语法、词法、字符模式,这些几乎所有 token 都需要,而且浅层时 token 的意思还没清晰,路由器很难准确分诊,用 dense 更稳。深层处理高阶知识——推理、代码、领域专长,这时 token 意思明确了,路由器能精准选专家,用 MoE 更划算。
顺带说一句,MoE 不是哪一家原创的。DeepSeek 系列把它带进了主流(细粒度专家 + 共享专家 + 防止专家冷热不均的负载均衡),现在 GLM、Qwen 这些大模型都用。它已经是大模型的标配结构。
这根探针挖到了什么
一个「参数量怎么骗人」的疑问,底下连着这些:普通 dense 模型每个参数都上阵,参数量等于激活量;MoE 换成医院分诊式——一堆专家摆着,路由器每次只选少数几个干活,叫稀疏激活;于是参数量(知识容量)和激活量(推理算力)分家了,标称几百、上千亿的 MoE,实际激活可能只有百分之几。
这一趟,MoE、dense、专家、路由器、稀疏激活、共享专家这些词,你都摸过了。以后再看模型排行榜,除了看「几百 B 参数」,记得多问一句:这是 dense 还是 MoE?激活量多少?
下一篇,换个反直觉的:为什么有的 AI 会「想」很久才回答,而且想得越久、答得越对?下回聊。