智谱唐杰谈 Scaling Law:GLM 5.3 参数没变,靠一个月强化学习继续“暴力 Scaling”

  • 2026-08-22

2026 年 8 月 19 日,智谱 AI 创始人、清华大学教授唐杰长文,谈及大模型 Scaling Law 的变化,并首次披露 GLM-5.3 背后的一个关键细节, GLM-5.3 与 GLM-5.2 使用相同的基础模型、相同架构,总参数量和激活参数量均没有变化,主要通过约一个月的长周期环境训练和强化学习(RL)获得能力提升。 原文翻译: 关于 Scaling Law 的一些思考 Scaling,但不只是扩大参数量。 如今,每次模型发布之后,大家都会问同一个问题:有多少参数? 但这个问题不能单独回答。 参数量只有和另外三个因素放在一起才有意义: 你有多少训练数据、准备将算力花在哪里,以及最终由谁、在什么条件下运行这个模型。 这个领域曾经为此交过学费。 Kaplan 等人在 2020 年提出的 Scaling Law 认为,相比数据量,模型参数应该增长得更快,两者大约按 2.7:1 的比例扩展。整个行业随后基本沿着这一方向前进,GPT-3、Gopher、MT-NLG 等大模型相继出现。 但 Hoffmann 等人在 2022 年重新进行了实验,测试了约 400 个模型,最终发现: 在计算量最优的情况下,更合理的比例接近每个参数对应 20 个 Token;而且当算力不断增加时,参数量和训练数据量应该以大致相同的速度增长,而不是逐渐拉开差距。 早期拟合中的误差,会随着计算规模每增加一个数量级而不断被放大。这也解释了为什么当时规模最大的模型,反而存在最严重的资源配置失衡。 回头来看,当年的“万亿参数竞赛”更像是整个行业共同走过的一段弯路,后来大家又一起掉头。 但 Chinchilla 也不是 Scaling Law 的终点。 Chinchilla 优化的是模型训练阶段的算力分配,默认模型训练一次,然后进行评测。但今天,一个模型每天可能被调用数十亿次,整个生命周期中,推理成本已经占据主导地位。 如果将推理成本也加入优化目标,最优方案就会转向: 模型做得更小,但训练时间更长,也就是有意进行“过度训练”。 Llama-2-7B 和 Gemma-2-9B 就已经在这么做,它们每个参数对应的训练 Token 数分别大约达到 290 和 889。 稀疏模型的出现,又一次改变了这个问题。 对于 MoE 模型,需要明确区分两个指标。 总参数量大致决定模型能够“装下多少东西”,包括知识、事实以及大量长尾信息;而实际激活的参数量和有效计算深度,则大致决定模型“能够想多远”,也就是能够连续完成多少步因果推理,而不会在中途丢失逻辑链条。 因此,稠密模型中常说的 20:1 Token/参数比例,并不能直接套用到 MoE 模型上。 事实上,这个比例本身也不存在一个统一答案。 Roberts 等人在 2025 年的研究发现,最优 Token/参数比例与具体任务有关:记忆型任务更偏向增加参数,而推理型任务更偏向增加训练数据。 后续针对 MoE 的研究也观察到,在固定 TPP(Tokens Per Parameter,每参数 Token 数)的情况下,一味增加总参数量,反而可能降低推理能力;相比之下,增加实际激活的专家数量,则能够更稳定地提升推理表现。 这与我们正在构建的模型方向直接相关。 发现一个漏洞,并不是一个信息检索问题。 它并不是因为模型记住了更多 CVE 漏洞编号,而是因为模型能够完整走完一条长达 20 步的推理链,并且在整个过程中始终保持逻辑连续,不丢失关键线索。 这种能力并不存在于“总参数量”本身。 这也就引出了这次 GLM-5.3 的发布。 总参数量似乎只在达到某个门槛之前非常重要 —— 模型首先需要足够大的容量,能够“装下这个世界”。 一旦超过这一门槛,进一步提升能力,就需要从其他地方寻找 Scaling 空间: 例如增加单次前向计算的有效深度,以及更重要的,扩大后训练规模。 GLM-5.3,就是我们针对这一判断进行的一次受控实验。 它与 GLM-5.2 使用完全相同的基础模型、相同的架构,总参数量和激活参数量也完全相同。 我们只做了一件事:用一个月时间,持续扩大长周期任务环境以及强化学习(RL)训练规模。 最终取得的提升并不是微不足道的。 所以,Scaling 从来不只有一个旋钮。 这一次,我们选择拧动“后训练”这个旋钮,是因为它还有最大的提升空间,而不是因为其他方向已经走到尽头。 基础模型规模、预训练数据量,以及每次前向计算投入的算力,都仍然存在继续扩展的空间,我们之后还会重新回到这些方向。 这次实验真正告诉我们的是:这些 Scaling 的旋钮并不需要同时转动。 而且,下一步最值得扩展的方向,往往并不是上一次最值得扩展的那个方向。 我们的 Scaling 还没有结束。 下一次,也许会轮到中期训练、预训练,甚至更多。 云头条

about image