智谱创始人谈 GLM-5.3:扩展定律不止参数规模,后训练成为关键变量
深潮TechFlow|2026年08月19日 11:33
8 月 19 日,智谱创始人唐杰发文表示,大模型扩展不应只关注参数数量,还需同时考虑数据规模、计算资源分配、推理成本与实际运行条件。文章回顾了从 Kaplan 扩展定律到 Chinchilla 计算最优理论的变化,指出早期“参数增长快于数据增长”的路线曾导致部分超大模型资源错配,而后续研究表明模型参数与训练数据应更均衡增长。文章进一步指出,随着模型被高频调用,推理成本已成为模型生命周期成本的核心,最优策略正转向更小模型与更长训练;同时,在专家混合模型中,总参数更多影响知识容量,激活参数与有效深度更影响推理能力,单一“每参数对应训练词元数”比例已不再适用。针对 GLM-5.3,该文称其与 GLM-5.2 使用相同基础模型、架构、总参数和激活参数,通过一个月扩展长程环境与强化学习进行后训练,取得显著提升。文章认为,参数规模、预训练数据、前向计算和后训练都是可独立调节的扩展变量,本次实验表明后训练仍有较大提升空间,扩展仍未结束。(深潮 TechFlow)
分享至:
熱門快訊
APP下載
X
Telegram
複製鏈接