Kimi K3凭什么追近Fable 5?月之暗面同时重写注意力、残差和MoE
律动BlockBeats|2026年07月27日 16:21
月之暗面公布 Kimi K3 技术报告。K3 拥有 2.8 万亿总参数,每个 Token 激活 1040 亿参数,底座架构较 K2 全面换代。参数变大只是其中一部分。月之暗面称,新架构、数据和训练方法让 K3 的整体扩展效率比 K2 提高约 2.5 倍。按其 Scaling Law 曲线,达到相同验证损失所需的训练计算量,约为 K2 的 40%。K3 首先重写了注意力。它用 KDA 处理长序列,每三层再加入一层全局 MLA。KDA 把此前内容压进固定大小的状态,降低百万 Token 上下文的计算和缓存压力;MLA 负责保留全局信息交换。它还加入 Attention Residuals。传统模型只能把此前所有层的信息不断叠加,K3 则允许每一层直接从更早的网络块中挑选需要的内容。模型更深以后,早期信息不容易被冲淡。MoE 也被重新设计。K3 拥有 896 个路由专家,每个 Token 激活 16 个,是 K2 的两倍。路由专家会先在压缩空间中计算,再返回模型主干。新的激活函数和负载均衡算法,则用来防止超大模型训练失控。真正拉高 Agent 能力的还有后训练。月之暗面分别训练通用、Agent 和代码模型,再为每个方向训练三种思考强度,最后把九个专家合并。训练任务最长可包含数千次工具调用,并持续保留文件、应用和虚拟机状态。K3 已在多项代码、搜索和工具调用测试中接近或领先 Fable 5 和 GPT-5.6 Sol 等顶级闭源模型。它的跃升并非只靠堆参数,而是把更大的底座、新架构和百万 Token Agent 强化学习一起推到了极限。[原文链接](动察 Beating)
分享至:
脉络
热门快讯
APP下载
X
Telegram
复制链接