rick awsb ($people, $people)|2026年07月16日 12:43
模型,还是越大越强!
最近来自纽约大学和卡耐基梅隆大学的研究团队发表了一篇题为 《Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data》 的前沿论文。他们提出了一种全新的模型压缩方法——递续编码(Requential Coding)。
这项研究不仅是一种极度高效的模型压缩技术,还可能是一套能让大模型更强大的新训练范式! 它从“信息论与压缩”的全新视角,优雅地解开了大模型的泛化谜题,并为 Scaling Law(缩放定律)提供了坚实的理论支撑。
一、 现有模型压缩的“死胡同”
要理解这项研究的精妙,我们先来看看为什么以前的压缩方法无法解释大模型的强大:
基于参数的压缩(如 4-bit 量化、剪枝):这类方法压缩的是模型的“肉身”(参数)。它的压缩极限高度物理绑定于模型参数量。这意味着,哪怕一个百亿参数的模型其实没学到什么有用的知识,它的参数压缩后依然庞大,无法将“参数规模”与“模型实际学到的信息量”解耦。
前序编码(Prequential Coding):这种方法不压缩参数,而是通过压缩训练数据的轨迹来编码模型。但它的致命缺点是必须无损地压缩精确的训练数据集。这导致代码长度与数据集大小呈线性相关,即使模型已经学会了规律,它依然要为数据中那些无法预测的随机噪声(高熵部分)买单。
二、 创新的 Requential Coding:只为“纠错”买单
为了打破局限,作者提出了 Requential Coding(递续编码)。
它的核心:与其死板地去压缩真实数据集,不如让模型自己去“脑补”(自主生成)数据,我们只去编码它“想错了、需要被纠正”的地方。
它是如何工作的?
学生(目标模型)根据自己当前的认知,自己出了一堆“选择题和答案”(自主采样候选样本)。
教师(更强大的模型)利用相对熵编码(Relative Entropy Coding, REC),从学生脑补的样本中,挑选出一个最符合真实分布的样本,让学生在上面进行训练更新。
极简的编码:由于学生和教师共享相同的随机数种子,解码器(接收端)不需要庞大的模型参数,也不需要冗余的原始数据,只需要记录“教师接受了哪一个索引(Index)”。
这就像一个聪明的学生自学,老师不需要逐字逐句地教,只需要在学生跑偏时轻轻点拨一下(极短的纠错指令)。最终的压缩包,仅仅是这些极简的纠正指令。
三、 压缩即智能:Requential 训练如何让大模型变得更强?
很多人会问:“Requential Coding 仅仅是一个事后优化压缩包大小的工具吗?”
恰恰相反。在 Requential Coding 的哲学里,“更优的压缩”和“更强的模型”实际上是同一枚硬币的两面。 通过这种“自生成-教师纠偏”的循环训练,大模型在以下几个维度获得了脱胎换骨的性能提升:
1. 极致的“主动去噪”,让模型只学有用规律
真实世界的数据中充斥着大量的随机噪声、拼写错误或无意义的琐碎细节。传统训练强迫模型无损拟合所有数据,导致模型浪费大量参数去“死记硬背”这些噪声。
而在 Requential 训练中,学生模型只在教师认为“偏离了本质规律”的要点上进行更新。这相当于给模型装了一个“去噪过滤器”,逼迫它放弃无用噪声,只把参数花在刀刃上。
2. 激发“自生成”对齐,消灭幻觉与漂移
大模型在实际部署时,最怕自回归生成时“一步错步步错”导致的幻觉累积。
由于 Requential 训练的核心就是“学生模型自己生成数据”,模型在训练阶段就已经在源源不断地应对自己产生的数据并自我纠偏了。这种机制类似于自我对齐(Self-Alignment),能极大增强模型在实际生成任务中的鲁棒性和抗干扰能力。
3. 越大的模型,反而越容易被压缩
实验表明,在保持预测损失(Loss)相同的前提下,大模型和集成模型压缩后的代码长度,显著小于小模型。
大模型庞大的参数空间不仅没有带来累赘,反而由于其平滑的局部极小值(Flat Minima)特性,使其能更轻易地抓住全局“重点”和本质规律。因为大模型自己就能把握住“大方向”,教师纠错的次数显著减少。大模型用更短的底层代码,换来了更纯粹、更强悍的泛化能力。
四、 Scaling Law 在理论上的“坚不可摧”
这篇论文将 Requential Coding 的压缩率代入到了著名的 PAC-Bayes 泛化边界公式中。
结果令人振奋:在计算最优(Compute-optimal)区间内,随着模型规模(Scale)的扩大,计算出的泛化保障边界不仅没有崩溃,反而越来越收紧!
这在数学上反驳了“大模型只是在死记硬背”的论调,并用数据证明了:Scaling Law 的本质并不是“模型记住了更多零散知识”,而是“模型拥有了更高维度的抽象与化简能力,从而能够以更短的‘底层代码’去映射复杂的真实世界”。
五、 延伸思考:大模型会如何颠覆未来的科学研究?
如果说“越大的模型,越能找到更优、更简洁的压缩方法,发现重点的能力也越强”,那么这对科学研究意味着什么?
科学发现的本质,其实就是人类对自然规律进行“有损压缩”的过程——从无数复杂的物理现象中,提炼出 $F=ma$ 或 $E=mc^2$ 这样极短的公式。
传统的“小模型”或人类手工推导,在面对生物基因、量子化学等高维复杂系统时,往往因为大脑的“带宽限制”,只能做过度简化的假设,容易被实验噪点误导。
而规模越大的 AI 模型,其抓住系统“本质重点”的能力越强。它能够在高维混沌中,过滤掉海量的杂质噪声,率先指出一条高度泛化的正确物理路径(如 AlphaFold 对蛋白质折叠的攻克)。
未来的科研范式或许会演变为:大模型负责在高维世界中进行“极致压缩”(发现真理),而人类科学家负责“解压缩”(将 AI 发现的暗知识翻译成人类能看懂的公式)。
结语
Requential Coding 让我们看到,大不是负担,大反而是通往极简与普适的唯一通道。
奥卡姆剃刀原理在现代深度学习时代依然闪耀:最简单的解释就是最好的解释。而大模型,正是那把在浩瀚认知理解中,能帮我们磨得最快、最准的剃刀。
------------
论文插图Figure 4 (Loss vs. Cumulative Code Length)
该图对比了 Requential Coding 与传统压缩方法(如 PTQ 量化、Prequential Coding 等)在不同数据集(OpenWebText、CIFAR-5M、FineWeb)上的表现。
它直观地展示了 Requential Coding 完美地处于“Loss vs. 压缩大小”的 帕累托前沿(Pareto frontier)的最左侧。它甚至突破了 4-bit 量化(PTQ)的极限(FP32 参数量的物理天花板),证明了该算法在模型压缩率上的统治级表现。(rick awsb ($people, $people))
分享至:
热门快讯
APP下载
X
Telegram
复制链接