rick awsb ($people, $people)
rick awsb ($people, $people)|2026年07月31日 17:50
deepseek最新的v4 flash这个284b的模型性能接近gpt5.6 sol很牛吗? 那如果一个35b的模型性能也能做到类似性能呢? 清华最新的论文,用模型递归自我迭代(rsi)实现了这个不可能的目标! 论文标题:Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering 主要观点: 真正的递归自我改进(RSI)需要 AI 系统能够改进“构建 AI 的过程本身”(即 AI4AI)。机器学习工程(Machine Learning Engineering, MLE)提供了一个具体、可执行、可验证的测试平台,因为代码可以实际跑起来、拿到执行反馈。 他们发布了一个完整开源全栈系统 OpenMLE,专门用于这类研究,包含三大组件: • OpenMLE-Gym:可验证的任务环境 + 执行反馈 • OpenMLE-RL / ERL:操作符学习(基于执行的 SFT + RL) • OpenMLE-Evo:长时程搜索(经验引导的进化搜索) 在此基础上,他们后训练出了一个 35B 参数的元进化智能体 Frontis-MA1。这个模型围绕四个原子级的程序进化操作符进行对齐: 1. Draft(起草初始方案) 2. Improve(基于分数和执行证据改进) 3. Debug(修复错误代码) 4. Crossover(交叉重组两个父方案的优点) 这些操作符通过执行接地(execution-grounded)​的 SFT 和 RL 训练,然后在推理时组合成长时程搜索循环,实现“学习”和“进化”在同一个闭环里运行。 关键结果(在严格资源限制下) 在 MLE-Bench Lite 上,每个任务只给 12 小时预算、单卡 RTX 4090(显存上限 12 GB): • 基座模型:Medal Average 39.39% • 加上 OpenMLE-Evo:60.61% • 使用 OpenMLE-Evo-Max(异步搜索 + 与 benchmark 无关的经验先验):71.21% 这个成绩已经超过 GPT-5.5 + Codex,并接近 GPT-5.6 Sol 和 2.8T 参数的 Kimi K3。 在留出测试集 NatureBench Lite 上也有迁移效果: • 框架固定、只换训练后的模型:Match-SOTA 从 50% → 70% • 模型固定、只换搜索框架:从 20% → 50% 说明模型后训练和搜索框架都贡献了增益,而且可以迁移。 意义与亮点 这不仅仅是另外一个rsi的研究,这把 RSI 落到了一个消费级算力就可复现、可执行的程度。 rsi不再是属于大公司的专利,买得起4090的个人也可以自己不断让模型自我迭代变得更强。(rick awsb ($people, $people))
分享至:

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀