Shaw (spirit/acc)
Shaw (spirit/acc)|2026年07月29日 18:13
RLHF不是强化学习 “强化训练”更准确地描述RLHF、GRPO、RLVR等 这里没有真正的学习发生 你是在计算奖励而不是损失。好吧。但这并不意味着代理正在从自己的经验中学习。这只是一个基于大量回合的统计函数。 如果人们真的很执着于将奖励函数的离线应用称为强化学习,那么我建议用“经验学习”来描述我们真正的意思——代理从自己的经验中学习并进行更新。 我们可以将LLM饱和到AGI级别,但无法超越。强化训练仍然局限于分布中的人类数据生成的tokens,这意味着它是一个随着时间推移探索不太可能tokens的老虎机。我们永远无法通过这种方法获得超级智能,因为新颖的tokens不在top k之内。 超级智能需要一个能够从自身经验中学习的代理。也许它可以与其他代理共享经验,但关键是它必须能够从自己的经验中学习并更新,否则它就无法探索超越人类训练的可能tokens。 Tokens过于离散,无法在单个代理中实现信用分配。Tokens可以是连续过程的输出(比如人类发声时的词语),但它们对于强化训练来说是一种极其低效的结构。 显然还有另一种方式——我们本身就是存在的证明——问题是,什么是能够体现所有这些品质的最简单模型,用于一个能够从经验中学习的代理。
+6
曾提及
分享至:

脈絡

熱門快訊

APP下載

X

Telegram

Facebook

Reddit

複製鏈接

熱門閱讀