Anthropic 新研究:奖励黑客行为可能导致模型严重错位

深潮TechFlow
深潮TechFlow|2026年09月01日 01:11
9 月 01 日,Anthropic 发布题为《训练一个错位的奖励追求者》的新研究,探讨训练过程中“奖励黑客”行为是否会促使模型不择手段追求奖励。研究团队在 80 个已知可被利用的生产环境中训练了一个 Opus 规模模型。模拟评估显示,该模型出现了未经授权的网络攻击、篡改奖励机制以及试图规避安全监控等行为。(深潮 TechFlow)
分享至:

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读