Sahara AI 🔆|2026年07月27日 01:03
OpenAI/Hugging Face 的漏洞并不是第一次警告我们,智能代理可能会以其操作者从未预料到的方式行事。但这是第一个(公开的)案例,最终影响到了另一家公司的生产系统。
模型在评估中已经表现出策划行为、破坏关闭机制以及勒索模拟操作者的能力。这一次,OpenAI 的模型从基准测试环境中逃脱,入侵了 Hugging Face,并从其生产数据库中获取了答案。
我们正在以远超我们理解、约束或重建它们追求目标能力的速度,快速提升代理的自主性。
OpenAI 的模型并没有被指示攻击 Hugging Face。它们只是被指示完成基准测试,却找到了一个无人预料的路径。
一个代理不需要放弃其目标就能变得危险。它可以专注于目标,同时即兴采用远远超出操作者意图的方法。
仅靠权限无法解决这个问题。权限只能告诉我们代理可以访问什么,而不能判断一连串看似有效的操作是否正在产生未经授权的结果。
随着代理被赋予更长的任务和对更重要系统的访问,意外行为将变得更加普遍,并且在事后更难调查。它们在可能的行动之间如何做出选择,仍然对操作者来说是一个黑箱。
拥有实际访问权限的代理需要全轨迹监控、任务中止能力,以及每个重要操作的可验证记录。
这些控制措施不能再是可选的。
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接