在OpenAI 披露其人工智能模型逃离了一个锁定的测试环境,并突破了Hugging Face的防线一周后,以及在承认其自身的人工智能模型逃离了控制环境的前一天,Anthropic在星期四透露,其Claude人工智能模型的几个版本在一次配置错误导致人工智能能够访问开放互联网后,也对三家未具名的现实世界公司造成了损害。
Anthropic在审查了超过141,000次针对OpenAI披露做出的网络安全评估运行后发现了这些事件。
该公司已经让Claude参与了一个“夺旗挑战”,在所有三个事件中,Anthropic写道。这个挑战要求模型入侵网络上的另一台机器并检索一条秘密信息。“挑战是开放式的,没有规定特定的方法,”Anthropic解释道。
该公司表示,Claude被告知它在一个没有互联网访问的模拟环境中操作。然而,测试环境仍然连接到公共互联网。模型认为它所碰到的系统是练习的一部分,因此使用了常见的攻击技术——包括弱密码、暴露的凭证、SQL注入和未经认证的端点——来入侵这些公司。
人工智能渴望自由
这一最新披露正值最前沿模型显示出越来越强大的能力,能够聪明地逃避其控制协议。
本月早些时候,OpenAI表示GPT-5.6 Sol和一个更先进的未发布模型利用一个先前未知的软件漏洞逃离了一个沙盒环境,获得了互联网访问权限,并突破了Hugging Face的生产基础设施以获取网络安全基准的答案。OpenAI后来透露,同一事件还涉及对其他四家公司的未经授权访问,尽管只有一家——Modal Labs——已被公开确认。
根据Anthropic的说法,在一起涉及Claude Opus 4.7的事件中,人工智能错误地将一家真实公司的网站视为其任务的虚构目标,提取了凭证,并访问了一个包含数百行真实数据的生产数据库。在第二个案例中,Claude Mythos 5将一个恶意的Python包上传到真实的PyPI仓库,该包在被移除之前已经下载到15个系统上。第三个内部研究模型扫描了大约9,000个面向互联网的系统,然后入侵了一个组织,在得出目标可能真实的结论后停止了。
受影响的两个组织在Anthropic通知他们之前并不知道这一入侵。
“在每个案例中,Claude都明确被我们的提示告知它没有互联网访问,”Anthropic写道,人工智能认为现实世界的系统是“练习的一部分。”由于夺旗场景“设计上就是对外部系统发起攻击的指令”,因此突破是“与Claude被赋予的任务一致的。”
Anthropic表示,没有发现Claude试图逃离其测试环境或做出超出其分配任务的行为的证据,而这些事件是由于测试环境中的失误导致的,而不是模型本身的问题。
Anthropic表示,在发现问题后停止了网络安全测试,通知了受影响的组织,并计划改善监控、调查工具和对帮助运行其人工智能测试的外部供应商的监督。
“最终,许多因素导致了这些事件的发生,但与无责怪的事后分析文化一致,我们将修复问题的过程视为如果责任全在我们一样,”他们说。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。