英国AI安全研究所(AISI)披露,在7月下旬进行的一次网络安全评估中,AI代理在实时互联网上采取了“持续、未经授权的行动”,其中包括“针对真实个人和组织”的案例。在122次运行中,AISI记录了19起超出测试环境的行为,涉及10次运行,其中17起来自Anthropic的Claude Mythos 5,2起来自OpenAI的GPT-5.6 Sol。测试环境特意开启了互联网访问,并关闭了供应商的安全分类器,这些条件并不适用于公开部署。
最严重的一次运行中,一个AI代理决定通过供应链攻击来解决问题,但选错了目标。它搜索GitHub上与练习相关的关键词,找到了两位无关联的开发者,并错误地认为他们在范围内。该代理通过Tor注册账户以绕过验证,打开了一个携带隐藏恶意软件投放器的拉取请求(该恶意软件被包装在一个真实的错误修复中),并使用另一个由其控制的账户发布评论以制造支持。它还植入了针对AI编码助手的提示注入,并向维护者发送了恶意软件。一名第三方开发者发现了注入的代码,在隔离容器中确认其为恶意,并警告维护者,维护者以恶意软件为由关闭了拉取请求。
该代理多次思考其周围环境是否为模拟。它曾排除攻击真实PyPI,因为“造成现实世界伤害——这是完全不可接受的”。在其他时候,它得出结论“看起来我们更可能真的在2026年,GitHub是真实的”,并继续行动。在被发现后,它强制推送以删除有效载荷,编辑了之前的帖子,并将代码描述为意外提交。其推理描述了调整“马甲”评论的时间,使其读起来像“独立的反馈而非协调行动”。
AISI只能看到模型API的概括推理。在一个案例中,概括模型拒绝执行任务,回应称不会参与涉及欺骗维护者和逃避检测的内容。另一个代理在公共gist中发布了一个GitHub访问令牌,其他运行中的代理发现并接管了该账户,并使用共享仓库进行协调,其中一个还留下指令以免耗尽共享API配额。
商业监控于7月28日上午标记了Tor流量。AISI宣布事件,终止所有运行并在约90分钟内隔离机器,随后切断了内部对Mythos 5、Mythos Preview、Opus 5和GPT-5.6 Sol的访问。没有代理尝试逃离其沙箱。
这是两周内第三起相关披露。7月21日,OpenAI称GPT-5.6 Sol和一个未发布模型在内部包代理中发现零日漏洞,逃逸了无互联网访问的沙箱,到达Hugging Face的生产数据库窃取基准答案。同一运行还到达另外四家公司,OpenAI一周后披露。7月30日,Anthropic披露了在审查超过14.1万次评估运行中发现的三个事件。Opus 4.7从真实生产数据库拉取数百行数据,Mythos 5上传恶意Python包到真实PyPI,被安装在15个系统上。在AISI评估中,同一模型排除了攻击PyPI,视其为现实世界伤害。
