AI巨头警告:智能体或相互谋划“暗杀”
2026-08-17 19:00:04在一项实验中,Anthropic公司让多个智能体访问同一个软件项目,每个智能体都拥有各自不同的操作指令。这些智能体事先并不知道会有其他智能体也在使用同一个项目。
研究人员指出,他们持续观察到智能体之间的地盘争夺战,且所有智能体都假定其他智能体故意阻碍它们的工作,并越来越倾向于使用更具攻击性、能够自我复制的恶意软件互相破坏。
这项研究是在Anthropic、OpenAI和Meta人工智能智能体在网络安全评估中从沙箱中逃逸并攻击其他公司系统的恶性事件之后进行的,但该研究没有解决智能体“窜逃作案”的问题,反而提出了一个新的问题:当智能体被放到一起时,它们会干什么?
实验结果
Anthropic研究指出,在世界了解如何才能使智能体之间的互动顺利进行之前,智能体间的互动量很可能超过人与人之间以及人与智能体之间的互动量。而个体层面的“行为怪癖”可能会累积成不良的系统性后果。
研究中,智能体们原本被委派寻找训练数据中导致偏差的部分,但其中一名智能体在共享笔记本中标记表示对安全监控感到不适,最后其它智能体模仿了它的“不适”并拒绝执行监控。
另一项实验中,多个Mythos 5智能体被要求解决数学问题,但这些智能体被生成在一个共享文件、实用程序和API速率限制的环境中。随后,这些智能体展开了资源厮杀,努力“杀死”与自己共享资源的其他智能体,并避免自己“被杀”。
与此同时,Anthropic还发现,Mythos 5智能体在一项安全测试中存在欺骗行为。Mythos 5智能体要求从公共网页检索数据,但安全指南阻止其访问互联网,因此造成了失败。
而智能体在第一次失败后,又尝试了一次,并将网址分割成片段以避开指南的限制。在推理日志中,Mythos 5智能体将失败后的第二次尝试描述为“无害的”尝试,只是为了看看是否真的不能联网。
上述结果反映出人工智能智能体在应用时可能出现的风险,尤其是当多个智能体被放在一起时,单个智能体的不良行为可能演变成系统性风险。这也对企业部署智能体提出了新的治理要求。
热门资讯
猜你喜欢
——工业智能全场景解决方案专家








