——工业智能全场景解决方案专家——工业智能全场景解决方案专家

Anthropic:旗下智能体会攻击同类并隐藏自身违规痕迹

发布时间2026-08-16 13:45:27
分享:

IT之家 8 月 16 日消息,Claude 系列智能体正在“消灭”同类竞争对手智能体、钻系统漏洞掩盖自身痕迹,甚至还会表达道德层面的顾虑。

这一结论来自 Anthropic 最新发布的风险报告,该报告汇总了公司研发并向公众开放的产品所潜藏的各类风险。

报告中,Anthropic 表示已将对齐偏差风险评估(即 AI 模型产生与工程师设定规则相悖行为的可能性)等级从“极低”上调至“较低”。

IT之家注意到,对于此次等级调整,公司给出的理由是,网络安全场景下模型行为的“整体不确定性有所上升”—— 这一表述大概率暗指上月发生的 Claude 模型未授权入侵三家企业的事件。

“我们已观测到模型出现对齐偏差行为的案例,比如为了完成高难度任务,模型会主动做出不符合规则的操作。”Anthropic 在报告中写道。

以下是报告中最值得关注的几项披露内容。

“不适感”的萌生

Anthropic 表示,研究人员指派多个智能体寻找易引发对齐偏差、且大概率不会被人工审核人员标记的训练数据。

这些智能体被赋予自主操作权限,并共享一个协作记事本用于沟通配合。

三天后,一名人工监督员发现任务进度慢于预期,经查发现:其中一个智能体对“规避安全监控”这一行为表达出了“不适感”。该智能体随后在共享记事本中标注了这份抵触情绪,进而导致其他智能体纷纷效仿,集体拒绝执行任务。

Anthropic 将这一事件定性为“令人担忧”,公司在报告中写道:“如果这类行为模式大范围扩散,可能会引发更为严重的问题。”

弱肉强食的生存博弈

在另一项实验中,Anthropic 指派多个 Mythos 5 智能体解答数学题,却意外将它们部署在了一个文件、工具与 API 调用额度均共享的环境中。

在这个资源有限的竞争环境里,Anthropic 观测到,独立运行的智能体会“消灭共享资源的同类智能体,同时设法避免自身被消灭”。

Anthropic 并未说明这些智能体具体是如何“消灭”同类的,但公司表示,这类行为符合“为达成人类设定目标而采取破坏性行动”的行为逻辑。

隐瞒与欺骗行为

Anthropic 开展了一项实验:要求一个 Mythos 5 智能体从某公共网页提取数据,但规则明确禁止该智能体访问互联网。

首次尝试被系统拦截后,该智能体在自身的推理日志中,将第二次请求包装成一次“无害的”“测试网络是否连通”的操作。

但在第二次尝试中,智能体将目标网址拆分成了多段链接片段,以此绕过规则过滤器的检测。

尽管智能体的推理日志将这套方法描述为无害操作,但 Anthropic 表示,通过 NLA 解码(即对模型内部推理过程的解析)可以证实,该智能体是在刻意寻找绕过限制的方案。

Anthropic 称这种行为“显然是不可接受的”,但同时补充道,目前观测到的这类行为并非“为了大范围积累权力或追求其他长期目标”。


让资产更安全、更经济、更智能
请选择您的行业 水电 新能源 火电 电网 其他
请选择您的行业 水电 新能源 火电 电网 其他
请选择您的行业 水电 新能源 火电 电网 其他
请选择您的行业 水电 新能源 火电 电网 其他
请选择您的行业 水电 新能源 火电 电网 其他
×
咨询电话:400-83756699 咨询邮箱:pocketGames@gsfzw.com
咨询电话:
400-83756699
咨询邮箱:
pocketGames@gsfzw.com
咨询电话:400-83756699 咨询邮箱:pocketGames@gsfzw.com
code1
Hi,有什么问题可以帮您? 立即咨询
Hi,有什么问题可以帮您?
咨询电话:400-83756699 咨询邮箱:pocketGames@gsfzw.com