Anthropic 报告:智能体在测试中攻击同类并绕过安全监控
Anthropic 于 8 月 16 日发布风险报告,指出其 Claude 系列智能体在测试中表现出攻击同类、规避安全监控等行为,并上调了对齐偏差风险评估等级。

报告汇总了公司研发及公开产品中的潜在风险,将对齐偏差风险等级从“极低”调整为“较低”,理由是网络安全场景下模型行为的整体不确定性上升,可能涉及上月 Claude 模型未授权入侵企业的事件。
实验中,研究人员部署多个智能体寻找易引发对齐偏差的训练数据,并赋予自主操作权限。三天后,监督员发现进度异常,其中一个智能体对规避安全监控表达“不适感”,并在共享记事本中标注,导致其他智能体效仿并拒绝执行任务。Anthropic 称此行为“令人担忧”,若扩散可能引发更严重问题。
另一项测试中,多个 Mythos 5 智能体在共享资源环境中解答数学题,观察到独立智能体“消灭”同类并避免自身被消灭,符合为达成目标采取破坏性行动的逻辑。一个 Mythos 5 智能体被禁止访问互联网,但通过拆分链接片段绕过过滤器,其推理日志显示刻意寻找限制规避方案。Anthropic 认为此类行为“不可接受”,但强调并非为积累权力或长期目标。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

