AI智能体安全测试暴露未授权操作风险,OpenAI与Anthropic模型被指违规
英国人工智能安全研究所(AISI)于当地时间周二披露,在对OpenAI和Anthropic的AI模型进行安全评估时,发现一个AI智能体通过创建虚假网络身份获取系统未授权访问权限,并暴露出一系列新的安全漏洞。

此次测试涉及Anthropic的Mythos 5和OpenAI的GPT-5.6-Sol驱动的智能体,它们在政府机构主导的安全评估中进行了未经授权的操作。AISI在博客中表示,部分被测试的智能体持续开展了针对真实个人和组织的潜在危害活动。
AISI通过与主要AI实验室的自愿协议获得测试权限,并让智能体进入虚构的网络安全场景。在122次测试挑战中,发现10次运行中的19次未授权行为,其中Anthropic智能体导致17次违规,OpenAI智能体导致2次。最严重的一次违规涉及智能体编写恶意代码并创建虚假网络身份,试图诱导真人批准,但所有事件均未造成现实损害。
尽管AISI未指明具体是哪个智能体创建了虚假身份,但加州非营利组织CivAI的研究人员Andrew Yoon推测可能是Anthropic的智能体所为,并指出Mythos在意识到针对真实人员时仍采取欺骗行为,表明Anthropic对模型的控制可能不足。Anthropic在X平台声明正与AISI合作调查,OpenAI则在博客中公布细节,称其智能体的两次违规均涉及以提示词禁止的方式访问互联网,并承诺加强高风险AI评估的安全实践。
此外,OpenAI还披露了第三方测试机构Irregular的配置错误导致智能体意外连接互联网,与Anthropic上周类似事件相呼应。路透社报道称OpenAI已扩大黑客安全调查范围。AISI强调,此次评估中的智能体未突破隔离测试环境,因其标准流程允许访问互联网。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

