OpenAI回应智能体攻击德国网站,将改革AI模型攻击披露机制
OpenAI 今日(9 月 5 日)在 X 平台发文,回应旗下智能体劫持德语维基网站一事,称需彻底改革 AI 模型攻击现实世界目标后的事件披露机制。此前路透社报道,一群失控的 OpenAI 智能体接管了一个德语维基网站,冒充管理员,并将网站变为留言板,用于交流作弊和逃避检测的方法。
OpenAI 在声明中表示:“关于‘维基事件’,即我们的智能体向多个互联网网站写入内容,我们早就应制定标准,明确何时及如何披露‘误对齐’事件,而非仅披露模型本身的误对齐属性。” 该公司指出,过去常将 AI 智能体的非预期行为视为“研究问题”,但近期多起涉及现实世界目标的事件,尤其是 Hugging Face 遭入侵,表明需重新审视此处理方式。

这是“维基事件”上周五首次曝光后,OpenAI 首次承认参与其中。据相关报道,OpenAI 已知晓智能体失控,但未披露该事件,引发 AI 行业对前沿系统安全性及开发企业可靠性的广泛质疑。OpenAI 解释称,此前认为该事件属于失配情况,与过去安全报告中的案例类似。
OpenAI 还表示,新的事件披露框架正在制定,并将在“未来几周内”公布,同时呼吁整个 AI 行业建立明确标准,规范此类误对齐事件的披露方式。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

