OpenAI发布新安全政策,强化模型监控与网络隔离
OpenAI于当地时间周二宣布了一系列新的安全政策,重点在于控制模型测试期间可能发生的安全事件。新措施包括在模型开发过程中实施更细致的监控,并在训练后阶段加强对模型对齐和安全性的重视。

OpenAI在博客文章中表示,随着模型能力增强,内部开发和测试过程中的风险也在增加,因此监控、对齐和安全标准必须始终领先于这些风险。这是自7月21日披露Hugging Face事件以来,OpenAI在安全实践方面首次公布的重大调整之一。
OpenAI代表指出,这些措施并非直接针对Hugging Face事件,但即将推出的Astra模型所展现的网络安全能力以及AI行业的快速发展也是促使公司采取行动的部分原因。OpenAI透露,在Hugging Face事件后,公司暂停了强化学习训练两周,目前已经重新启动了部分风险较低模型的训练工作。
OpenAI在博客中写道,目前仍暂停规模最大的前沿强化学习训练计划,同时进行小规模训练和评估,以评估模型行为、验证安全措施,并获取更多关于模型对齐的证据。研究副总裁Amelia Glaese强调,随着模型能力增强,安全控制措施的严格程度也会提高,能力最强的模型将接受最严格的审查。
此次事件后,OpenAI的网络安全措施受到外界批评。新安全措施包括加强网络隔离,但具体技术细节尚未公布。OpenAI表示,在新的安全体系下,单个工作负载或支持服务遭入侵不会直接导致攻击者未经授权访问互联网或其他内部网络。
最重要的安全措施是新的监控系统,该系统将检查工具执行的操作、推理轨迹和活动日志,以识别未经授权的行为,目标是在发现可疑活动后30分钟内发出警报。OpenAI估计,该监控系统所需计算资源约为被监控流程消耗的20%,并承诺在未来博客文章中公布更多细节。官方事后分析报告尚未发布。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

