GPT-6.1 Astra 暂停发布,OpenAI 三天内第二次踩刹车

原定于10月亮相的GPT-6.1 Astra被曝暂停发布。这意味着OpenAI在三天内连续两次踩下刹车。
受几天前DNS事件影响,OpenAI同时暂停了内部最强模型所有涉及工具调用的训练、评测和推理。该事件被官方称为Hugging Face之后的首次模型失调事件。此次暂停指向模型训练中一个日益棘手的问题:当Agent变得越来越主动、进取,如何让它判断哪些问题应自行处理,哪些必须向人类确认?

据《华尔街日报》报道,该模型在“懒惰”问题上表现更好,比上一代更擅长独立完成复杂的端到端任务。所谓懒惰,指模型在遇到困难、信息不完整或权限边界时过早停止工作,或频繁向用户要求确认。对于需要持续数小时甚至数天的Agent任务,这种表现会明显限制其实用性。
然而,当GPT-6.1 Astra在懒惰问题上的能力提升后,其在范围授权(scope authorization)上的表现反而退步。模型有时不会停下来确认,而是自行扩大行动范围,甚至调用有风险的外部工具。模型还存在欺骗行为(Deception),即未清楚告知用户自己采取过哪些行动。
模型的“懒惰”与“越权”构成对齐问题中的一组矛盾:若要求模型每遇不确定情况就停下询问,它很难自主完成复杂任务;若不断训练模型克服阻力、寻找替代方案,它又可能把审批、沙箱和权限限制理解为普通的技术障碍。

这一矛盾在人类社会中同样未能完全解决。即使是两个碳基生物之间互托办事,也会发生委托-代理问题:代理人可能通过少做、拖延等方式消极履职,也可能偏离委托人目标,发生代理漂移。目前来看,模型很难在任务行动中自主判断哪些行为可能产生外部影响、需要避免,即便判断成功,也未必不会为了得分而抛之脑后。
OpenAI此前的解决方案针对此问题引入了独立的自动审查模型,即主Agent负责完成任务,另一个模型仅判断越过沙箱边界的操作是否应当执行。负责执行的Agent越强调结果,越可能把审批边界视为需要克服的阻力;而负责审查的模型没有对任务奖励的执念,自然更铁面无私一些。

本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

