OpenAI推理教父Noam Brown谈多智能体系统与千禧年难题
OpenAI研究员Noam Brown指出,Navier-Stokes千禧年难题的突破中,10000个Agent最多贡献了10%的功劳。
Noam Brown被称为“OpenAI推理教父”,是o1核心作者。2023年,当多数人还在关注模型参数时,他已押注test-time compute scaling(推理时计算)。一年后,o1-preview发布,引发行业震动。如今,TTS已成为行业共识,成为普遍应用的“深度思考”功能。

△Dwarkesh Patel播客《OpenAI researcher on agent swarms & recursive self-improvement》
目前,Noam Brown的研究方向是多智能体(multi-Agent)系统。此前,OpenAI动用10000个Agent,耗时88小时,输出1300亿token,攻克了一道千禧年数学难题。在最新播客中,Noam Brown从多智能体系统出发,探讨了公司经营、RSI发展、超级对齐等话题。
当难题越来越少、模型强到一秒解题时,如何继续提升能力?如果把这批Agent投入递归自我改进研发,会发生什么?前沿模型若一个长任务可做三个月,而发布周期只有两个月,怎么办?AI越来越会隐藏思维链,人应如何监测?当AGI超越人类智慧,我们如何知道对齐问题已解决?
主持人:今天我们对话的是OpenAI研究员Noam Brown。他是o1及此后一系列推理模型的奠基性贡献者之一,目前研究多智能体系统。你们上周宣布,一个由1万个不同AI Agent组成的系统,历时88小时、消耗1300亿token,解出了一道千禧年难题。实际上大约两三年前,你就指出,只要放大推理时算力投入,就能预见几年后模型基础能力会达到什么水平。我觉得你现在又站到了类似位置:Agent规模已大幅扩展,你可以帮我们看清未来能力会是什么模样。

Noam Brown:我是这样想的,如果你用横轴取test-time compute(推理时计算量),纵轴取这些推理模型的基准成绩,就会看到一条极清晰的规律,模型思考答案的时间越长,表现越好。人也一样,考SAT的话,如果只给五分钟做完整张卷子,成绩必然很糟糕;给五个小时,成绩就会好得多。AI模型也差不多,它们会用这段时间来自言自语,理清问题、审视各种情形、排除种种可能,并在已有发现上继续推进。但问题在于,你不可能干等三年才拿到一个答案。于是很多人开始搞并行化,也就是组团队。所以说,多智能体是把推理时的计算量由纯串行扩展改为并行扩展的方式。它的效率会低一些,因为不像单个Agent那样独享全部上下文。但只要做得好,它仍是极为有效的手段。
本文图片来自互联网,仅供学习交流使用,版权归原作者或原平台所有。如认为图片侵犯了您的权益,请联系我们删除。

