OpenAI“AI研究实习生”上岗,Agent运行时间已超人类3倍

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:1,472

摘要:OpenAI宣布已实现“自动化研究实习生”目标,AI已能在人类指导下完成部分耗时数天的研究任务。截至8月中旬,Agent累计运行时间约为人类工作时间的3.1倍,即研究员上1天班,按8小时折算,相当于约24.8小时的Agent并行跑任务。OpenAI下一目标是在2028年3月前打造“自动化AI研究员”。

产联社编辑 | 黄钰慧

image.png

图片由AI生成

【产联社】OpenAI正在给自己的研究团队增加越来越多的“AI实习生”。当地时间9月6日,OpenAI发布内部研究报告《Research acceleration: The view inside OpenAI》,并宣布已经实现去年提出的阶段性目标,即在今年9月前拥有“自动化研究实习生”(automated research intern)。按照OpenAI的定义,这类系统能够在人类指导下完成目标明确的研究任务,其中包括原本需要熟练研究人员数天才能完成的工作。

这里的“研究实习生”并不意味着AI已经可以独立进行科学研究。OpenAI披露,目前人类仍负责设定研究优先级、判断哪些想法和实验结果值得继续,并决定系统是扩大规模、暂停还是部署。而Agent更多地承担具体任务,也就是说,它更接近一个能够接下任务并持续执行的研究助手,而不是自己决定研究什么的科学家。

不过,这些“AI实习生”的工作量已经不小。截至8月中旬,按照标准的8小时工作日折算,OpenAI研究组织每投入1个人类工作日,对应约3.1个Agent工作日。相比今年6月以前Agent总运行时间还低于人类研究人员工作时间,二者已经发生反转。

AI研究实习生能干什么

OpenAI的Agent最初主要帮助研究员写代码,现在正在进入实验、排障和分析等更多研发环节。

AI研发不只是提出一个想法、训练一个模型。研究人员还要编写和修改代码、搭建实验环境、运行和监控实验、排查故障、分析实验结果,再决定哪些方法值得进入下一轮测试。OpenAI此次披露的数据表明,Agent正在承担越来越多原本由研究人员完成的研发工作。

为了观察Agent究竟在做什么,OpenAI借用了研究机构Epoch AI针对AI研发的分类方式,将相关工作分成决定研究方向、设计方案、构建代码和数据、运行实验、分析结果以及沟通协作六类。从今年1月到8月,Agent在六类工作中的使用量均有所增加,其中增长最明显的仍然集中在研究和基础设施代码、技术支持与评审,以及实验启动、监控和调试。也就是说,Agent正在从单纯“帮研究员写代码”,走向“帮研究员把实验跑起来”。除了编写研究和基础设施代码,它们还可以帮助解决技术问题、启动和监控实验,并参与部分实验结果分析。

这种变化已经影响OpenAI内部一些具体工作流程。过去,部分团队会安排固定的答疑时间,由工作人员帮助研究员排查实验和基础设施故障。但进入2026年后,多个团队发现前来寻求人工帮助的人数明显下降,其中一个团队已经取消专门的答疑时间,把精力转向其他系统改进。OpenAI内部主要技术求助频道的发帖量也在下降,公司称目前没有发现这些需求转移到其他人工支持渠道。

这意味着,Agent接手的不再只是一次性的代码生成,而是一些过去需要研究人员或技术支持团队持续投入时间的具体工作。OpenAI今年7月公布的一份科学计算研究也出现了类似变化,在多个Agent辅助科研项目中,研究人员的角色逐渐从具体实现转向验证和组织工作,即确定要做什么、如何判断结果正确,以及什么时候可以交付。

“实习生”帮OpenAI干了多少活

随着更多研究任务交给Agent,OpenAI研究人员使用AI的强度快速上升,代码和实验数量也在增加。

最直观的指标是Agent运行时间。截至8月中旬,OpenAI研究组织每投入1个人类工作日,对应约3.1个Agent工作日。同时,越来越多研究人员开始采用并行工作方式,同时运行4个或更多Agent。

研究人员调用Agent的规模也在迅速扩大。今年年初,如果把OpenAI研究员按照Agent使用量从少到多排列,处在中间位置的研究员还只会少量使用编程Agent;到8月中旬,这一水平的研究员每天使用的AI推理量,按照公开API价格折算已经超过600美元。使用量最高的前10%研究员,每天则超过7000美元。

随着Agent使用增加,OpenAI观察到的代码和实验数量也在增长。以2025年以前的平均水平作为基准,目前全公司每名活跃代码贡献者的代码修改量已经达到约7倍。进入2026年以来,每名活跃实验人员运行的实验数量也持续增加,今年8月达到自2025年1月开始追踪以来的最高水平。但这些数字不能直接理解为OpenAI的研发效率提高了3.1倍或7倍。AI研发还包括设计方案、评测模型、发现训练异常以及判断哪些结果值得继续等多个环节,任何一个环节受限,都可能拖慢整个研发周期。

实验数量增加也不能全部归因于Agent。OpenAI称,今年实验数量的增长与Codex采用率提升相关,但同期公司可使用的算力也出现明显增长。因此,目前更准确的结论是,Agent使用增加的同时,OpenAI内部代码修改量和实验数量也在增长,而不能据此计算Agent究竟让整体研发速度提高了多少。

这些变化背后,一种新的工作方式正在OpenAI内部普及。研究员不再只能自己依次完成每项工作,而是可以同时把不同任务交给多个Agent推进。

离真正的“AI研究员”还有多远

虽然Agent已经能承担部分长时间、复杂的研究任务,但OpenAI目前仍把它定位为“实习生”,一个重要原因是复杂任务还离不开人的指导和判断。

OpenAI按照“如果交给人类,需要多长时间完成”来划分不同任务的难度。从今年1月至7月,不同难度任务的成功率总体都在提高。但任务越复杂,对人工指导的依赖也越明显。过去6个月,在成功完成的、相当于人类需要4至8小时处理的任务中,超过一半至少经历过一次人工介入。这意味着Agent已经能够持续处理一部分较长任务,但研究员还不能把复杂任务交出去之后就完全不管。OpenAI的统计显示,高层规划目前仍只占Agent输出Token的很小一部分。

更关键的差距在于研究决策。Agent已经能够完成越来越多具体任务,但研究往哪里走,仍需要人来判断。这也是OpenAI将现阶段定义为“自动化研究实习生”,而不是“自动化研究员”的关键区别。

“研究实习生”之后,OpenAI已经给出了下一阶段的时间表。公司计划在2028年3月前打造“自动化AI研究员”(automated AI researcher),目标是让它在人类监督下进一步推进深度学习和对齐研究,并实现迭代改进。

如果AI能够参与改进AI,并让新一代系统继续参与下一轮研发,就可能进一步缩短部分模型研发环节的反馈周期,这也是OpenAI此次讨论“递归自我改进”的背景。不过,这仍是OpenAI希望推进的方向。公司明确表示,目前还不知道如何安全地实现完成对齐的全面递归自我改进,也不能假设安全和对齐能力一定能够跟上模型能力提升。

因此,从“研究实习生”到OpenAI计划中的“自动化AI研究员”,要跨越的不只是让Agent写更多代码、跑更多实验。现在的Agent已经能够放大研究员的执行能力,下一步真正需要突破的,是那些仍高度依赖人类指导、判断和取舍的研究工作。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

4
2
分享
上一篇 下一篇