用AI训练AI,实现自我进化!OpenAI内部数据首次曝光

9月6日,OpenAI在其官方博客发布了一篇题为《研究加速:OpenAI内部视角》的长文。这是公司首次以内部数据的形式,系统披露了AI“递归自我改进”(Recursive Self-Improvement, RSI)的实质性进展。

文章证实,OpenAI已实现去年秋天设定的关键里程碑——在今年9月前打造出一个“自动化研究实习生”系统。所谓“自动化研究实习生”,指的是“一个能在人类指导下执行明确定义的研究任务的系统,包括那些需要一名熟练研究员数天才能完成的任务”。

3.1倍:人机工作量的历史性逆转

最关键的转折点发生在今年6月。在此之前,研究组织的智能体总运行时长仍低于人类劳动总时长;此后情况发生逆转。截至8月中旬,以标准8小时工作日计算,每消耗1个人类工作日,研究组织的智能体已产出3.1个工作日的工作量。这意味着在OpenAI的研究部门,AI智能体已不再是辅助工具,而是成为实际上的主要“劳动力”来源。

从使用规模看,研究部门对智能体的采用速度远超公司其他团队。以中位员工的输出Token变化计算,智能体使用规模较2025年12月增长了124倍。按API价格折算,中位研究员每天的智能体推理使用额已超过600美元;而使用量处于前10%的研究员,每天消耗的Token价值则超过7000美元。越来越多的研究员会同时运行4个或更多智能体会话。

飞轮效应:研发循环全面加速

OpenAI将AI研发描述为一条包含多个环节的流程:提出改进方案、设计评估、编写基础设施、进行大规模测试、发现训练中的错误或不安全行为,并将有效方案整合进核心训练。智能体的介入正在压缩这一循环中的等待时间。

数据显示,公司工程师整体代码交付速度显著提升。更重要的是,2026年以来每名活跃实验人员对应的实验数量持续增加,8月达到自2025年1月开始跟踪以来的新高。OpenAI坦承,这一趋势与Codex使用增加存在相关性,但也强调算力增长是同步变量,不能将实验增长完全归因于智能体。

这种加速形成了典型的飞轮效应:AI产出更多代码和实验结果→研究进展加快→更好的模型被训练出来→反过来提升智能体能力。但同时,OpenAI也警告,随着自动化推进,最不易被自动化的任务可能占据研究人员更多时间,成为新的瓶颈;算力也可能在其他瓶颈减弱后变得更加关键。

下一步:2028年3月前的“自动化AI研究员”

OpenAI同时公布了下一阶段的雄心:在2028年3月前实现完整的“自动化AI研究员”,使其能够参与深度学习和对齐研究,并通过迭代进一步改进系统自身。这一路线图勾勒出一条清晰的能力跃升路径——从执行明确指令的实习生,到能够自主提出研究方向、设计实验并推动领域进展的独立研究者。

OpenAI此次披露的内部数据,是AI发展史上首次有顶尖实验室以量化方式公开RSI进程。3.1倍的工作量比例、124倍的使用增长、以及明确的“自动化AI研究员”时间表,都表明“AI训练AI”已从理论构想进入实操阶段。

(素材来自:OpenAI 智算芯能前沿网综合)

标签:AI 大模型 OpenAI

本文由智算芯能前沿网编辑整理,转载请注明出处。