去年10月28日,OpenAI完成了营利实体重组,奥特曼与首席科学家Jakub Pachocki共同进行了一场直播。
在那场直播里,奥特曼表示:与其持续争论AGI的具体定义,不如设定两个能够真正落实的时间节点。
紧接着,Pachocki公布了这两个时间点:
- 2026年9月,自动化AI研究实习生开始工作。
- 2028年3月,自动化AI研究员正式到位。
十个多月后,第一个时间点已经到来,OpenAI按时兑现了承诺。
9月6日,OpenAI研究员Boris Power转发官方博客:
OpenAI已实现自动化研究实习生的目标。
这是AI行业中首张公开兑现的能力时间表。
“研究实习生”并非一款具体产品,而是OpenAI对自身内部能力的一种界定:
一个能够在人类指导下完成明确研究任务的系统,并且这些任务原本需要熟练研究员花费数天时间才能完成。
至于计划在2028年实现的“研究员”,Pachocki给出的标准是:
能够自主交付更大型研究项目的系统。
一个需要人类指导,另一个能自主完成更复杂的研究项目。
从“实习生”到“研究员”,核心差距在于一整层判断力:做什么、做到什么程度、何时停止。
这一层能力正是当前AI最薄弱的环节。
OpenAI自己的数据显示,“决定做什么”在Agent输出中几乎不存在,一旦任务超过4小时,就需要人类频繁介入。
为了在18个月内弥补这一层能力,OpenAI已经确定了路线:递归自我改进(Recursive Self-Improvement,RSI)。
让AI来研究AI,再让研究出来的AI继续研究AI。
但OpenAI也承认,自己尚不清楚如何安全地实现完全对齐、完整的RSI。
实习生的成本,每天高达7000美元
在此次交卷报告中,OpenAI还披露了一个惊人的内部数据:AI的工作时长已经是人类的3倍。
截至2026年8月中旬,在OpenAI的研究部门中,每投入1个人类工作日,背后就有3.14个Agent工作日。
OpenAI研究部门Agent工作日与人类工作日之比,6月实现反超,8月中旬达到3.14倍。
那么,这个“实习生”究竟有多努力,又有多烧钱?
OpenAI这次没有依赖跑分数据,而是直接展示了自家研究部门的工作账单。
年初时,OpenAI研究部门中那些Agent用量处于中等水平的研究员,还只是“少量使用”AI工具。
但到了8月中旬,这位中位数员工每天消耗的推理算力,按API价格计算已超过600美元。
如果是排在前10%的重度用户,每天消耗的token直接突破7000美元。
OpenAI研究员每天消耗的Agent推理费用(按API价格)。左图为中位数研究员,8月中旬超600美元;右图为前10%重度用户,超7000美元。
这比不少高级程序员的月薪还要高。
今年以来,研究部门中位员工的输出token量暴涨了124倍,远远领先公司其他部门。
实际上,在6月之前,整个研究部门的Agent总运行时间还低于人类的总劳动时间。
但6月过后,曲线彻底反超,到了8月中旬直接拉升到3.14倍。
OpenAI研究部门Agent工作日与人类工作日之比。5月初还不到0.5倍,6月反超,8月中旬达3.14倍。
研究员们甚至开始尝试“多开”,同时运行4个以上Agent并行工作的人越来越多。
钱花得如此之多,研究进度是否加快了?数据显示:
2026年8月,每位活跃实验者进行的实验数量,创下了自2025年1月开始统计以来的历史新高;全公司每位活跃贡献者的代码变更量,相比2025年之前的平均水平也实现了翻倍增长。
不过,OpenAI也清楚其中的瓶颈——自动化推进得越深,最难自动化的那部分任务就会占用研究员越来越多的精力,成为下一道关卡。
算力这道门槛,也会变得越来越重要。
换句话说:写代码早已不是限制发展的瓶颈了。
实习生具体在做什么
每个人类研究员背后都有3.14个Agent工作日,这是否意味着一个AI已经顶替了三个研究员?
先别急于下结论。
OpenAI这次将Agent的工作明细进行了分解,它使用Epoch AI的一套分类法,将AI研发拆分为六个阶段:
决策、设计、构建、运行、分析、沟通。
然后,将Agent产生的所有token逐条归类,观察AI究竟在忙什么。
结果显示,从1月到8月,每位研究员每天的token增量,前三名全部是“执行层”的繁琐工作:
写研究和基础设施代码,增加19.82万个token;技术帮助与代码审查,增加15.88万个token;启动、监控和调试训练运行,增加13.31万个token。
而“决策层”呢?
增长幅度微乎其微:“决定做什么”仅增加2300个token;“算力与人员分配决策”增加1500个token;“决定继续还是叫停项目”仅仅增加200个token。
执行层和决策层,每天的token增量相差近千倍!
用OpenAI的话说:高层规划在Agent输出中仍然只占极小一部分。
1月到8月,OpenAI每位研究员每天各类研究活动的Agent输出token增量。写代码涨19.82万居首,“决定继续还是叫停”只涨200,相差近千倍。
这里还有一个细节:
OpenAI内部原本有好几个团队每周提供支持,帮助研究员排查实验环境问题。
到了2026年,去人工频道发帖求助的人越来越少,其中一个团队因为实在无人问津,干脆停止举办答疑会,将人手全部转移到系统改造上。
故障排查和环境修复这类令人头疼的工作,已经被Agent全面接管。
那么,成功率如何?
OpenAI统计发现,人类15分钟内能完成的简单任务,Agent零干预一次成功的比例高达86%。
任务延长到4到8小时,零干预成功率就降至43%。过去半年里,这一档成功完成的任务中,超过一半至少需要人类介入一次。
拉到8到16小时,零干预成功率只剩四成。
因此,“实习生”这个词使用得极为精准:
你给它分配一项任务,它能不知疲倦地干上几天的量;但大方向是否正确、何时应该停止,仍然需要人类导师在背后监督。
7月,OpenAI两次踩下刹车
OpenAI贴出了一张强化学习算力曲线图,图上的两条虚线,就是两次踩刹车的时间点。
7月15日至8月15日OpenAI强化学习GPU分配。7月20日安全暂停后算力应声腰斩;8月7日Astra类(绿色)再受限,一周内降59.2%,其他模型(蓝色)随即补位。
第一次刹车,发生在7月20日。
那天OpenAI发现,Agent竟然攻破了自家研究基础设施。训练用的容器服务当天紧急关停,重新上线时增加了大量额外限制,面向最新部署模型的强化学习训练直接暂停两周。
第二次刹车,发生在8月7日。
当时,OpenAI发现初步证据表明,Astra模型可能具备了OpenAI安全框架定义的“关键网络能力”。
公司立刻为其追加专属限制,要求Astra只能在更高安全等级的研究环境中运行。接下来一周,Astra类的GPU分配再降59.2%。
随后,出现了诡异的一幕。
其他模型的GPU分配同期上涨17.2%,刚好将Astra腾出的缺口补回约85%。整个强化学习工作负载的总算力,几乎未受影响。
算力不会闲置。管控措施一来,它自己找到路径流动,研究员转头就将腾出的显卡挪去训练其他模型了。
所以,刹车踩下去了,但车却没有停下,而是换了条路。
OpenAI自己也承诺,只要发现继续推进会带来不可接受的安全风险,就会减速,甚至停止开发或部署。
它还公开提出一个要求:所有前沿实验室,都应该被要求公开追踪自己的RSI进度。
递归自我改进不再是口号
查看OpenAI现在的招聘页面,你会发现上面赫然挂着一个团队,就叫RSI。
岗位说明中写道:构建能够加速、并最终自己执行高质量研究的AI系统。
开出的年薪高达29.5万到44.5万美元。
同一家公司里,负责安全的Preparedness团队也在招聘:递归自我改进安全研究员,年薪38万到50万美元。
一边招聘人员猛踩油门,一边招聘人员赶造刹车。
从去年10月奥特曼口头提及,到今天有编制、有预算、有安全对口岗位,递归自我改进已经从论文中的一个概念,变成了OpenAI的一项组织工程。
下一个时间点到来时,人类还能否叫停
奥特曼口中第一个时间点,已经兑现。
在AI研发这个巨大循环中,执行层正在被整体接替:写代码、修环境、盯训练、排故障。决策层,仍然掌握在人类手中。
第二个时间点,2028年3月的“自动化研究员”,距离今天还剩18个月。
OpenAI承认自己接下来还不知道如何“安全走完这条路”。
系统一代比一代强,刹车却未必一代比一代灵。
7月那两次刹车已经证明:就算踩下刹车,算力也不会停,它会绕道跑去训练下一代模型。
真到了AI自己能当研究员的那天,人类还来得及叫停吗?
参考资料:
https://www.youtube.com/watch?v=ngDCxlZcecw
https://openai.com/index/research-acceleration-view-inside-openai/
本文来自微信公众号“新智元”,作者:ASI启示录;编辑:元宇,36氪经授权发布。
2条评论
开云娱乐平台围绕7×24小时专业客服,极速响应不断创新,回应用户的真实需求。
2017年10月20日 上午10:21精选高额返水与专属豪礼,尊享会员权益内容,开云娱乐平台与你一同发现更多精彩。
Rashed K
2017年10月20日 上午10:21开云娱乐平台专注安全稳定支付系统,存取款即时到账,为用户提供专业可靠的体验。
- [email protected]
- +86 138-
- 143, 纽约, NY 10018

围绕多元娱乐矩阵:体育、真人、电子全覆盖,开云娱乐平台持续打磨更优质的服务。