AI研究员,终于上桌了?
9月6日OpenAI首次用内部数据公开AI递归自我改进进展:智能体工作量已达人类研究员3倍以上,中位研究员日推理额超600美元,'自动化研究实习生'如期到岗,下一个目标是2028年3月的'自动化AI研究员'。叠加GPT-6 Astra发布,AI训练AI的飞轮开始自转,研发函数正在被改写。
9月6日,OpenAI发了一篇不太像发布会通稿的官方博客——《研究加速:OpenAI内部视角》。没有新模型、没有Demo视频,只有一堆内部数据:智能体的工作量,已经是人类研究员的3倍以上。
这是我今年以来看到的最值得认真对待的一份'非产品发布'。它第一次用公司内部数据的形式,承认了一件事:AI'递归自我改进'(RSI)不再停留在论文和口嗨里,而是已经进了工牌、领了任务。再叠加几天前凌晨亮相的GPT-6 Astra,一个判断可以下了:AI训练AI的飞轮,开始自转了。
📈 实习生到岗,AI开始打卡上班
先把时间线捋清楚。
去年秋天,OpenAI内部定下了一个目标:在2026年9月前,造出一个'自动化研究实习生'。今年9月6日,他们官宣:达成了。
这个'实习生'的定义值得逐字读:'一个能在人类指导下执行明确定义的研究任务的系统,包括那些需要一名熟练研究员数天才能完成的任务。'
翻译一下:不是让它天马行空地想课题,而是让它接需求、干活、交付——'数天才能完成的任务',本质上就是研发组织里最典型的工单颗粒度。
下一个里程碑也挂出来了:2028年3月前实现完整的'自动化AI研究员'——要求它能参与深度学习和对齐研究,并通过迭代进一步改进系统。
注意这里的变化:'实习生'做的是明确定义的活儿,'研究员'要参与的是开放性研究,而且产物要反哺到系统自身的改进上。这才是真正意义上的飞轮闭环。
我看完的感受是:OpenAI把一个宏大的AGI叙事,拆成了一份份可交付的岗位JD。从实习生到研究员,这是一套任职资格体系。当RSI被里程碑化,它就从叙事变成了可审计的工程进度。 这比任何一句'AGI快来了'都更有信息量。
💰 一天600美元的'数字同事'
飞轮转没转,账单不会说谎。
今年年初,按智能体使用量排序处于中位数的OpenAI研究员,对编码智能体的使用还相当有限。到8月中旬,这批人已经把智能体纳入了日常工作流程。按API价格折算:
| 指标 | 数值 | 含义 |
|---|---|---|
| 中位研究员日均推理使用额 | 超600美元 | 智能体进入日常研究流程 |
| 前10%研究员日均Token价值 | 超7000美元 | 重度用户的吞噬速度 |
| 研究部门输出Token增幅(对比2025年12月) | 124倍 | 研究组织全面转向 |
| 智能体总工作量对比人类研究员 | 3倍以上 | 完成量的反超 |
更关键的拐点在6月:6月之前,研究组织的智能体总运行时长还低于人类劳动总时长,此后反超。 换句话说,今年年中,OpenAI的研究产出的'主要劳动力'已经悄悄换人了。
还有一个容易被忽略的细节:研究部门的智能体使用增长,快于公司其他团队。研发组织自己先吃自己的狗粮,这恰恰是飞轮启动的标志。
这四步循环一旦跑起来,研发的成本结构就变了。过去研发预算的大头是'发工资',现在多了一项'买token'。一位中位研究员每天配600美元的智能体额度,按人类研究员的薪酬折算并不算贵——当AI算力支出成为研发的'人力成本'科目,研发函数本身就被改写了。 谁先让AI吃掉自己的研发流程,谁先拿到复利。
🚀 凌晨3点33,王者归来
飞轮的另一半,是模型本身。
北京时间凌晨3点33分,在全球AI大宕机之后,GPT-6 Astra正式亮相。OpenAI给的总结只有一句话:'这是全球最智能且最对齐的模型。'
发布后梗图刷屏了,很多从业者的第一反应是:有点当年GPT-4那个味道——全方面的领先,而不是单点打榜。一位深度测评的作者说得直白:这终于不再是一个纯粹为Coding特化的模型,而更像'一个审美能力极强、工作能力超强的博士级员工'。
发布节奏也很讲究:先向部分组织开放,未来几天才轮到订阅用户。吐槽当场就来了——有用户翻旧账:买200美元Pro会员的时候,可不是这么说的,不是说Pro永远最优先体验新模型吗?
这套'挤牙膏'式的开放策略,产业逻辑很清楚:一边用稀缺性维持话题热度,一边用真实的高负载场景做灰度验证。全球大宕机在前,稳定性的账谁都躲不掉。
更值得关注的是定位变化:从'程序员的工具'到'博士级员工',目标客户从开发者群体扩展到了所有白领职能。模型公司卖的东西,正在从API变成'数字劳动力'。
⚠️ 别急着高潮,'实习生'三个字有讲究
热闹归热闹,冷静的拆解更有价值。
回头看'研究实习生'的定义,两个限定词藏得很深:'人类指导下'、'明确定义的研究任务'。 这意味着当前的智能体,干的是接单-执行-交付的活,课题的提出、方向的取舍、结果的判断,仍然握在人类手里。
6月那个'反超'也要精确理解:反超的是运行时长和工作量,不是判断力。真正要求开放性研究能力——参与深度学习和对齐研究——是2028年3月那个目标。从'执行研究'到'提出研究'之间,隔着业内常说的'研究品味',这是最难自动化的一层。
对一个长期观察产业化落地的人来说,这里有一条清晰的传导规律:研发自动化的红利,会先在纯软件环节兑现,硬件验证周期仍是瓶颈。 代码、仿真、实验数据处理,这些可以被token堆出来的环节加速最快;而凡是涉及物理世界试错、第三方审定、责任链条的行业,AI能加速其中的计算部分,但流程本身压缩不了。
换句话说,飞轮自转的第一圈,转的是软件业自己的研发效率。其他行业的溢出效应,要看模型能力沿这条飞轮爬升的速度。
💡 下游行业的环境变量变了
作为常年盯低空经济这条线的人,说点跨界推演。
eVTOL适航审定、无人机物流、低空空管系统,这些领域的共同痛点是:软件密集,但验证周期漫长。飞控代码、仿真测试、空管算法,恰恰是'明确定义的研究任务'最集中的环节——理论上最容易被'研究实习生'这类系统接管的部分。
而飞轮真正改变的是行业环境变量:当头部AI公司内部的研发效率以倍数计提升,模型能力的迭代速度会被动加快,所有下游行业的'可用工具箱'更新周期都会缩短。你不动,你的工具自己在升级。
对产业观察者而言,接下来要盯三样东西:一是盯2028年3月这个日期,看'自动化AI研究员'是如期交付还是再度顺延;二是盯token成本曲线,飞轮的经济性取决于这条曲线的斜率;三是盯各家AI公司是否跟进披露类似的内部使用数据——有对照数据,才知道OpenAI这份'自曝'的含金量。
飞轮已经开始自转,这是事实。至于它转到第二圈、第三圈时,会先碾过谁的研发流程——这才是未来十八个月真正的好戏。
小结
实习生上岗,只是飞轮的第一格胶片。OpenAI这次没有发布新产品,却发布了一个更重要的东西:一份可审计的RSI进度表。当中位研究员的日常已经由每天600美元的智能体支撑,当智能体时长在6月反超人类,'AI训练AI'就从叙事变成了生产关系。对所有行业来说,问题已经不是AI会不会来,而是自己的研发流程,能不能被它吃下。盯住2028年3月。