科技

OpenAI称AI已到“研究实习生”水平:3.1人日仍是内部口径

|作者: QUASA 编辑团队|2 分钟阅读| 1
OpenAI称AI已到“研究实习生”水平:3.1人日仍是内部口径

OpenAI于2026年9月6日发布的研究加速报告 称,按公司内部衡量,AI已经达到“自动化研究实习生”目标;该文件把这一水平定义为在人类指导下执行边界明确的研究任务,包括熟练研究员可能需要数天完成的工作,并将完整的自动化AI研究员列为2028年3月目标。

这不是一款新产品的发布,也不意味着AI已经能够独立选择研究方向。Cocoloop对公开材料的核查 指出,截至2026年8月中旬,OpenAI研究组织每投入一个标准八小时的人类工作日,就累计使用3.1个智能体工作日;这一比值源自内部埋点,外部无法复核,而且在估算需四至八小时的成功任务中,超过一半仍至少需要一次人工介入。

“研究实习生”仍是受指导的任务执行者

OpenAI编码智能体在人类指导和介入下完成边界明确的研究任务

这一里程碑有三条清晰边界:任务需要事先定义,工作由人类交办和指导,任务规模按熟练研究员的工作量估算可以持续数天。它衡量的是智能体承接较长执行任务的能力,而不是自行发现重要问题、确定研究路线或对科学结论负责的能力。

在内部采用的研发流程分类中,工作被拆分为决定、设计、构建、运行、分析和沟通等阶段。智能体在研究代码、基础设施代码、技术支持和运行监控中的活动增加,但高层规划仍只占其输出令牌的很小部分;“会完成较长任务”与“会主持一项研究”因此仍是两个不同层级。

成功率本身也只覆盖可以找到客观结果的任务,结果不确定的分类未被纳入。代码是否运行完成可以得到相对明确的判断,但论文构想是否新颖、某项实验是否值得继续、现有证据能否支撑结论,通常无法用同一种自动判定方式处理。

3.1人日衡量运行规模,不是成果倍数

OpenAI内部将3.1个智能体工作日与一个人类工作日进行运行时间换算

3.1的分子是编码智能体累计运行时间,不是被采用的科研成果。计算方式是把符合条件的运行时间折算为八小时制智能体工作日,再与研究组织同期的人类劳动比较。研究人员并行启动多个智能体,或者顶层智能体创建子智能体时,不同执行链的活跃时间会分别累计。

因此,这一比值不能改写成“一个智能体等于3.1名研究员”,也不能证明科研产出提高了3.1倍。它没有按结果质量调整运行时间,也没有单独说明失败尝试、重复执行、等待资源和人工返工各占多少;能够直接观察到的是机器侧执行规模已经超过人类工时,而不是两者产生了等值成果。

测量范围还覆盖“研究组织”这一宽口径,其中包括从事实验、研究基础设施、项目管理和支持工作的人员。工具和统计方法也在快速变化,部分智能体使用没有被纳入。即使未来比值继续上升,不同时期或不同实验室的数据也未必能直接横向比较。

实验量与推理成本同时上升

CellCog对公开数字的逐项整理 显示,2026年8月每名活跃实验人员运行的实验数达到自2025年1月开始追踪以来的最高点;截至8月中旬,按API价格估算,智能体用量处于中位数的研究人员每天消耗超过600美元,第90百分位超过7000美元。

实验增加与Codex采用率上升同时发生,但同期可用算力也比2025年显著增加,现有数据没有把两个因素各自带来的影响分离出来。代码提交速度、实验次数和推理消耗都属于过程指标,尚不能单独回答有多少实验产生了可进入核心训练的有效改进。

这些金额同样更适合作为推理用量的标尺,而不是OpenAI实际支付的账单。公开数据没有给出每项成功任务或每个有效研究成果的完整成本,也没有把机器推理、人工审查、训练算力和返工费用合并计算,因而暂时无法得到可比较的单位科研产出成本。

科研链条还包括问题选择、评估设计、安全检查、结果解释和规模化验证。执行环节加快后,较难自动化的判断与验证可能占用更大比例的研究时间,这也是运行量不能直接换算为整体进展速度的原因。

人类保留最终决策,2028目标尚未实现

OpenAI研究人员审查智能体结果并决定研究是否扩大、暂停或部署

人工介入不是偶发现象,而是当前里程碑成立的条件。对于较复杂的长任务,研究人员仍可能需要补充背景、纠正执行路径、解决环境问题或完成收尾;“能够承接数天工作量”并不等于智能体可以在整个任务周期内无人看管地持续推进。

研究人员仍负责设定优先级,判断哪些想法和结果值得继续,并决定是否扩大实验、暂停工作或部署系统。智能体目前扩展的主要是构建、运行、分析、技术支持和监控等执行环节,最终研究判断与风险决策没有随运行时间一起自动化。

2028年3月对应的是下一阶段目标:在人的监督下进一步推进深度学习与对齐研究的自动化AI研究员。现有公开材料没有给出一套可由外部检验的达标门槛,也没有证明系统已经具备独立提出研究问题、长期规划和稳定验证开放式结论的能力。

截至目前,已经实现的是一项基于内部定义和内部数据的“研究实习生”里程碑。尚待观察的关键变化包括长任务人工介入率是否下降、高层研究规划能否形成可验证能力,以及后续披露能否把智能体运行指标与实际科研成果建立更清晰的联系。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0