科技

OpenAI智能体工时已是人类3.1倍,但多数长任务仍需介入

|作者: QUASA 编辑团队|2 分钟阅读
OpenAI智能体工时已是人类3.1倍,但多数长任务仍需介入

OpenAI于2026年9月6日发布的内部研究报告 给出了一组新的自动化指标:截至8月中旬,其研究组织每个人类工作日对应3.1个按八小时折算的智能体工作日;过去半年成功完成、且估计需要人类投入4至8小时的任务中,超过一半至少发生过一次人工介入。报告附录还明确,“研究人员”包括研究基础设施建设、项目管理及其他支持成员,而编码智能体指标覆盖大部分、并非全部使用活动。

这表明编码智能体的累计运行规模已超过人类工时,但不等于研究效率或成果增加了3.1倍,也不意味着较长任务普遍能够无人值守。AI Understanding的独立复核 将这些数字界定为初步内部指标:现有披露没有提供外部审计、绝对任务总量或足以独立验证整体科研进度的数据。

3.1倍计算的是运行时间

OpenAI研究组织并行运行多个编码智能体,机器运行时长快于单个人类工作日累积

“智能体工作日”是投入量,不是成果单位。它把研究组织内编码智能体的累计运行时间折算为标准工作日,再与人类工作日比较。研究人员可以同时启动多个会话,直接启动的智能体还可能派生子智能体,机器时间因此能够并行累积。

这一指标回答的是智能体运行了多久,而不是产生了多少有效代码、可复现实验或能够进入模型训练的研究发现。运行记录本身也不区分一次任务是否需要重试、返工或人工纠偏,因此不能直接转换为节省的人类工时。

统计分母同样影响解读。这里比较的不是编码智能体与狭义“研究科学家”,而是智能体运行时间与整个研究组织成员的工作日;工具快速变化造成的未覆盖活动,又使机器侧数据并不完整。因此,3.1倍适合描述OpenAI内部自动化规模,不能直接用于比较不同实验室的研发生产率。

每日推理金额反映资源投入

截至8月中旬,中位使用者每天的推理用量按公开API价格估算超过600美元,第90百分位使用者超过7000美元。PacketNebula对计价口径的拆解 强调,这些金额是按对外标价换算的资源用量,并非OpenAI的内部边际成本,也不是某款公开“自动化研究员”产品的售价。

推理金额与智能体工时都属于投入指标,只是观察角度不同:前者反映模型调用强度,后者反映任务占用的累计机器时间。两者可以说明研究团队越来越频繁地把工作交给智能体,却不能单独回答实验是否有效、代码返工多少,或一项发现能否改善核心模型。

  • 智能体工时:衡量累计运行规模,会受到并行会话和子智能体影响。
  • 推理金额:按公开API价格估算用量,不等于实际内部支出。
  • 人工介入率:记录成功任务是否至少被干预一次,不表示介入持续多久。
  • 研究产出:需要结合可复现结果、有效实验和模型改进判断,本次披露没有给出统一增幅。

多数4至8小时级成功任务仍有人介入

OpenAI研究智能体的4至8小时级任务在中间步骤暂停,由研究人员检查并修正后继续

标题中的“多数长任务”有严格范围:它只指过去半年成功完成、且估计需要有经验的人类投入4至8小时的任务,并非所有长任务或全部智能体会话。难度依据人类完成同一任务所需时间估算,也不代表智能体连续自主运行了相同时长。

至少一次人工介入不等于任务失败,却说明成功结果并非普遍来自完全无人值守。介入可能涉及补充背景、澄清目标、解决工具或环境问题、修正中间步骤,或者判断结果能否进入后续实验;现有材料没有拆分各类介入的比例,也没有公布相应的人类耗时,因此无法据此计算净节省工时。

成功率图表排除了结果不确定的分类,也排除了会话数或独立用户数不足50的数据点。因而,这只是可判定结果样本的趋势,不能外推为所有内部任务的成功率,更不能把“成功”自动理解为“全程自主完成”。

代码和实验增加,尚不能建立单一因果关系

OpenAI智能体生成代码并运行多轮实验,只有经人工审核的结果才进入后续模型研发流程

OpenAI内部的代码提交速度和每名活跃实验者运行的实验数量都在上升,2026年8月的后者达到自2025年1月开始追踪以来的最高值。与此同时,可用算力较2025年也显著增长,因此智能体采用、代码活动与实验量的同步上升,不能全部归因于Codex或其他编码智能体。

智能体任务已经覆盖研究方向选择、方案设计、构建、运行、分析和沟通等研发环节,但分布并不均匀。研究与基础设施代码仍占主要部分,技术支持和监控任务增长明显,高层规划在输出token中仍只占很小比例。这更像是执行能力扩张,而不是研究议程和价值判断已经交给机器。

科研进展还受任务选择、评估质量、安全检查、实验复现、算力供给以及成果能否整合进核心训练等环节约束。代码和实验增加可以作为中间信号,但只要其他瓶颈没有同步改善,最终研究质量和模型能力就不会按照智能体运行时长同比增长。

“自动化研究实习生”仍是内部能力阶段

“自动化研究实习生”指一种能够在人类指导下完成边界清晰研究任务的内部能力,其中包括熟练研究员可能需要数天处理的工作。它不是已经面向消费者或企业发布的通用自动化研究员;目前没有与这一内部能力对应的公开价格、申请条件或发布日期。

人类仍负责确定研究优先级、判断哪些想法和结果值得继续,并决定系统应扩大运行、暂停还是部署。智能体主要增加可并行执行的编码、实验和基础设施处理能力;涉及研究价值、安全风险或部署后果时,最终判断仍由人作出。

截至目前,可以确认的是OpenAI内部编码智能体的运行规模迅速扩大,而较复杂任务的成功仍经常包含人工监督。判断这种投入是否真正加快科研进展,还需要更完整的任务总量、失败率、返工量、人工介入耗时和可复现成果,以及能够由外部独立检验的方法。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0