创作者经济

Faraday复现论文胜过前沿模型,但它的基准还没被独立复现

|作者: QUASA 编辑团队|2 分钟阅读| 7
Faraday复现论文胜过前沿模型,但它的基准还没被独立复现

8月23日,一篇外部分析将Faraday成绩中的验证缺口推到焦点:这个27B参数科学代理在团队自建的论文图表复现基准Replica中领先Claude Opus 4.8和GPT-5.5的代理配置,但核心比较仍未经过第三方独立重跑。TEXXR对基准的审视 没有找到确认该排名的独立复现实验,也没有列出已完成验证的外部实验室或评测机构。

这一判断针对Inherent于8月14日公布的研究结果,而不是对Faraday能力的全面否定。Inherent的研究说明 把Faraday定义为经长时程强化学习训练、以编码代理为工具的27B科学代理,并宣称它在Replica任务中超过Claude Opus 4.8和GPT-5.5;截至8月23日,可以确认的是作者实验中的受限领先,而非已经独立验证的通用科研优势。

Replica复现的是单张结果图,不是整篇论文

Replica并非让代理下载作者代码后重新运行,也不要求它完整重复一篇论文。每项任务从论文PDF中遮去一张结果图,但保留图注;代理进入预装科研软件的容器环境,可使用互联网、编码工具和受限算力,再根据论文中并不完整的方法描述重建实验与图表。

如果原实验无法在预算内完成,代理需要缩小数据、模型或运行规模,同时保留被检验的核心机制。评分因此不只看图形是否相似,还考察实验深度、能否支持原主张、实现是否忠于论文方法、资源利用以及是否通过硬编码或挑选有利结果走捷径。

这与完整论文复现存在明显边界。传统复现可能覆盖全部数据处理、超参数、消融实验、统计检验和物理设备;Replica的基本单位是一张图及其对应主张,主要面向能够在计算环境中完成的机器学习和AI for Science实验。

310项任务如何产生“胜过前沿模型”的结果

Replica任务从论文中遮去结果图,代理在固定预算内生成代码、运行记录和重建图表

作者提交的技术论文 显示,Replica包含来自100篇论文的310项任务:242项机器学习任务用于训练及分布内评估,68项AI for Science任务作为保留测试集。标准评估给每项任务60分钟和一块H200 GPU的七分之一MIG切片,各配置每项任务运行八次,再按平均成绩比较。

在逐任务rubric评分器下,Faraday在73%的分布内任务和60%的保留任务上超过Claude与Codex基线。保留测试集的平均成绩比Claude高6%、比Codex高8%。这些数字分别描述任务级领先比例和平均分差,不能混写成“总体准确率”,也不代表Faraday在所有科学问题上都优于两款前沿模型。

对照配置决定了标题中的“胜过”应如何理解。Claude Opus 4.8运行于Claude Code框架,GPT-5.5运行于Codex框架;Faraday则作为外层决策代理,同样调用GPT-5.5 Codex执行编码工作。因此,实验比较的是三套代理配置,而不是一个独立27B模型凭自身能力与两个基础模型进行参数规模对决。

27B模型学的是怎样调度编码代理

Faraday负责实验判断并调用编码代理实现和检查论文复现实验

Faraday由Qwen3.6-27B继续训练而来,负责判断要调查什么、怎样把实验压缩到预算内、实现是否真正检验论文主张,以及何时修改或放弃一条路线。编码工作交给外部工具:大部分训练阶段使用GPT-5.4 mini,训练后期和正式评估使用GPT-5.5。

奖励由自动生成的逐任务rubric给出。评分代理可以查看原始“金标准”图、生成图、代码库、运行轨迹和工作区,并对视觉相似度、主张复现、实现忠实度、资源利用及科研诚信五个维度打分;训练阶段还对三次独立评分取平均,并把信用分配到长轨迹中的不同轮次。

这一结构解释了较小外层模型为何可能改善强大编码代理的结果:提升来自科研决策与工程执行的组合,而不是27B模型单独获得了GPT-5.5的编码能力。较早、只使用GPT-5.4 mini训练的检查点在测试时换成GPT-5.5后也得到提升,说明成绩会随工具能力变化。

作者证明了什么,外界还缺什么

Faraday作者基准已有运行和评分结果,独立验证环境尚无确认的重跑结果

作者实验支持的结论是:在Replica规定的任务、资源限制、工具组合和自动评分器下,强化学习后的Faraday配置优于两套前沿代理基线。曲线比较显示,它在分布内几乎所有评分阈值上保持领先,在保留任务上也覆盖大部分阈值范围。

人工研究为评分器提供了有限校准,但没有替代独立复现。全部人类研究共收集20名参与者的117次排序;其中代理对比子研究包含11名参与者的41次排序,在特意选取“自动评分器认为Faraday占优”的结果中,人类有71%的排序把Faraday置于两个基线之上。这个抽样能检验评分偏好是否完全脱离专家判断,却不能证明完整基准不存在任务选择或评测设计偏差。

尚未独立验证的部分是核心排名能否由外部团队重现。独立验证需要重建或取得任务生成规则、被遮图的论文材料、逐任务rubric、评分提示、运行环境、模型与框架版本、重复次数和原始输出;只运行几个示例,或只查看作者给出的汇总图,都不足以确认排名稳定。

不能外推的部分是自主科学发现能力。复原一张受限预算下的论文图表,不等于独立提出重要问题、完成整套研究计划或验证现实世界实验。Faraday没有操作物理实验设备;所谓“想象复现”也只是改变既有任务的数据集、环境或主张,而且相关自动评分器尚未通过对应的人类研究验证。

基准结论目前停在作者报告阶段

现有公开证据足以支持标题的前半句,但必须带上实验边界:Faraday配置在Replica中胜过了Claude Opus 4.8和GPT-5.5的对照配置。它展示的是外层科研判断模型能够改善编码代理在受限复现任务中的表现,而不是小模型全面压倒前沿模型。

标题的后半句仍是这项工作的关键状态:截至8月23日,核心基准没有公开的第三方独立复现结果。下一项能改变结论的证据,应是外部团队按预先确定的协议重跑任务、评分器和对照配置,并公开足以解释差异的原始输出;在此之前,Faraday的领先仍属于作者报告的基准成绩。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0