新手入门

270亿参数反超前沿模型?Faraday赢的是一项窄任务

|作者: QUASA 编辑团队|2 分钟阅读| 3
270亿参数反超前沿模型?Faraday赢的是一项窄任务

8月22日,TechCrunch的报道 介绍了Inherent此前公布的Faraday实验:这款270亿参数代理在公司自建的Replica评测中超过Claude Opus 4.8和GPT-5.5。这里的“超过”只指有限时间和算力下复现论文结果图,不是通用推理、编码或完整科研能力的排名。

这篇8月22日报道中的Faraday也不是独立完成全部任务的270亿参数模型。它以Qwen3.6-27B为基础,承担实验规划和决策,同时调用GPT-5.5 Codex编写代码、执行实验;标题中的反超因此是专项训练后的代理系统胜过两套前沿代理基线,而非小模型脱离前沿工具后的单模型胜利。

Replica只要求复现一张结果图

Replica任务隐藏论文原始结果图,代理在有限资源下运行实验并重建图表

8月13日提交的研究预印本 显示,Replica包含从100篇论文生成的310项任务,其中242项来自机器学习论文并用于训练,68项来自留出的AI for Science论文;每项任务隐藏一张结果图,代理获得删图后的论文、图注、联网容器和研究软件,在60分钟内使用一块H200 GPU的七分之一MIG切片完成实验。无法按原规模运行时,任务允许提交忠实的缩小版实验。

代理最终提交代码和重建图表,评分不仅考察视觉接近程度,还覆盖论文主张是否得到支持、实现是否忠实、资源使用是否合理,以及是否存在硬编码结果等破坏科研诚信的做法。每项任务以八次评测运行的平均成绩比较系统,因此Replica测量的是受约束的单图复现能力,并不要求从头复现整篇论文。

这一定义排除了标题最容易引发的误读。完成一项Replica任务不等于提出原创研究问题,也不涉及湿实验、完整论文写作或同行评议;即使重建图表成功,也只能说明代理在给定论文和有限资源下找到了较可信的实验路径。

270亿参数描述的是决策层,不是整个系统

Faraday以270亿参数决策层调用GPT-5.5 Codex,并与相同预算下的独立前沿代理比较

Inherent的研究说明 称,Faraday通过长时程强化学习从Qwen3.6-27B后训练而来,训练的大部分阶段使用GPT-5.4 mini作为编码工具,后期训练和正式评测改用GPT-5.5 Codex;Claude Opus 4.8和GPT-5.5基线则分别运行在Claude Code与Codex中,并采用extra-high思考强度。

这种设置比较的不是三个裸模型。Faraday是“专项训练的270亿参数决策层加GPT-5.5 Codex”,负责决定做什么实验、何时改变路线以及如何分配计算资源;GPT-5.5基线则让Codex直接处理同一任务。更准确的结论是,小型上层代理经过针对性训练后,能比前沿编码代理单独工作时更有效地组织实验。

GPT-5.5还承担了另一角色:自动裁判会检查任务量表、完整交互轨迹、代码、生成图表和原论文标准图,并可重新执行代码。Claude Opus 4.7用于生成逐任务评分量表。这些模型既参与被测系统或基线,也进入评分流程,使结果必须连同整套配置理解。

领先数字来自Inherent自己的评测闭环

按论文报告的自动裁判成绩,Faraday在73%的训练分布内任务和60%的留出任务上同时超过Claude与Codex;留出集平均分比Claude高6%,比Codex高8%。这些数字支持“Faraday在Replica配置中领先”,却不能据此排列三者在通用科研或综合智能上的名次。

研究团队用20名在读或已毕业博士提供的117次排序检验裁判。逐任务量表裁判与人类排序的Kendall相关系数为0.19,高于固定提示裁判的0.15,但也明显低于两名人类之间的0.30,说明科研质量判断本身存在分歧,自动评分与专家意见的一致程度仍然有限。

另一项人工比较只挑选自动裁判认为Faraday优势明显的案例;在41次比较中,人类有29次把Faraday排在两个基线之前。这个抽样能检查裁判识别出的优势是否真实可见,却不能估算全部310项任务中人类总体偏好Faraday的比例。

公司自测不能外推为全面科研领先

第三方使用不同裁判重新运行Replica任务,以检验Faraday公司自测结果

Replica、逐任务量表、自动裁判和Faraday都由Inherent设计,论文目前是arXiv v1预印本。统一预算使内部比较具有可读性,但同一个团队同时定义任务、训练参赛系统并选择评分方式,也意味着排名是否能在不同裁判、代理框架和独立任务集上保持不变,仍是开放问题。

论文自身也承认,Faraday未能复现若干作者认为原始结果严谨可信的任务,并明确表示这些失败不能反过来证明原论文存在根本问题。它展示的是在强约束环境里重建既有结果的能力,而不是发现新知识已经得到验证。

对模型训练策略而言,真正清晰的信号是分层:较小模型可以专门学习实验判断,再调度更强的编码工具。但“270亿参数”并不代表完整系统的参数量或端到端成本,因为训练、八次重复运行、GPU使用和GPT-5.5调用都在这一数字之外。

目前能够成立的结论仍然很窄:Faraday在Inherent设定并评分的Replica论文图表复现任务上领先两套前沿代理基线。要把这项成绩扩展为更广泛的科研能力证据,还需要第三方复跑任务、替换自动裁判,并在独立任务集上测试同一系统配置。

分享:

订阅我们的新闻通讯

将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。

0