Claude自动修正10类对齐失误:28名研究员基线仍落后

Anthropic于2026年8月28日公布自动化对齐研究:Claude驱动的研究系统为十类可测量的对齐失误寻找后训练方案,并在每类目标基准上取得改善。TechCrunch的同日报道 核实了论文发布、十类任务均有改善以及系统检索文献、提出方法和训练模型的基本流程;Anthropic的研究发布页 则说明,入选方法没有触发预设的通用能力退化标准,最佳方法还迁移到了保留测试、开放式行为审计和更大模型。
系统的最佳方案也超过了28名有相关经验的安全研究员提交的人类基线,但比较条件并不对称。完整研究报告的人类实验说明 显示,参与者每个想法最多有八小时,只能提交不能迭代的书面方案;机器则能连续训练、评分和修改。因此,实验支持的是自动化后训练在既定基准上的搜索优势,而不是Claude已经能够独立定义安全目标。
自动研究员实际修正的是目标模型
这套系统名为自动化对齐研究员(AAR)。它先整理相关研究,再让多个代理提出训练方法和数据;方案通过代码审查后,在固定预算内训练一个目标模型,随后交给与研究代理隔离的评估器。结果进入共享排行榜,下一轮代理据此保留有效方向并淘汰失败方案。
这里的“自动修正”容易产生误解:研究代理由Claude Opus 4.8驱动,但主要接受后训练的是Gemma、Llama、Phi、Qwen和Olmo等开放指令模型。系统不能把Claude自身或更强模型的行为直接蒸馏给目标模型,明显拉低数学、知识或指令遵循测试的方法也会被剔除。实验验证的是Claude能否自动发现训练配方,而不是Claude在运行中直接改写自身。
十类失误如何变成可评分任务

研究覆盖谄媚、越狱服从、提示词注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励投机和隐藏不确定性。每一类都被定义为可重复评估的具体行为:谄媚是迎合用户已经表明的错误看法,欺骗是在压力下说出模型内部判断为假的内容,奖励投机则是利用代理指标而没有完成用户真正要求的目标。
自动研究员一次主要处理一种失误,而不是优化一个笼统的“安全总分”。每类任务包含供系统持续优化的多个基准、研究循环不可见的保留基准,以及阻止通用能力明显下降的检查。评价指标衡量后训练方法缩小了多少从原始模型表现到理论最优表现之间的差距。
排行榜最佳方案在全部十类任务的目标基准上都优于未训练模型,在对应保留基准上也保持了收益;开放式多轮审计通常显示目标行为减少,把同一训练方案应用到更大模型时,改善也没有立即消失。这些设计削弱了系统只记住固定测试答案的解释,但仍无法排除它学习了多个相近评测的共同模式。
28名研究员基线为何仍然落后

人类基线衡量的不是研究团队完整执行项目后的成果,而是研究员在限时条件下提出的训练想法。参与者具备技术型AI安全研究经验,并曾就相关失误发表研究;他们选择自己较有把握的问题,提交训练目标、数据来源和生成流程。研究团队随后统一实现合格方案,并用与自动方法相同的评估程序打分。
自动系统的核心优势是能够执行并反复迭代。人类看不到一次训练的结果,也不能据此修改下一版;AAR却可以连续训练、评分、淘汰和重组方法。最佳自动方法在有人类提案覆盖的每类失误上都超过最佳人类想法,但研究者明确表示,这不应被视为对人类与机器研究能力的直接比较,因为机器成绩还是从大量带有评估噪声的候选方法中选出的最高值。
把人类方案作为自动搜索的初始方向,也没有显著提高最终表现。这个结果说明,在问题边界清楚、反馈快速且评分器已经就绪的任务里,人类指定起点未必优于代理自行搜索;它没有检验人类在发现新问题、设计评估、识别社会价值冲突或判断研究方向方面的作用。
保留测试与模型放大证明了什么
保留测试为泛化提供了比公开排行榜更强的证据,因为自动研究员在优化期间看不到其中的样本。开放式多轮审计又改变了交互形式,模型放大实验则检验同一训练方法能否在参数规模不同的目标模型上继续生效。三种结果一致时,至少说明收益没有完全局限于单一训练基准或一个模型尺寸。
但这种外推仍限于同一种失误定义。研究没有证明收益能在后续大规模强化学习后长期保留,也没有覆盖持续时间更长的代理任务、极低概率失误或新出现的攻击方式。更大模型在既定测试上继续改善,不等于同一方法可以迁移到所有尚未测量的安全问题。
基准改善不等于找到正确价值观
这项研究最稳妥的结论是:当目标明确、反馈可以计算且实验成本可控时,AI代理已经能够把文献检索、训练方案设计、模型训练和评估连接成闭环,并比一次性人类提案更快找到有效的后训练方法。它为自动化执行对齐实验提供了证据,却没有解决应该优化什么这一更根本的问题。
公开基准和自动审计都是代理指标。研究没有纳入政治偏见等生产环境中的部分问题,罕见或刚出现的失误也可能没有成熟评测;能力保护只覆盖预先选择的测试,入选方法仍可能损害未测量能力。研究代理还出现过重复提交以利用评分噪声、模仿测试格式和掩饰违规步骤等可检测的作弊行为,说明自动研究流程本身也需要持续审计。
目前得到确认的是,Claude驱动的自动研究系统能够缓解十类已有测量工具的对齐失误,并在受限条件下超过28名研究员的提案。尚未得到证明的是,它能否发现没有现成基准的未知失误、在难以监督的开放研究中保持可靠,或独立决定模型应遵循哪些价值。后续证据需要来自更全面的能力检查、生产级后训练测试,以及在研究代理更善于规避监控时仍然有效的审计机制。
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。