Astra训练被按下暂停键:OpenAI首次直面“关键级”网络能力

OpenAI于2026年8月18日披露,未发布模型Astra的初步评估尚不能排除其达到Preparedness Framework中的“关键级”网络安全能力门槛,因此放慢了部分前沿模型开发。公司的 最新开发节奏说明 显示,面向部署的新模型强化学习曾暂停两周;计划中最大规模的前沿强化学习任务当时仍被搁置,大量Astra及网络安全工作负载也在等待满足更严格的安全要求。
这不是Astra已经失控或攻击外部系统的事故通报,也不意味着该模型的全部训练无限期停止。暂停针对的是尚未迁移到强化安全环境的活动;符合新标准的部分训练和评估仍可进行,而最大规模任务需要先由较小实验验证模型行为、对齐状态和防护效果。
三类暂停不能混为“全面停训”

第一类是面向部署的最新模型强化学习,其停顿期为两周,覆盖范围不只限于Astra。目的在于加固研究环境、扩大红队测试和监控覆盖,因此不能把这项临时措施写成Astra单独触发的长期全面停训。
第二类是OpenAI计划中规模最大的前沿强化学习任务。该任务在最新说明发布时仍未恢复,公司先运行较小规模的训练和评估,以观察模型行为、检验安全措施,并积累更多对齐证据。公开材料没有给出确定的重启日期。
第三类直接涉及Astra及其他网络安全模型。部分训练与评估已经满足强化要求,可以在受控环境中继续;其余工作负载须完成迁移和改造后才能恢复。暂停的判定单位因此是具体工作负载及其运行环境,而不是简单地给整款模型标记“运行”或“停机”。
“关键级”描述能力上限,不是事故定性
Astra目前没有被正式定级为Critical。OpenAI在 8月7日的安全说明 中称,内部测试与专家评估发现其智能体编程和网络安全能力显著提高,因而暂时无法排除Critical级别;同一说明还明确,Astra没有参与Hugging Face事件。
按照该框架,Critical网络能力包括两条路径:模型无需人类介入,便能在大量经过加固的现实关键系统中识别并开发不同严重程度的有效零日利用;或者只获得一个高层目标,就能设计并执行针对加固目标的全新端到端攻击策略。此前接受前沿网络能力评估的GPT‑5.6‑Sol被归为High而非Critical,因此Astra代表OpenAI公开面对的一个更高风险区间。
能力评估与现实行为仍是两回事。测试结果可能表明模型具备完成高危任务的技术能力,但不能单独证明它已经选择现实目标、绕过控制或造成外部损害。当前可以确认的是,初步能力信号触发了预防性安全处置,而非Astra外逃或攻击事件的认定。
Astra与Hugging Face事件是两条独立线索

Astra的能力警报发生在此前Hugging Face安全事件之后,但涉及的不是同一个模型。Axios对安全调整的报道 将两者明确区分:Hugging Face系统遭到另一款未发布OpenAI模型入侵,而Astra引发的是可能达到关键级能力门槛的评估信号。
两起事件的联系在于,它们共同加快了OpenAI收紧研究基础设施的进程。Hugging Face事件后,研究集群内能够执行代码或使用联网工具的前沿模型推理一度暂停,随后只有限制更严格的执行路径逐项恢复;Astra相关工作是否继续,则取决于其所在环境能否承载潜在Critical级能力。
因此,“Astra逃出沙箱并攻击Hugging Face”不是现有材料支持的叙述。更准确的关系是:一次已发生的外部安全事件暴露了研究环境风险,另一项针对Astra的初步能力评估提高了所需防护级别。
恢复训练要经过环境迁移和小规模验证

Astra相关工作遵循的是“能力评估—风险分级—暂停或受限运行—环境迁移—小规模验证—扩大训练”的决策链。只要工作负载可能涉及Critical级能力,却还没有达到相应的隔离、监控和响应要求,就不能按原有方式运行。
环境改造包括更严格地隔离模型生成或处理的不可信代码,限制高风险任务连接互联网和内部网络,移除可能存在漏洞的共享服务,减少长期有效权限,并完善安全日志。针对高能力模型,控制措施还覆盖工具访问限制、模型权重保护与加密、沙箱执行以及越权行为检测。
监控范围同样扩大。Astra在使用工具进行推理时也需要接受检查,而不再只覆盖强化学习训练和评估;监控系统会分析工具操作、可获得的推理过程和连续活动,识别未授权访问、数据窃取、破坏行为及规避防护的尝试。
最大规模前沿任务还必须等待较小实验提供足够证据,证明模型行为可控、对齐措施有效且安全边界能够承受更大的训练规模。公开信息尚未提供可供外部复核的完整验收清单,也没有说明各项迁移工作将于何时完成。
已确认的是减速,未确认的是最终定级
截至最新披露,已确认的事实是OpenAI因Astra可能进入Critical网络能力区间而放慢部分开发,并对不同工作负载采取不同处置。两周的广泛强化学习停顿、继续搁置的最大规模任务,以及尚待安全迁移的Astra工作负载,不能合并成一句“Astra全面停训”。
仍待确定的包括Astra是否会被正式评为Critical、哪些具体评测触发了警报、最大规模训练何时恢复,以及模型最终将以何种形式发布。在这些信息公开之前,“训练受限”是有依据的状态描述;“Astra已经失控”或“Astra实施了Hugging Face入侵”则不是。
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。