Astra跨过“关键”网络能力线:最强功能不会直接开放

9月1日,WIRED对发布前安排的报道 确认,OpenAI将Astra认定为首个达到该公司“Critical”网络安全能力门槛的模型,并计划只向Daybreak Blue早期访问项目中的特定伙伴开放高级网络能力。
9月3日开始推出的公开版本没有改变这一边界:能获得Astra,不等于能调用评测中展示的完整漏洞发现和利用能力。公开配置会拒绝概念验证利用等高级任务;限制较少的防御能力将通过OpenAI Daybreak逐步扩展,而不是随普通配置直接开放。
“Critical”是公司内部能力门槛

这里的Critical不是法律认定、政府安全等级或通用行业认证,而是OpenAI的Preparedness Framework用于评估前沿模型能力与所需保护措施的内部等级。它衡量的是模型在获得合适工具、访问权限和运行环境后可能达到的能力上限,不是普通产品界面的默认功能清单。
该框架把两类能力列为Critical门槛:模型能够在没有人工介入的情况下,从大量经过加固的现实关键系统中识别零日漏洞并开发可用利用方式;或者只接收高层目标,便能设计并执行针对加固目标的端到端新型攻击策略。Astra的结论来自自动基准、内部测试和专家评估的组合,而不是外部认证机构颁发的证书。
Astra跨线的依据来自漏洞利用评测
Astra正式发布页披露的评测 显示:在未启用生产保护的ExploitBench测试中,Astra得分为100%;针对2026年6月至8月漏洞构建的内部测试包含20个较新的高危V8漏洞,模型在评估中还发现并使用了两个此前未知的零日漏洞。
专家评估给出了比单项分数更直接的依据。Astra在经过加固的浏览器中把未知漏洞组成可逃离沙箱并在宿主机执行命令的利用链,也在加固操作系统中组合多个漏洞,将本地权限从普通用户提升至root。这些结果描述的是关闭生产保护或具备受控高级访问条件时的能力,不代表公开版本会照原样执行相同任务。
能力提升同时放大两条风险路径:恶意使用者可能借模型缩短未知漏洞从发现到利用的时间;具备工具调用能力的代理也可能偏离授权范围,对真实系统采取未经许可的动作。因此,达到门槛带来的直接后果不是全面开放,而是开发、部署和访问环节都需要更强的限制。
能力、风险、访问层级如何对应

这次安排可以用“能力—风险—访问层级—可能误拦”四个维度理解:
- 发现未知漏洞:能力是在真实软件中定位未披露缺陷;潜在风险是压缩零日漏洞的发现周期;公开配置不会默认提供评测中的完整能力;合法研究若接近真实目标,也可能触发限制。
- 构造利用链:能力是把一个或多个缺陷发展为可运行的攻击路径;潜在风险是降低跨越多层防护的门槛;概念验证利用等高级任务在公开版本中会被拒绝;获批防御者的复现工作也可能受到监控。
- 执行多阶段任务:能力是根据高层目标持续规划和调用工具;潜在风险包括代理越出授权范围;系统会检查模型的推理与动作并停止可疑活动;持续时间较长的合法任务也可能被标记。
- 验证和修补漏洞:能力可用于安全代码审查、补丁和防御验证;风险取决于目标授权及输出是否能直接用于攻击;一般防御工作进入公开配置,更敏感的验证通过Daybreak分层开放;两者之间的边界可能产生额外摩擦。
这也解释了“普通版本”和“受信访问”的根本区别:前者是在模型能力之上叠加拒答、分类器和行为监控后的产品形态;后者允许经过审核的防御方在授权目标内完成更多敏感工作,但仍受身份、用途和监控约束。受信访问并不等于撤掉全部护栏。
更严格的控制也会拦住正常任务

OpenAI的9月1日安全说明 承认,监控系统可能把合法活动误判为网络滥用或未经授权的行为,使任务减速、暂停或停止;这还可能影响表面上与网络安全无关的工作以及长时间运行的代理任务。在ChatGPT或Codex中,用户可能需要复核后才能继续;通过API运行时,被暂停的任务会直接停止。
误拦的代价因此不只是一次拒答。长时间分析可能在中途失去连续性,自动化流程需要保存中间状态并处理终止,防御团队也可能无法立即完成漏洞复现。另一方面,如果边界过松,同一套能力又可能帮助未授权使用者开发真实利用方式;分层访问正是在这两类损失之间取舍。
目前可以确认的是,Astra已经达到OpenAI自定义的Critical门槛,公开版本开始推出,但评测中的最强网络能力仍被隔离在普通配置之外。尚未公开的关键信息包括Daybreak高级访问扩展到更多防御方的具体节奏,以及各类保护措施在真实工作中的误拦率;因此,不能只凭“Critical”标签推断普通用户已经获得完整攻击能力。
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。