首页AI 资讯OpenAI 搁置 Astra 发布:首个被评「关键级」网络攻击能力的模型意味着什么
OpenAI 搁置 Astra 发布:首个被评「关键级」网络攻击能力的模型意味着什么 封面
技术前沿2026-08-089 分钟

OpenAI 搁置 Astra 发布:首个被评「关键级」网络攻击能力的模型意味着什么

据路透社报道,OpenAI 内部评估显示下一代模型 Astra 在智能体编程与网络安全任务上进展显著,无法排除其达到《准备框架》中「关键级」网络攻击能力,因此暂停部分研发并扩大安全测试。这是 OpenAI 首款网络安全风险评级为关键的模型。

OpenAIAstraAI 安全网络安全智能体零日漏洞准备框架

核心结论

Astra 是 OpenAI 首款网络安全风险评级为「关键级」的模型,核心风险是自主零日利用与端到端攻击链

事件标志着前沿模型安全评估从「审查输出」转向「审查能力」,发布前治理成为头部厂商的新门槛

「关键级」是内部评估结论而非监管定性,具体测试方法与时间表尚未公开

对比判断表

风险等级含义OpenAI 通常采取的缓解动作
低(Low)日常使用场景,风险可接受常规部署,持续监控
中(Medium)存在有限风险,需部分控制限制部分能力,增加评估
高(High)可能造成显著危害严格限制部署,红队测试
关键(Critical)可能导致灾难性影响(本次 Astra 网络安全维度)暂停研发/发布,政府与第三方联合测试

落地检查清单

以 OpenAI 官方声明和路透社原始报道为准,区分事实与推测
理解「关键级」是内部风险评估结论,不是监管或法律定性
区分「模型自身能力」与「模型是否被用于攻击」:OpenAI 已澄清 Astra 未参与 Hugging Face 攻击
关注安全测试的后续公开时间表,判断 Astra 实际发布窗口
评估自己是否构建了面向安全的 Agent 应用,提前适配新的安全规范
在自建系统中补充 AI 工具调用的监控与熔断机制
定期回看准备框架文档更新,跟进风险等级定义变化

一、事件回顾:8 月 6 日至 8 日发生了什么

8 月 6 日晚间(北京时间 8 月 7 日),路透社援引知情人士与 OpenAI 声明独家报道:OpenAI 正在放缓下一代模型 Astra 的发布节奏。8 月 7 日,OpenAI 正式发布声明,确认基于最新内部评估结果,Astra 在「网络安全活动」方面可能达到严重风险级别,公司决定暂停涉及该模型的、不满足强化安全标准的内部工作,并扩大安全测试范围。

据多家媒体报道,最近几天的内部评测显示,Astra 在智能体编程(agentic coding)和网络安全任务上相比前代有明显进步。按照 OpenAI《准备框架》(Preparedness Framework)的评估标准,公司目前无法排除它已经具备「关键级」(Critical)网络安全能力的可能性。这也是 OpenAI 首次有模型在网络安全维度被评到关键级。

OpenAI 同时澄清:这款尚未发布的模型并未参与此前针对 Hugging Face 平台的网络攻击活动。CEO 山姆·奥特曼在声明中表示,Astra 综合性能表现突出,公司将在完善安全防护体系、消除风险隐患后稳步推进公开落地。

二、《准备框架》和「关键级」是什么

OpenAI《准备框架》是其内部用于评估前沿模型风险的分级体系,从低到高依次分为低(Low)、中(Medium)、高(High)、关键(Critical)四个等级。达到高或关键级别时,OpenAI 需要采取与风险匹配的缓解措施,包括限制部署、暂停开发、外部审计等,评估结果也会影响模型能否上线。

本次评估的结论是:Astra 不是「能力很强所以谨慎」,而是「能力可能直接构成网络攻击工具」——这正是《准备框架》里网络安全(cybersecurity)维度的核心关切。OpenAI 的框架文档将网络安全能力列为独立评估维度,与生物威胁、说服力、自主复制等并列。

需要说明的是,「关键级」是 OpenAI 内部风险评估结论,不等同于监管认定或法律定性;它更多是公司对「如果模型被滥用可能造成多大危害」的内部判断。

三、让 OpenAI 紧张的两项核心能力

据环球网引述 OpenAI 介绍,Astra 的两项高风险能力引发了安全层面的高度关切。第一项是自主漏洞利用:该模型可以在无人工干预的情况下,针对多重安全加固的核心真实系统,自主识别并生成不同危害等级的零日漏洞利用程序。零日漏洞指厂商尚未知晓、没有补丁的漏洞,一旦被武器化,防御方几乎没有应对窗口。

第二项是端到端攻击流程设计:仅凭高层级攻击目标指令(比如「突破某类系统的防线」),Astra 就能独立设计并完整执行全新的端到端网络攻击链路,具备较强的自主渗透能力。这意味着攻击的门槛从「需要安全专家团队」被压缩到「只需提出目标」。

这两项能力组合起来的风险在于:模型不仅能发现漏洞,还能把漏洞串成完整的攻击路径,并且不需要人类在中间环节干预。这正是 OpenAI 决定放慢脚步、升级安全标准的直接原因。

四、OpenAI 具体停掉了什么、加强了什么

OpenAI 同步落地了多层级安全约束机制。第一层是研发流程管控:搭建独立的隔离测试环境,严格限定模型的网络与工具访问权限;对模型权重实施加密防护;增设全天候风险监测体系;实行沙箱隔离运行;同时叫停内部所有未达到全新安全标准的 Astra 相关研发工作。

第二层是全周期动态风险监测:针对 Astra 的全部智能体应用,覆盖训练与评测全阶段,建立高风险行为、对齐失效问题的全域监控体系,通过解析模型思维链路(思维链)提前识别并阻断高危操作。

第三层是多方协同安全测试:主动对接相关政府监管机构与专业 AI 安全机构联合开展模型安全测试,并向第三方合作评测主体统一输出标准化安全管控规范,确保高风险评测全程可控。据 Yahoo Tech 报道,安全测试将包含与政府机构的联合评估。

五、为什么「Agent 化」会把网络安全风险放大

传统大模型只是「建议者」:它给出攻击思路,但执行需要人。Astra 这类具备智能体能力的前沿模型则是「执行者」:它能调用工具、操作环境、迭代尝试,直到达成目标。一旦模型能在真实系统里自主行动,安全风险就从「输出内容风险」升级为「操作后果风险」。

这也是为什么本次评估特别强调「智能体编程和网络安全任务上的进步」:智能体编程让模型会写代码、会调工具,网络安全任务则让模型知道攻击什么、怎么攻击。两者结合,正是自主攻击能力的雏形。

对行业而言,这标志着一个转折点:前沿模型的安全评估,正在从「审查输出」转向「审查能力」。能力本身没有错,但能力评估必须前置到发布之前,而不是等上线后再补救。

六、行业影响:从能力竞赛到安全竞赛

OpenAI 主动放缓旗舰模型发布,给整个行业传递了一个明确信号:前沿模型的竞争维度正在从单一的「能力参数」扩展到「安全治理」。如果头部实验室都开始把关键级能力评估当作发布门槛,那么「先发布、再打补丁」的模式将难以为继。

对监管机构来说,这是一个可参照的案例:企业自主评估、主动停发、政府联合测试,形成了一套「发布前安全治理」的样本。对开发者社区来说,安全测试工具和评估框架(如红队评测、能力评估基准)的需求会显著上升,相关开源项目可能迎来一轮关注。

同时也要看到另一面:关键级能力评估越严格,前沿模型的发布周期就越长,「能力代差」可能被拉大。安全与创新之间的平衡,将是接下来所有前沿模型厂商都要面对的考题。

七、对开发者和安全从业者的启示

对使用 OpenAI API 的开发者:Astra 尚未发布,现有 ChatGPT 与 API 服务不受影响;但如果你正在构建面向安全的 Agent 应用,建议提前关注 OpenAI 安全测试规范的变化,避免模型能力升级后触发新的使用限制。

对安全团队:可以把「模型自主漏洞利用」和「端到端攻击链」作为新的威胁建模输入,提前在自建系统中引入针对 AI 工具调用的监控与熔断机制,而不是等攻击发生后再追溯。

对关注 AI 治理的从业者:建议阅读 OpenAI 准备框架的公开文档,理解四个风险等级与缓解措施的关系;本次事件是一个极好的研究样本,它展示了「能力评估-风险定级-发布决策」在企业内部的完整闭环。

八、尚未解决的问题

目前公开信息仍有几个待解问题:第一,Astra 的关键级评估具体基于哪些测试环境与基准,OpenAI 尚未公开完整方法论;第二,「扩大安全测试」需要多长时间、何时能重新推进发布,没有时间表;第三,如果模型确实具备关键级能力,OpenAI 是否会选择永久限制其某些能力(如安全蒸馏),仍待观察。

此外,行业层面还有一个悬而未决的问题:当「关键级」成为事实标准后,谁来定义它、谁来审计它?如果每个实验室都用自己的框架自评,跨实验室的可比性会非常有限。这是比单次发布延期更值得长期跟踪的话题。

界面与截图

环球网科技关于 OpenAI 搁置 Astra 模型发布的报道
环球网科技(转引路透社)报道:OpenAI 首个网络安全风险评级为「关键级」的模型 Astra

常见问题

Astra 是什么?什么时候发布的?

Astra 是 OpenAI 正在开发的下一代模型,本次事件发生时尚未公开发布。OpenAI 并未公布具体发布时间表,目前已知的是它具备较强的智能体编程与网络安全任务能力,公司正因安全评估结果放缓发布节奏。

「关键级」意味着 Astra 能黑掉一切系统吗?

不是。「关键级」是 OpenAI 内部评估结论,表示公司无法排除该模型具备相当于人类专家的自主网络攻击能力;它不代表模型真的攻破过所有系统,也不代表任何系统都必然失守,而是说风险高到必须启动额外安全措施。

OpenAI 是彻底放弃 Astra 了吗?

不是。OpenAI 的说法是「放缓」和「暂停不满足新安全标准的内部工作」,CEO 奥特曼明确表示会在完善安全防护后稳步推进发布。目前没有公开的发布时间表。

为什么特意澄清与 Hugging Face 攻击无关?

因为媒体报道时间接近,外界容易把两件事联系起来。OpenAI 主动澄清,是为了避免 Astra 被误认为已在实际攻击事件中被使用,同时也是在区分「能力评估」与「实际攻击归因」。

政府机构参与安全测试意味着什么?

意味着关键级能力的评估不再只是企业内部行为:政府与专业 AI 安全机构联合测试,可以让风险定级更有公信力,也为后续可能的监管框架提供了实践样本。对用户来说,这会拉长模型发布周期,但也会提高上线模型的安全下限。

这对正在使用 ChatGPT 或 OpenAI API 的用户有影响吗?

目前没有直接影响:Astra 尚未发布,现有服务照常运行。需要留意的是,OpenAI 对面向安全场景的 Agent 应用可能出台更细的使用规范,长期使用 API 的开发者应关注官方文档更新。

可核验来源

相关工具

相关阅读