首页AI 资讯华为 openPangu-2.0 训练栈开源收官:从「开放权重」到「开放全流程」,国产大模型补上最后一块拼图
华为 openPangu-2.0 训练栈开源收官:从「开放权重」到「开放全流程」,国产大模型补上最后一块拼图 封面
技术前沿2026-10-0210 分钟

华为 openPangu-2.0 训练栈开源收官:从「开放权重」到「开放全流程」,国产大模型补上最后一块拼图

9 月 28 日华为开源盘古 openPangu-2.0 的预训练、SFT 代码(openPangu-2.0-Training)与后训练 RL 代码(openPangu-2.0-RL,基于 VERL 生态、支持 GSPO/GRPO),至此 6 月预告的 7 大组件分阶段开源收官——权重、推理代码、训推算子之外,把千亿参数规模上验证过的完整训练管线也交了出去。同一周 Anthropic、OpenAI、Google 三连发全部把最强能力锁进 API 或分阶段分发,华为反向操作。但需要清醒:训练栈针对昇腾原生优化(官方技术报告口径,非昇腾硬件适配性未披露)、全部性能数字无第三方复现、技术报告自认在复杂软件工程任务上与第一梯队仍有差距。百器AI 未实测。

openPangu-2.0华为开源昇腾后训练 RLVERL国产大模型训练框架

核心结论

本次开源的本质是『开放权重 → 开放全流程』:权重解决『能用』,训练管线解决『能造』——RL 代码(含 Agentic RL 后训练)可能是含金量最高的部分,因为它填补了国内开源生态『RLHF 完整实现细节普遍不开放』的空白

昇腾原生绑定是双刃剑:官方 FAQ 的主语是『为业界用好昇腾提供最佳实践参考』,训练栈同时是开源贡献与昇腾获客工具——与华为 9/17『AI 战略核心是算力、硬件变现』的表述严丝合缝(编辑判断)

同一周的结构性镜像:Anthropic(9/28)/ OpenAI(9/29)/ Google(9/30)三连发全部闭源且分发收紧,华为反向交出训练管线——不是先进与落后之分,是『卖智能』与『卖算力生态』两种变现结构的分岔(编辑判断)

华为技术报告自曝短板(复杂软件工程与复杂智能体任务与第一梯队仍有差距;Apex 仅 17.7%、CL-Bench 19.7%)——厂商自曝是采信其强项数据的重要前提,但不能替代第三方复现

跨厂商基准对比的警示:Opus 5.5 的 Terminal-Bench 66.4%、Argon 的 DeepSWE 77.9%、openPangu-2.0-Pro 的 SWE-bench Verified 68.5% 分属三个不同基准与脚手架,任何『谁更强』的横向结论都不成立——各家报各家基准仍是行业现状

对中文用户的现实提醒:没有昇腾算力的个人开发者直接可用性有限;最大受益者是已有昇腾集群的行业客户与国产算力适配团队(编辑判断)

对比判断表

对比维度openPangu-2.0(华为)DeepSeek 开源系Claude / GPT / Gemini 闭源系(同周)
开源范围权重 + 推理代码 + 训推算子 + 预训练/SFT 代码 + 后训练 RL 代码(全流程,9/28 收官)权重 + 技术报告(训练细节部分披露)闭源(API / 分阶段分发)
代表模型参数Pro 505B(激活 18B)/ Flash 92B(激活 6B),512K 上下文V4 系列(站内已核验报道)未披露(Opus 5.5 / GPT-6.1 Sol / Gemini 4 Argon)
后训练 RL 代码开源(openPangu-2.0-RL,VERL 内核,GSPO/GRPO)未完整开源不适用(闭源)
目标硬件昇腾原生优化(官方称训练效率 +30%,媒体转述口径)CUDA 生态为主自有云 / API
许可证Apache-2.0(gitcode 仓库标注)MIT / 自定义(以各仓库为准)不适用
代码基准(厂商口径,不同基准不可横比)SWE-bench Verified 68.5%(Pro Thinking)站内已核验报道未含同口径数字Opus 5.5 FrontierCode 1.1 54.4% / Argon DeepSWE v1.1 77.9%
自述短板复杂软件工程与复杂智能体任务与第一梯队仍有差距(技术报告自认)—Argon:彭博社报道内部员工对编码稳定性有疑问(未经官方证实)
百器AI 实测未实测未实测未实测

落地检查清单

确认你的团队是否已有昇腾算力——这决定本次开源对你的直接可用性(非昇腾硬件适配性官方未披露,UNKNOWN)
行业客户:先在 openPangu-2.0-Training 跑通 SFT 路径,再评估 openPangu-2.0-RL 在自有奖励函数上的 GSPO/GRPO 效果
所有性能预期以自己集群实测为准,不要直接套用技术报告数字(厂商口径 + 无第三方复现)
CUDA 生态团队:训练侧迁移成本与性能损耗需自行验证,暂无官方跨硬件承诺;推理侧可参考 vLLM 昇腾后端支持情况
个人开发者:关注后续基于该训练栈的中小参数复现工作与昇腾外社区适配分支(目前 UNKNOWN)
跟踪四个变量:非昇腾适配进展 / gitcode 仓库 Issue-PR 活跃度(现仅 1 commit)/ 『训练效率 +30%』测试条件 / HF-ModelScope 是否同步
不要把『训练代码开源』误读为『新模型发布』——Flash/Pro 权重 6/30、7/31 已分别开放

发生了什么:9/28 训练栈上线,7 大组件开源收官

2026 年 9 月 28 日,华为宣布开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源上线,开源地址在 Ascend Tribe 开源社区(gitcode.com/ascend-tribe),两个仓库分别为 openPangu-2.0-Training 与 openPangu-2.0-RL,均为 Apache-2.0 许可证(gitcode 仓库页面标注,具体条款以仓库 LICENSE 文件为准)。

先把这次开源放到完整时间线里看。6 月 12 日华为开发者大会 HDC 2026 上,余承东宣布 openPangu 2.0 计划从 6 月 30 日起陆续开源 7 大组件,包括新增开源的预训练代码、后训练代码、训练算子。此后:6 月 30 日开源 92B 参数(激活 6B)的 openPangu-2.0-Flash,含权重、基础推理代码、训推算子;7 月 31 日开源 505B 参数(激活 18B、512K 上下文)的 openPangu-2.0-Pro,含权重、推理代码与技术报告。9 月 28 日训练栈上线后,从权重、推理代码、算子到训练全流程的核心组件分阶段开放完毕——智东西称之为『openPangu-2.0 项目开源收官的关键一步』。

一个容易被误读的点需要先说清楚:本次开源的是训练代码,不是新的模型权重。Flash 与 Pro 的权重分别在 6/30 和 7/31 已经发布。如果你是下载权重的用户,这次事件对你没有直接的新增内容;如果你是想基于盘古做垂直领域二次开发的团队,这次才是重点。

两个仓库各管一段。openPangu-2.0-Training 是面向大规模基础模型训练的统一训练框架(华为官方 FAQ 口径):预训练方面支持大规模无监督语料从头训练、基于已有 Checkpoint 的持续训练、大规模分布式训练与长上下文训练;监督微调方面支持指令对齐、多轮对话与领域数据微调、参数高效微调与多任务训练。openPangu-2.0-RL 是面向昇腾的强化学习加速框架:以开源 RL 框架 VERL 为训练编排内核,通过运行时补丁与昇腾亲和优化,在昇腾集群上完成 Actor(策略模型)、Rollout(样本生成)、Reward(奖励模型)协同训练,支持 GSPO 与 GRPO 后训练——据智东西与 i黑马转述,典型场景包括数学推理的单轮 Rollout 与面向推理的代码生成的多轮 Rollout(ReAct 模式)。

关键变化:从「开放权重」到「开放全流程」,补的是什么空白

每日经济新闻 9 月 29 日的点评把这次开源的定位说得很准:『国产开源大模型正从开放权重走向开放全流程。当海外巨头逐渐把最先进能力锁在 API 背后时,华为选择把训练管线交出去,既是在押注生态厚度,也是在为国产算力找真实应用场景。』

这个判断的背景是:过去两年国内开源生态繁荣,但『开源』绝大多数时候指的是权重 + 基础推理代码。想做垂直领域二次开发的团队拿到的是『训练好的模型』,而不是『把模型训出来的方法』——微调要么用第三方开源训练框架自己适配(常见性能损耗与兼容性问题),要么从零搭建训练体系(对中小团队几乎不可行)。电子发烧友的入驻作者把它称为大模型落地的『最后一块关键拼图』,并指出 RL 代码尤其稀缺:『过去很多开源大模型的 RLHF 能力,都没有开放完整的实现细节』。这两段为第三方观点,非百器AI 结论。

开放训练管线的实际价值在哪里(编辑判断):权重开源解决『能用』,训练管线开源解决『能造』。对一个想在医疗、政务、工业场景做行业模型的客户,能否自定义奖励函数、把模型输出对齐到行业规范,比再多一个通用权重更关键。从这个角度看,RL 代码(含 Agentic RL 后训练能力,官方称『显著提升模型在复杂任务中自主规划与执行的能力』)可能是这次开放里含金量最高的部分。

但也要对『全流程』保持克制的理解:gitcode 两个仓库目前各只有 1 个提交、Star 数各约 18(百器AI 10/2 实测),开源刚上线,Issue 活跃度、社区维护响应、行业实际采用度都还是未知数。『收官』指的是组件发布清单走完,不等于生态已经长出来。

必须正视的双刃剑:昇腾原生绑定

这套训练栈不是为通用硬件写的。gitcode 仓库自述『配套昇腾原生的开源盘古 2.0 系列模型』,官方 FAQ 定位也是『致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考』——注意主语是『用好昇腾』。据智东西转述技术报告,盘古模型针对昇腾算力优化后『昇腾原生训练的训练效率提升了 30%』(该数字为媒体转述口径,测试条件未说明,百器AI 未在技术报告原文中逐字核对)。

把它与华为自己的战略表述放在一起看会更清楚。9 月 17 日华为全联接大会上,副董事长、轮值董事长汪涛宣布华为 AI 战略的核心是算力、坚持硬件变现,同时构建开源开放的算力生态、积极拥抱『百模千态』。开源训练栈与这个战略严丝合缝:行业客户想用盘古全流程代码训练自有模型,门槛最低的路径就是昇腾集群(编辑判断,基于官方战略表述与仓库自述,非官方直接陈述)。

对用户的实际含义(编辑判断):如果你已经有昇腾算力——这是直接可用的完整方案;如果你在 CUDA 生态上——训练栈在非昇腾硬件上的可用性与性能官方未披露(UNKNOWN),第三方框架跨硬件适配的常见性能损耗问题(电子发烧友观点)在这里同样可能出现,迁移前需要自行验证;如果你是个人开发者——万亿参数级训练本身非个人可负担,本次开源的直接受益者是行业客户与做国产算力适配的团队。

另一个公平的对照是:昇腾生态同时也在向外兼容。站内 10/1 核验批次确认 vLLM 已支持昇腾(Ascend)后端——开源推理生态与昇腾的对接是双向的,不是单向锁定。

性能与短板:官方口径的强项,与技术报告自己承认的差距

先说官方口径的强项(全部来自华为技术报告《openPangu-2.0: Towards Reliable and Efficient Agentic Reasoning》表 5,统一 top-p=0.8、temperature=1.0,无第三方复现):openPangu-2.0-Pro(Thinking 模式)SWE-bench Verified 68.5%、LiveCodeBench V6 85.7%、GPQA-Diamond 87.9%、AIME 2026 95.4%、BrowseComp 65.7%、GDPVal 74.9%;Flash(Thinking)IFEval 95.9%、TAU2-Bench 88.0%。推理性能(昇腾 910C、128K 上下文):Flash TPOT 最低 5.63ms、TPOT=15ms 时单 NPU 吞吐 1846 tokens/s;Pro 超低时延 9.55ms、TPOT=20ms 时 1326 tokens/s。

更值得引用的是技术报告自己写明的短板:『在基础代码问答 DeepCodeBench 和功能实现 FeatBench 上表现不错,但处理复杂、真实世界软件工程流程时,与顶级模型仍存在明显差距』;『在复杂智能体任务上,与第一梯队模型相比仍存在一定差距』。具体数字上:Apex 基准 Pro Thinking 仅 17.7%(Flash Thinking 1.0%),HLE 27.1%,CL-Bench 19.7%——这些绝对值都不高。厂商在技术报告里自曝短板并不常见,这是本文采信其强项数据的重要前提,但『自曝』不能替代第三方复现。

与同周海外发布的对照要格外小心:站内已核验 Claude Opus 5.5 在 Terminal-Bench 4.0 得 66.4%、FrontierCode 1.1 得 54.4%(Anthropic 口径),Gemini 4 Argon 在 DeepSWE v1.1 得 77.9%(谷歌口径),openPangu-2.0-Pro 在 SWE-bench Verified 得 68.5%(华为口径)——三个数字分属三个不同基准,测试脚手架、题目集、统计口径都不同,任何『谁更强』的横向结论都不成立。各家报各家基准,这是当前行业的现状,也是站内一以贯之的立场。

架构层面的信息(官方技术报告口径):Pro 为 505B 总参数、每 token 激活约 18B 的 MoE,384 个路由专家每次激活 8 个,512K 上下文,训练数据约 34T tokens;注意力采用 DSA(DeepSeek 稀疏注意力)+ SWA 逐层混合(配比 1:2),残差流升级为 4 支流 mHC,配 3 头 MTP 自投机解码与 Muon 优化器;后训练走 SFT → 四域(推理/通用/智能体/代码)并行 RL 专家训练 → 多专家 On-Policy 蒸馏三阶段。这些设计全部围绕长上下文智能体任务与昇腾硬件的协同优化展开。

同一周的镜像:海外锁能力,华为交管线

把 9 月最后一周的行业动作并排看,会发现一个结构性的对照。9/28 Anthropic 发布 Claude Sonnet 5.5(维持 $2/$10,单任务成本最高降 30%,站内 9/30 已发布解读);9/29 OpenAI DevDay 发布 GPT-6.1 Sol 与全天候智能体 Dots(GPT-6.1 Astra 因安全测试问题暂缓);9/30 谷歌发布 Gemini 4 Argon(先给 Fairwind 网络安全防御者、商业开放无日期,站内 10/1 已发布解读)——三家全部闭源,且分发策略一个比一个收紧。

华为在同一周做的正好是反向动作:把训练管线交出去。每经的点评(『当海外巨头逐渐把最先进能力锁在 API 背后时』)点破的正是这个对照。

但两条路线不是简单的先进与落后。海外三家的商业化模式是卖智能(API 调用、订阅),模型能力本身就是收入来源,锁能力符合其商业利益;华为的战略核心是算力与硬件变现(官方 9/17 表述),模型与训练栈开源是给算力生态引流的手段。一个把『智能』当产品,一个把『智能』当生态基础设施——判断哪条路线更可持续,取决于你相信哪一种变现结构(编辑判断)。

对中文用户的选型含义(编辑判断):如果你的场景需要今天最强的模型能力,闭源 API(或等 Argon 开放)仍是现实选项,开源训练栈不改变这一点;如果你的场景是『要在自有数据、自有算力上长期迭代行业模型』,openPangu-2.0 的全流程开放第一次让这个路径在昇腾生态上有完整官方参照——这比又一个新权重的意义更长期。

选型建议与跟踪清单

已有昇腾集群的行业客户与国产算力适配团队:这是本次开源的直接受益者。建议先在开源仓库跑通 SFT 与单轮 Rollout 路径,再评估 GSPO/GRPO 在自有奖励函数上的效果;所有性能预期以自己集群的实测为准,不要直接套用技术报告数字(厂商口径,无第三方复现)。

CUDA 生态上的团队:训练栈在非昇腾硬件上的可用性与性能官方未披露(UNKNOWN),迁移成本与性能损耗需自行验证;推理侧可参考 vLLM 的昇腾后端支持情况评估推理路径,训练侧暂无官方跨硬件承诺。

个人开发者与中小团队:92B/505B 参数的训练与微调对算力的要求决定了直接可用性有限;更现实的关注点是后续是否出现基于该训练栈的中小参数复现工作、以及社区贡献的昇腾外适配分支(目前 UNKNOWN)。

需要跟踪的四个变量:①训练栈在非昇腾硬件上的社区适配进展;②gitcode 仓库的 Issue/PR 活跃度与华为维护响应(目前仅 1 commit,Star 约 18);③『训练效率提升 30%』的测试条件是否在后续文档中披露;④是否同步上线 Hugging Face / ModelScope 等平台(权重已在 HF 有 openpangu 组织,训练栈本次未见同步公告)。

以上均为基于公开信息的编辑判断(EDITORIAL)。百器AI 未对 openPangu-2.0 训练栈做任何实测——未在昇腾集群上跑通训练流程,未验证 RL 框架吞吐,本文所有性能数字均来自华为官方技术报告或已标注的媒体转述。

常见问题

华为这次开源的是什么?是新模型吗?

不是新模型。9 月 28 日开源的是 openPangu-2.0 的预训练、SFT 代码(openPangu-2.0-Training)与后训练 RL 代码(openPangu-2.0-RL)。模型权重早在 6 月 30 日(Flash 92B)和 7 月 31 日(Pro 505B)就已开放。本次事件的意义是训练管线补齐——从权重、推理代码、训推算子到训练代码的全流程组件至此收官。百器AI 于 10/2 核验并发布本文。

openPangu-2.0-RL 支持什么算法?能做什么?

据华为官方 FAQ 与智东西、i黑马转述:它以开源强化学习框架 VERL 为训练编排内核,在昇腾集群上完成 Actor(策略模型)/Rollout(样本生成)/Reward(奖励模型)协同训练,支持 GSPO(组序列策略优化)与 GRPO(组相对策略优化)后训练;官方称支持高精度、高效的 Agentic RL 后训练,典型场景包括数学推理的单轮 Rollout 与面向推理的代码生成的多轮 Rollout(ReAct 模式)。以上为官方与媒体转述口径,百器AI 未实测。

这套训练代码能在 NVIDIA 显卡上跑吗?

未知(UNKNOWN)。gitcode 仓库自述『配套昇腾原生的开源盘古 2.0 系列模型』,官方 FAQ 的定位也是『为业界用好昇腾提供最佳实践参考』——训练栈是昇腾原生优化的。官方未披露在 CUDA/ROCm 硬件上的可用性与性能;第三方框架跨硬件适配常见的性能损耗问题在这里同样可能出现。CUDA 生态团队迁移前需自行验证。

openPangu-2.0 的性能到底怎么样?

按华为官方技术报告(厂商口径,无第三方复现):Pro(Thinking)SWE-bench Verified 68.5%、LiveCodeBench V6 85.7%、GPQA-Diamond 87.9%、AIME 2026 95.4%。同时技术报告自己承认:在复杂、真实世界软件工程流程与复杂智能体任务上,与第一梯队模型仍有明显差距(Apex 17.7%、CL-Bench 19.7%)。强项与短板都来自同一份官方报告;第三方独立评测出现前,不建议据此做选型决策。

和 DeepSeek、Qwen 等国内开源模型比,华为这次有什么不同?

范围不同。DeepSeek、Qwen、Kimi K3 等的『开源』主体是权重(+技术报告,训练细节部分披露);openPangu-2.0 在权重之外把预训练/SFT/后训练 RL 代码也开放了——每日经济新闻称之为从『开放权重』走向『开放全流程』。但 openPangu 训练栈与昇腾硬件强绑定,而 DeepSeek/Qwen 生态主要在 CUDA 上;两条路线各自服务不同算力生态,不构成简单替代关系(编辑判断)。

个人开发者现在能用它做什么?

直接可用性有限。92B/505B 参数的训练与微调对算力要求高,训练栈又是昇腾原生——没有昇腾集群的个人开发者能做的主要是读代码、学研究实现(DSA+SWA 混合注意力、mHC、Muon、四域并行 RL 专家训练等设计都有官方技术报告对应)。更实际的关注点是后续社区是否出现基于该训练栈的中小参数复现与昇腾外适配(目前 UNKNOWN)。

华为为什么要把训练代码开源?

官方口径是『通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考,助力打造 Agent 时代强大的智能底座』。结合 9/17 全联接大会汪涛宣布的『AI 战略核心是算力、坚持硬件变现』,可以理解为:训练栈开源是给昇腾算力生态引流——行业客户用全流程官方代码在昇腾上训练自有模型门槛最低。这是编辑判断(基于官方战略表述),非华为官方直接陈述。

可核验来源

相关工具

相关阅读

技术前沿

ChatGPT 全量推送 GPT-6 + Intelligent UI:聊天框从「对话框」变成「即时应用容器」

OpenAI 于 10 月 7 日起把 GPT-6 Sol 推送给 ChatGPT Plus/Pro/Business/Enterprise,10 月 8 日把 GPT-6 Luna 推送给 Free/Go 用户——这是 GPT-6 第一次进入 ChatGPT 主聊天默认模型。更大的变化是同步上线的 Intelligent UI:模型回答不再只是文字,会在文本里嵌入可点击按钮、表单、图表、计算器乃至小游戏,组件随生成流式呈现。官方覆盖每周 12 亿+周活用户。百器AI 未实测,本文区分官方口径、Deployment Safety Hub 报告与第三方转述,并提示工作区版 / Work / Codex 不在本次切换范围内。

技术前沿

Qwen3.8-Max-0902 快照版解析:CodeArena 前端编程登顶之外,快照机制才是开发者更该关注的事

9 月 2 日阿里将旗舰模型 Qwen3.8-Max 升级至 0902 快照版:官方围绕编程与专业办公后训练,第三方榜单 CodeArena 中提升 22 分至 1691 分登顶前端编程总榜,每百万 Tokens 综合均价约 5 美元(榜单口径),9 月 5 日起 qwen3.8-max 指针自动切换且价格不变。本文拆解「榜单第一」的实际含义、快照锁定对生产系统的意义,以及与 Qwen4 路线图的关系。百器AI 未实测,全文基于官方口径与三家媒体交叉核验。

技术前沿

云栖大会抛出 Qwen4 与「思考力商品化」;小米 MiMo-V2.6 开源登顶:本周国产模型双信号

9/22 云栖大会披露 Qwen4 已投入训练(后续版本将扩至 5–10 万亿参数)并提出「思考力商品化」;同日小米发布并开源 MiMo-V2.6 系列,登顶 Artificial Analysis 全球开源榜。训练规模竞赛与开源榜单易主同时发生,国产模型的竞争正在从「追平」转向「定标准」。百器AI 未实测,本文区分官方口径与媒体转述。