云栖大会抛出 Qwen4 与「思考力商品化」;小米 MiMo-V2.6 开源登顶:本周国产模型双信号
9/22 云栖大会披露 Qwen4 已投入训练(后续版本将扩至 5–10 万亿参数)并提出「思考力商品化」;同日小米发布并开源 MiMo-V2.6 系列,登顶 Artificial Analysis 全球开源榜。训练规模竞赛与开源榜单易主同时发生,国产模型的竞争正在从「追平」转向「定标准」。百器AI 未实测,本文区分官方口径与媒体转述。
核心结论
Qwen4「已投入训练」与「5–10 万亿参数」是路线图信息,不是产品发布,不应写进采购决策。
小米 MiMo-V2.6 的 AA 开源榜登顶是第三方评测口径,可比性高于厂商自评,但仍是「别人的考卷」。
国产模型的竞争焦点正从单点能力转向「基础设施 + 生态标准」(思考力商品化、Skills 资源库)。
开源第一梯队的名单本月发生变动,上月做的选型结论值得用新榜单复测。
所有基准与目标均为官方口径,百器AI 未实测,本文不含第一方测试证据。
落地检查清单
信号一:Qwen4 进入训练,参数竞赛重启到 5–10 万亿
【2026-10-03 补充提示】本文提到 Qwen3.8-Max 的榜单表现时,可补充:该模型已于 9 月 2 日升级至 0902 快照版(CodeArena 前端编程 1691 分登顶、价格不变自动切换),属 Qwen4 发布前的 3.8 代收尾强化。详见 /news/qwen3-8-max-0902-snapshot-release。
【2026-10-03 补充提示】本文提到 Qwen3.8-Max 的榜单表现时,可补充:该模型已于 9 月 2 日升级至 0902 快照版(CodeArena 前端编程 1691 分登顶、价格不变自动切换),属 Qwen4 发布前的 3.8 代收尾强化。详见 /news/qwen3-8-max-0902-snapshot-release。
【2026-10-03 补充提示】本文提到 Qwen3.8-Max 的榜单表现时,可补充:该模型已于 9 月 2 日升级至 0902 快照版(CodeArena 前端编程 1691 分登顶、价格不变自动切换),属 Qwen4 发布前的 3.8 代收尾强化。详见 /news/qwen3-8-max-0902-snapshot-release。
【2026-10-03 补充提示】本文提到 Qwen3.8-Max 的榜单表现时,可补充:该模型已于 9 月 2 日升级至 0902 快照版(CodeArena 前端编程 1691 分登顶、价格不变自动切换),属 Qwen4 发布前的 3.8 代收尾强化。详见 /news/qwen3-8-max-0902-snapshot-release。
【2026-10-03 补充提示】本文提到 Qwen3.8-Max 的榜单表现时,可补充:该模型已于 9 月 2 日升级至 0902 快照版(CodeArena 前端编程 1691 分登顶、价格不变自动切换),属 Qwen4 发布前的 3.8 代收尾强化。详见 /news/qwen3-8-max-0902-snapshot-release。
9 月 22 日云栖大会开幕,阿里巴巴 CEO 吴泳铭发表主旨演讲,提出「思考力商品化」:类比工业革命把动力变成商品,AI 正在把思考变成可规模化供给的商品,机器产生的思考总量未来或将达到人类思考总量的 1000 倍以上。
对选型者更有信息量的是模型路线图:官方披露 Qwen3.8-Max 在编程与办公领域表现出色(发布后获 Artificial Analysis Agentic 智能体第一、CodeArena 前端编程第一),而基于下一代架构的 Qwen4 已投入训练,未来 Qwen4.5、Qwen5 等版本参数将扩展至 5–10 万亿。
多模态方面同场披露:Qwen-Image-3.1 有望逼近最强 GPT-Image 系列;Qwen-Audio-3.1 在 ASR、TTS 与 Realtime 三赛道官方称国际第一梯队、国内第一;视频生成模型 Wan3.0 获 Artificial Analysis 文生视频与视频编辑双榜第一。
以上均为大会披露的官方口径。参数规模不等于能力,「5–10 万亿」是训练目标而非成品规格,发布时间未定——引用时应保留这一层不确定。
信号二:小米 MiMo-V2.6 开源登顶 AA 全球开源榜
同日(9/22),小米发布并开源新一代 MiMo-V2.6 系列模型,登顶 Artificial Analysis 全球开源榜——这是小米自研基座模型首次进入全球开源第一梯队。多家媒体(证券时报、界面新闻、新浪科技)做了报道,口径一致。
对用户的直接意义是开源基座的「第一梯队名单」变了:此前这个位置长期由 DeepSeek、Qwen 系把守。榜单口径是 Artificial Analysis 的评测体系,仍是第三方评测而非你的场景实测,但作为横向参考其可比性高于厂商自评。
需要区分的事实层级:AA 榜单为第三方评测(THIRD_PARTY_REPORT);「官方称对标头部闭源模型」为厂商声明(OFFICIAL_CLAIM);百器AI 未实测(无 FIRST_PARTY_TEST)。
两件事叠加:国产模型竞争从「追平」转向「定标准」
把两条新闻放在一起看:阿里在讲「思考力商品化」的生产资料叙事(芯片 + 模型 + 云三基石,目标 2032 年数据中心超 20GW),小米在用一次开源榜单登顶证明自己是基座玩家。前者是基础设施叙事,后者是产品能力叙事,共同点是都在试图定义「下一步比什么」。
同期还有佐证:智谱上线 GLM-5.3-FlashX(官方称最高 200 tokens/s,基于 10 万张国产芯片推理提速)、阶跃星辰 Step 5 Preview 开源(600B MoE 激活 27B)、工信部发文推动建设智能体软件应用商店与 Skills 资源库——模型层、推理层、生态政策层在同两周内密集动作。
对选型者的含义:国产模型的「够用线」在快速上移。如果你上月因为成本或能力选了闭源海外模型,本月值得用开源榜单重测一轮——尤其是高频调用场景,国产开源模型的价格/能力比变化最快。
同样要泼冷水:榜单第一 ≠ 你的场景第一。Agent 能力、中文长文本、特定行业任务的表现差异,只有拿你的真实任务测试才能确认。百器AI 对上述模型均未实测。
常见问题
Qwen4 发布了吗?
没有。9/22 云栖大会披露的是「基于下一代架构的 Qwen4 已投入训练」,未来 Qwen4.5、Qwen5 参数将扩展至 5–10 万亿。这是路线图信息,发布时间未定。
小米 MiMo-V2.6 是什么?
小米 9/22 发布并开源的新一代自研基座模型系列,登顶 Artificial Analysis 全球开源榜。该排名为第三方评测口径,百器AI 未实测。
「思考力商品化」是什么意思?
吴泳铭在云栖大会提出的观点:AI 正在像工业革命的商品化「动力」一样,把思考变成可规模化供给的商品,并提出 AI 芯片、AI 模型、AI 云三大基石。属于厂商战略叙事,不是可执行的技术规格。
国产开源模型现在能替代海外闭源模型吗?
取决于任务与成本结构。榜单显示国产开源在通用能力上已进入第一梯队,且价格优势明显;但特定场景(如复杂编码智能体、长上下文可靠性)需实测确认。百器AI 未做对比实测,无法给出确定结论。