首页AI 资讯斑马智能发布 AutoOmni 2.0-23B-A3B:23B 端侧大模型上车,「智能密度」比参数更值得关注
斑马智能发布 AutoOmni 2.0-23B-A3B:23B 端侧大模型上车,「智能密度」比参数更值得关注 封面
产品发布2026-09-248 分钟

斑马智能发布 AutoOmni 2.0-23B-A3B:23B 端侧大模型上车,「智能密度」比参数更值得关注

9/23 云栖大会期间,斑马智能发布首个全模态端侧大模型 AutoOmni 2.0-23B-A3B:MoE 架构总参 23B、激活约 3B,官方称普通任务堪比 10 倍参数云模型、复杂任务达其 80%–90%;已合作 10 家芯片企业、8 路并发、推理加速 5–6 倍。端侧大模型正从「能不能上车」走向「能不能成为交互入口」。百器AI 未实测,本文全部为发布会披露口径。

斑马智能AutoOmni 2.0端侧大模型智能座舱MoE云栖大会

核心结论

AutoOmni 2.0 的关键是 MoE「存大激活小」:23B 总参/3B 激活让端侧算力能承载旗舰级模型。

端侧的核心卖点被重新定义为「始终在场」的交互范式,而非省 token 或时延——这是理解车端 Agent 商业逻辑的关键。

「68% 车企覆盖 / 63% 端模型上车选择斑马」均为厂商口径,引用需标注。

所有性能数字无第三方复现,端侧大模型「真风口」判断需等实车大规模验证。

智能汽车作为「具身智能中试场」是叙事框架:车足够难、生态足够复杂,练出的能力有外溢可能。

落地检查清单

把发布会数字当「厂商声明」而非「评测结论」——等第三方复测
确认你的座舱芯片在 AutoOmni 合作名单(官方称 10 家芯片企业)内
评估你的场景收益:高频模糊交互收益大,单次精确问答收益小
隐私合规场景(数据不出车)是端侧的最强理由,云端方案无法替代
关注实车上车名单与交付后的独立评测,而非发布会演示

发生了什么:首个全模态端侧大模型 + 座舱协作智能体

9 月 23 日云栖大会期间,斑马智能发布新一代全模态端侧大模型 AutoOmni 2.0-23B-A3B,并同步亮相全域 AutoClaw 2.0 智舱协作智能体实车方案。

核心参数:MoE 混合专家架构,总参数量 23B、激活参数约 3B。斑马智能首席产品官蔡明解释,MoE 的特点是「存得大、激活得少」——对算力要求不苛刻,但对存储空间要求更高。官方称在有限车端算力下,模型可获得更强的泛化理解能力。

官方给出的能力口径:普通任务能力堪比 10 倍参数量的云模型,复杂任务处理能力相当于 10 倍参数云模型的 80%–90%。相比目前主流上车的 4B、7B 端侧模型,23B MoE 带来的不是参数翻倍,而是「智能密度」提升。

工程侧披露:已合作国内外 10 家芯片企业,软硬协同支持 8 路以上多任务稳定并发,大模型推理加速 5–6 倍,量化保真度超 99%,少占用运行内存 50% 以上(官方口径,无第三方复现)。

为什么端侧值得重新关注:从「快省隐私」到「始终在场」

行业讲端侧模型的好处通常是「时延低、隐私好、省云端 token」,但斑马把核心价值定位在交互范式:全车全时免唤醒 + 上下文记忆。蔡明用「服务员」比喻——云端唤醒词像包间外的服务员,「喊了还不一定来」;端侧 Always-on 则像包房专人服务,一直在场、一直听。

这组判断对普通用户的实际含义:如果你的场景是座舱高频交互(导航、车控、多媒体的模糊意图与多任务),端侧模型的价值不在「跑分」,而在「不叫不醒」到「始终在场」的体验差异;如果你的场景是精确的单次问答,端侧与云端的差距不明显。

隐私层面官方口径明确:端侧让「看到、听到、记到的」不出车。数据不出车既是用户卖点,也是车企愿意开放更多车控权限的前提——这是端侧模型在车企侧真正的商业杠杆。

商业模式上有增量信息:斑马首席战略官邢悦透露,已有接近 20% 收益来自后续服务与内容运营,未来这一比例可能提升到 50%。

选型视角:端侧 23B 意味着什么,边界在哪

对车企/出行产品团队:AutoOmni 2.0 的意义是「同一颗国产舱驾芯片上装下 23B 全模态模型」,端侧算力门槛由 MoE + 量化压缩解决。官方称腾势、智己、神行者、红旗等车型已选择斑马元神 AI,元神 AI 对主流车企服务覆盖 68%、端模型上车企业中 63% 选择斑马(厂商口径)。

对比参考:主流端侧上车模型仍是 4B/7B 档,AutoOmni 2.0 的差异化在「智能密度」而非绝对参数。23B 相对 7B 的实际体验差距,目前只有厂商演示可参考,没有独立横评。

必须说明的边界:①所有性能数字(80%–90%、5–6 倍加速、99% 保真度)均为发布会披露口径,无第三方复现;②「首个全模态端侧大模型」为厂商表述;③斑马已从 AutoOmni 向 EdgeOmni 演进、智能汽车是「具身智能最大中试场」等属于战略叙事;④百器AI 未实测任何端侧部署。

最诚实的结论:这发布值得追踪,但「端侧 AI 成为真风口」的判断(环球网标题设问)还需实车大规模交付后的独立验证。建议关注后续实车评测与车企官宣上车名单,而非发布会数据。

常见问题

AutoOmni 2.0-23B-A3B 是什么?

斑马智能 9 月 23 日云栖大会期间发布的全模态端侧大模型:MoE 架构总参 23B、激活约 3B,面向智能座舱场景,官方称普通任务堪比 10 倍参数云模型。同期还有 AutoClaw 2.0 智舱协作智能体实车方案。

23B 模型能在车端跑得动吗?

官方口径是:MoE「存得大、激活得少」,对算力要求不苛刻、对存储要求更高;配合量化(保真度超 99%)与 10 家芯片企业的软硬协同,可在单颗国产舱驾芯片上实时推理。实际表现需等实车独立评测,百器AI 未实测。

和 4B/7B 端侧模型比强多少?

厂商口径:普通任务堪比 10 倍参数云模型、复杂任务达其 80%–90%;但没有与具体 4B/7B 模型的同条件横评数据。参数优势能否转化为体验优势,目前无法独立确认。

普通用户什么时候能用上?

发布会披露元神 AI 已覆盖 68% 主流车企、腾势/智己/红旗等品牌已选择斑马,但具体车型 OTA 时间未公布。已购车主建议关注车企推送节奏,而非自行预期。

这对其他端侧 AI 场景有参考意义吗?

有。MoE 压缩 + 量化保真的工程路径、以及「Always-on 交互范式 > 省 token」的价值定位,对手机、机器人等端侧场景同样适用;斑马自己也强调汽车是具身智能的「中试场」。但其他终端的算力/功耗约束不同,不能直接照搬结论。

可核验来源

相关工具

相关阅读

产品发布

GPT-6.1 Sol Ultrafast 上线:8 倍速 6 倍价,三端同步,值不值?

OpenAI Developers 2026-10-09 宣布在 API、Codex、ChatGPT Work 三端同步推出 GPT-6.1 Sol 的 Ultrafast 极速版:速度最高 8 倍,定价 6 倍(短上下文输入 $12、输出 $60/百万 token,>272K 输入翻倍),Codex/Work 端仅向 Pro 500、按量付费 Enterprise、配额制 Edu 开放。百器AI 未实测。

产品发布

Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75%

Anthropic 发布 Claude Haiku 5.5(官方公告页标注 2026-10-07 美国时间,中文媒体 10-08 报道),定位高吞吐、成本敏感的小模型:1M token 上下文、128K 最大输出、首款支持 effort 五档调节的 Haiku。价格分两档——10 万 token 以内的请求,官方标价输入 $0.10/百万 token、输出 $0.50/百万 token,是 Haiku 4.5($1/$5)的十分之一;超过 10 万 token 后跳到 $0.50/$2.50。官方口径是「平均运行成本降低约 75%」,而不是 90%——差额来自请求长度分布与新分词器(官方文档称同样文本在新分词器下约多 30% token)。同日官方把 Sonnet 5.5 缓存读取价从 $0.20 腰斩至 $0.10。**百器AI 未实测**:本文所有价格、规格与基准数字均为官方口径或第三方转述,厂商基准无第三方复现。

产品发布

谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上

9 月 30 日谷歌发布 Gemini 4 Argon,官方称『迄今最先进的 AI 模型』:单次输出上限从 6.4 万 token 提至约 100 万,DeepSWE v1.1 软件工程评测 77.9% 官方称超过 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%)。但 Argon 并未面向公众开放——第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者,付费 API 与 Google AI Ultra 用户在后续批次、日期未定。初始定价 $2/$10(每百万 token,缓存低 95%),发布期后涨至 $4/$20。同周 OpenAI 刚在 DevDay 发布 GPT-6.1 Sol 与智能体 Dots,彭博社同时报道谷歌内部员工对 Gemini 4 编码稳定性仍有疑问。百器AI 未实测,所有基准为谷歌官方口径。