首页AI 资讯榜单变天:Meta Muse Spark 1.3 上线三天登顶,国产 Kimi K3、GLM-5.3 守住前十
榜单变天:Meta Muse Spark 1.3 上线三天登顶,国产 Kimi K3、GLM-5.3 守住前十 封面
深度解读2026-09-038 分钟

榜单变天:Meta Muse Spark 1.3 上线三天登顶,国产 Kimi K3、GLM-5.3 守住前十

9 月 2 日 Meta 上线 Muse Spark 1.3,三天后拿下综合榜单第一:智能体基准居首,同类模型单任务成本最低。前十名中国产模型占两席,Kimi K3 第 6、GLM-5.3 第 8。成本与能力的格局在本周被同时改写。

MetaMuse Spark 1.3大模型榜单Kimi K3GLM-5.3智能体性价比

核心结论

榜首易主说明前沿层竞争重新开放:编程与智能体基准成为新的分水岭,单任务成本第一次成为头部模型的卖点。

国产模型用两条路线守住前十:开源权重堆参数(Kimi K3)与小激活高效率(GLM-5.3)。

选型窗口变短:谷歌六周三连发、Meta 三天登顶,季度级的选型计划需要月度复核。

一、三天登顶:发生了什么

9 月 2 日,Meta 上线 Muse Spark 1.3,定位前沿编程与智能体模型。发布三天后,它在主流综合智能指数上拿下第一,榜首既不是 OpenAI 也不是 Anthropic。

具体强项有两点:顶级变体在智能体任务基准中拿下第一,同时是同类模型中单任务成本最低的一个。榜单之外,第三方分析把它与 Claude 的差距描述为「紧追」。

二、前十名单:两超多强,国产两席

综合多家榜单快照:Muse Spark 1.3 第 1,OpenAI 与 Anthropic 的旗舰紧随其后;国产模型 Kimi K3 第 6、GLM-5.3 第 8,前十占两席。

把范围放宽到前十五:上周首秀的 glm-5.3-max 位列第 13,kimi-k3-max 升至第 10。国产阵营在中上区间的密度还在上升。

三、Muse Spark 1.3 强在哪

编程与智能体是主战场:多步工具调用、代码任务的长链执行,是它和 1.2 拉开差距的地方。

成本曲线是另一张牌:单任务成本在同类前沿模型中最低,对按调用量计费的应用方是直接的价格信号。

上下文与速度的平衡方案还没有完整第三方数据,可以等 Artificial Analysis 的完整横评再下结论。

四、对选型的实际意义

榜单第一不等于全场景第一:Muse Spark 1.3 的优势集中在智能体与编程,写作、多模态等场景仍需实测。

成本敏感的应用(批量摘要、客服、代码补全)可以把「单任务成本」放进选型公式,这次 Meta 把这个变量拉到了台前。

国产阵营的启示:Kimi K3 以开源权重加 2.8 万亿参数守住第 6,GLM-5.3 用小激活路线守住第 8,两条路线都还在牌桌上。

五、接下来一周看什么

Muse Spark 1.3 是否开放权重:Meta 有 Llama 系开源传统,此次是否放权重尚未官宣。

OpenRouter 调用量变化:榜单分与真实用量是否一致。

国产新旗舰的应对:DeepSeek、Qwen 的下一版时间点。

常见问题

Muse Spark 1.3 是开源的吗?

截至发稿 Meta 未官宣权重开放,目前以 API 形式提供;Meta 过往有开源传统,是否放权重以官方公告为准。

Kimi K3 和 GLM-5.3 差距大吗?

两者分列榜单第 6、第 8。Kimi K3 走开源权重与超大参数路线,GLM-5.3 主打小激活效率,建议按实际任务实测再选。

榜单第一就意味着该换模型吗?

不必。榜单是综合快照,先看自己的任务类型(编程、智能体、多模态)与成本约束,再做 A/B 实测。

可核验来源

相关工具

相关阅读