阶跃 Step 5 Preview 登顶 OpenRouter Trending:600B MoE 只激活 27B,10 月 15 日开源值不值得等?
10 月 10 日,阶跃星辰旗舰基座模型 Step 5 Preview 登上 OpenRouter Trending 榜第 1、日榜全球第 2,官方称将于 10 月 15 日开源。核心规格为稀疏 MoE、总参数 6000 亿、每 Token 激活 270 亿、上下文 1M,Artificial Analysis 综合智能指数 44 分;同一份 AA 数据也给出一条不太好看的记录——输出 token 数 160M 高于中位数近一倍,被标注为「非常冗长」。百器AI 未实测,本文全部数据来自第三方评测页面与媒体报道,厂商自评已单独标注。
核心结论
Trending 榜测的是「多少人在用」,不是「模型有多强」——把它当热度信号而非能力信号,是读这条新闻的第一条原则。
AA 页面把 Step 5 Preview 标为 Proprietary,而媒体标题写「开源前三」:这个冲突的根源是权重 10 月 15 日才释放,「开源前三」描述的是预期位次而非当前标签。
低价的另一面是冗长:AA 测得其输出 token 数 160M、近乎中位数 82M 的两倍。忽略这一项去做成本估算,会系统性低估真实账单。
价格三处口径不一致(AA 美元标价 / 阿里云百炼人民币标价 / 厂商自评的 1/8)——三者不可互换,预算要以你实际使用的那个渠道的官方计费页为准。
600B 总参、27B 激活让推理成本接近 30B 稠密模型,但显存仍要驻留 600B 权重——「便宜」是对托管方和 API 用户成立,对个人本地部署不成立。
本文不含任何第一方实测证据。所有厂商数据标注「官方称」,所有第三方数据标注来源,编辑判断单独标注。
对比判断表
| 对比维度 | Step 5 Preview(阶跃星辰) | AA 全站参照(227 个模型) | 备注 |
|---|---|---|---|
| AA 综合智能指数 | 44 分(第 40 位) | 中位数 26 分 | v4.3.2 版,含 10 项评测;「开源前三」为媒体对榜单的排序表述,非 AA 自身标签 |
| 每百万 token 输入价 | US$1.00 | 中位数 US$2.00 | AA 页面直核;阿里云百炼华北2 报价为输入 7 元/百万 token,渠道口径不同 |
| 每百万 token 输出价 | US$2.70(缓存折扣 90%) | 中位数 US$10.00 | AA 页面直核;阿里云百炼华北2 报价为输出 20 元/百万 token、缓存命中 0.35 元 |
| 输出速度 | 87 tokens/s(第 77 位) | 中位数 79 tokens/s | AA 页面数值;部分媒体转述为 100 tokens/s,存在差异,以 AA 直核为准 |
| 输出冗长度 | 160M token(第 90 位) | 中位数 82M token | AA 明确判定「非常冗长」,会部分抵消输出低价带来的成本优势 |
| 平均每任务成本 | US$1.03(第 53 位) | — | 按 Intelligence Index 任务加权;厂商另有「为 Opus 5 的 1/8」的自评口径,无第三方复现 |
| 上下文窗口 | 1M token | — | 阿里云百炼文档:最大输入/输出均为 1,048,576 |
| 输入 / 输出模态 | 输入文本 + 图像,输出文本 | — | 阿里云百炼能力表:联网搜索、前缀续写、模型调优均不支持 |
| 权重可得性 | 10 月 15 日开源(当前为专有) | — | 许可证未公布;是否放出完整 600B 权重未知 |
落地检查清单
发生了什么:一次榜单登顶 + 一个已经排好的开源日期
2026 年 10 月 10 日,阶跃星辰的旗舰基座模型 Step 5 Preview 出现在多家媒体报道里:登上 OpenRouter Trending 榜第 1 位,并在按每日 Token 处理量排名的日榜上列全球第 2。报道方包括上海证券报·中国证券网、澎湃新闻(新浪财经转载)、雷峰网、爱范儿、文汇报、观点网,口径一致,均写明「据官方消息,将于 10 月 15 日正式开源」。
先把榜单本身的性质说清楚,因为这决定了这条新闻值多少注意力。OpenRouter 是聚合多模型的开发者平台,Trending 榜按近期用量增长排序,日榜按每日处理的 Token 总量排序。也就是说,这两个榜测的是「多少人在用、用了多少」,不是「模型有多强」。它是采用率信号,不是能力信号。榜单名次本身是动态快照——百器AI 未能归档到静态名次页面(OpenRouter 模型页为 JS 渲染),所以本文不把「第 1 / 第 2」当作可长期引用的结论,只作为 10 月 10 日当天的事实记录。
真正值得关注的部分在模型本身:一个总参数 6000 亿、每 Token 只激活 270 亿的稀疏 MoE 模型,官方称综合智能指数追平了参数量大得多的对手,而价格显著低于行业中位数。选型这件事上,这组数字比榜单名次有信息量得多。
规格拆解:600B 总参数配 27B 激活,意味着什么
据阶跃官方口径(经多家媒体一致转述),Step 5 Preview 采用稀疏 MoE 架构,总参数量 600B,每个 Token 激活约 27B 参数。阿里云百炼的官方模型文档页给出了同一组数字并补充了工程细节:上下文长度 1,048,576 Token(1M),输入模态支持文本与图像,仅输出文本;最大输入与输出长度均为 1,048,576。
「600B 总参数 / 27B 激活」这个比例是理解这款模型的钥匙。推理时每个 Token 只经过约 4.5% 的参数做计算,这让它的推理速度和成本表现接近 30B 级别的稠密模型;但推理时 600B 权重仍需全部驻留显存,所以本地自建部署的硬件门槛并没有因为「激活 27B」而降到个人开发者可承受的范围——对大多数人来说,API 和第三方推理平台才是现实路径。
能力边界上,AA 页面明确标注输入模态为「文本和图像」,输出模态为「文本」。阿里云百炼文档的能力表进一步列出:Function Calling 支持、结构化输出支持、上下文缓存支持、批量推理支持;联网搜索不支持、前缀续写不支持、模型调优不支持。如果你需要的是一个能联网检索的模型,这条路在这一版上不通。
厂商自画像的重点场景是 AI 编程、软件工程、专业知识工作与金融;阿里云文档的表述多了「在金融领域展现出尤为突出的能力」。场景定位属于厂商口径,百器AI 无法验证其在你的任务上的实际表现。
Benchmark:44 分的那张成绩单,和不那么好看的另一半
Artificial Analysis 官方模型页给出的数据是可以直核的:Step 5 Preview 的 Artificial Analysis Intelligence Index 为 44 分,在全站 227 个模型中列第 40 位。AA Intelligence Index v4.3.2 由 10 项评测构成(AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1)。
这里有一处口径冲突必须写清楚:AA 页面把 Step 5 Preview 标记为 Proprietary(专有模型),而多家媒体的标题写的是「全球开源前三」。合理的解释是——截至查询时权重尚未释放,AA 按其当前状态标注;10 月 15 日开源后状态才会改变。换句话说,「开源前三」描述的是开源后的预期位次,不是此刻 AA 页面上的标签。这是二手标题常见的压缩失真,读者容易被误导。
更有价值的是 AA 页面里那条没有被媒体标题带出来的数据:Step 5 Preview 在 Intelligence Index 评测中生成了 160M 个输出 token,而中位数是 82M,AA 明确判定其回答「非常冗长」。这条必须和低价格放在一起读——输出价格便宜,但如果每个任务多吐近一倍 token,账单上的优势会被部分吃掉。只看「输出 $2.70 vs 中位数 $10」会觉得省了 73%,把冗长度算进去才是真实成本。这是编辑判断。
速度方面存在一组不一致数据:AA 页面数值为每秒 87 个输出 token(高于 79 的中位数),部分媒体转述为「每秒 100 Token」。本文按 AA 直核页面的 87 tokens/s 为准,并如实标注差异。
还有一组来自第三方整理(非本次独立复核)的对照:AA 指数上 GLM-5.3 = 45、Claude Opus 5 = 45、Step 5 Preview = 44、Kimi K3 = 44、DeepSeek V4.1 Flash = 40、DeepSeek V4 Pro = 36;Terminal-Bench 4.0 上 Step 5 Preview 为 33.3%。这组数据的采样时间是 9 月中下旬,距今已有变化可能,引用时应标注为「据报道」,且不要把 1 分之差当成能力排序的结论。
价格:三方渠道口径不完全一致,别按一个数字做预算
价格是这次讨论的中心,但三个来源的数字口径不同,必须分开看。
Artificial Analysis 页面给出的是美元标价:每百万输入 token US$1.00、每百万输出 token US$2.70,缓存折扣 90%,Intelligence Index 上平均每任务成本 US$1.03。AA 同时给出参照:输入价格中位数 US$2.00、输出中位数 US$10.00——相比之下它的输入约为中位数一半、输出约为中位数的四分之一多一点。
阿里云百炼官方模型文档给出的华北 2(北京)价格为人民币计价:输入 7 元/百万 token、输出 20 元/百万 token、缓存命中输入 0.35 元/百万 token;限流为 RPM 500、TPM 10,000,000。按当前汇率折算后与 AA 的美元标价处于同一量级但不完全相等——不同渠道、不同区域、不同计费口径本来就不该强行对齐。
阶跃开放平台的官方定价页(platform.stepfun.ai/docs/en/guides/pricing/details)确实存在,但本次抓取只取到导航框架、未拿到逐档价格表。所以本文的价格判断以 AA 页面 + 阿里云百炼官方页为准,并把「官方定价页未直核」如实记录为 limitations 之一。
厂商自评里有一句流传较广的话:单任务成本为 Claude Opus 5 的 1/8。这句话没有说明任务类型、对照配置与 Token 统计方法,也无第三方复现,AA 页面未给出与该模型的成本倍率对照。它属于 OFFICIAL_CLAIM(厂商自评),不是可以写进采购单的结论。
第三方与社区怎么看:一句「帕累托前沿」,和它没说的部分
AI 研究员、DAIR.AI 联合创始人 Elvis Saravia 在试用后评价该模型令人印象深刻,认为其能力可与 GLM-5.3、Kimi K3 媲美,价格具有竞争力,处在成本与能力权衡的「帕累托前沿」,值得开发者在自己常用的编程智能体中接入。这是个人试用评价,属社区级证据,强度低于系统评测,但它的判断方向和多方转载的兴趣点是一致的。
阶跃自己把这条路概括为「智能效率」——从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,连续三代基座模型围绕把算力投入转化为有效智能的比例做优化。跳过 Step 4.x 直接命名 Step 5,官方未解释原因,第三方媒体普遍理解为架构与效率路线上的代际跃迁表达,而非实际版本号断层。这是编辑判断,不是厂商声明。
百器AI 未对 Step 5 Preview 做任何第一方测试:没有 API 调用、没有本地部署、没有在自己的任务集上跑过对照。本文所有性能与成本描述均为官方口径或第三方评测/报道的转述。如果你要把它放进生产链路,请以你自己的任务集做 A/B 实测,尤其是要测它在你的场景里的 token 消耗量。
10 月 15 日开源之前:现在能做什么,不能做什么
现在能做的:通过 API 使用。模型已全量开放,阶跃开放平台模型 ID 为 step-5-preview,阿里云百炼的接入路径为 stepfun/step-5-preview,推理服务由阶跃星辰提供。Agent 类任务可以用 Function Calling、结构化输出和上下文缓存。1M 上下文意味着可以一次性装入较大的代码库或资料集,但上下文预算不等于每次都应填满——长上下文的注意力开销会体现在延迟与账单上。
现在还不能做的:拿到权重自行部署。10 月 15 日是官方给出的开源时间点,在此之前 AA 页面仍将其标注为专有模型。也就是说,如果你在意的是自托管与数据不出内网,那么这条路径要等到 10 月 15 日之后,并且要看到实际发布的许可证条款才能判断能不能商用。
需要盯的三个不确定项:一是开源许可证(Apache-2.0、MIT,还是带商用限制的自定义协议),官方尚未公布;二是开源的是否为完整 600B 权重;三是 Trending/日榜的名次是动态的,随时可能被替代。开源落地之后还应该确认一件事:百器AI 手中没有它的第一方测试证据,开源后是否会有社区在同一评测配置下复现 SWE-bench / Terminal-Bench 的独立结果,是判断这份成绩单成色的下一个节点。
最后提醒一个容易混淆的点:榜单登顶是采用率信号,开源是供给事件,两者指向不同结论。开发者在 OpenRouter 上大量调用一个模型,说明它的价格/能力比对当下这批人有吸引力;至于它能不能在你的场景里跑赢你正在用的模型,榜单回答不了。
常见问题
Step 5 Preview 现在开源了吗?
还没有。多家媒体一致报道的官方口径是「将于 2026 年 10 月 15 日正式开源」。在权重释放前,Artificial Analysis 模型页仍将其标注为 Proprietary(专有模型)。许可证类型、是否放出完整 600B 权重,官方均未公布。
「登顶 OpenRouter」是指模型能力最强吗?
不是。OpenRouter 的 Trending 榜按近期用量增长排序,日榜按每日处理的 Token 总量排序,两者测的都是使用热度而非能力。要看能力,应参考 Artificial Analysis Intelligence Index(Step 5 Preview 为 44 分,全站第 40 / 227)。此外榜单是动态快照,名次随时可能变化。
600B 总参数、27B 激活参数,本地部署需要什么条件?
推理时每个 Token 只经过约 27B 参数的计算,速度与成本表现接近 30B 级稠密模型;但 600B 权重需要全部驻留显存,本地部署仍需多卡集群。对个人开发者和中小团队而言,经 API 或第三方推理平台使用更现实。
Step 5 Preview 的价格到底是多少?
取决于渠道。Artificial Analysis 页面为每百万输入 US$1.00、输出 US$2.70、缓存折扣 90%;阿里云百炼华北 2(北京)官方页为输入 7 元、输出 20 元、缓存命中 0.35 元每百万 token。阶跃开放平台官方定价页存在,但本次核验未取到逐档价格表。厂商另有「单任务成本为 Claude Opus 5 的 1/8」的自评,未公开任务类型与统计方法,无第三方复现。
它有什么短板值得注意?
两条来自第三方评测页面:一是输出冗长,AA 测得 Intelligence Index 评测中生成 160M token,中位数为 82M,被标注「非常冗长」,会部分抵消低价优势;二是功能边界,阿里云百炼能力表显示联网搜索、前缀续写、模型调优均不支持,输出仅文本不含多模态生成。
百器AI 实测过这个模型吗?
没有。本文不含任何第一方测试证据:未做 API 调用、未做本地部署、未在我们的任务集上跑过对照。所有性能与成本描述均为官方口径(标注「官方称」)或第三方评测/媒体报道的转述,编辑判断已单独标注。选型请以你自己的任务集实测为准。
为什么叫 Step 5,跳过了 Step 4?
阶跃官方未解释命名原因。第三方媒体普遍理解为强调架构与效率路线上的代际跃迁,而非增量更新——官方表述将其放在「Step 3.5 Flash → Step 3.7 Flash → Step 5 Preview」的序列中。这是编辑判断,不是厂商声明。