首页AI 资讯阶跃 Step 5 Preview 登顶 OpenRouter Trending:600B MoE 只激活 27B,10 月 15 日开源值不值得等?
阶跃 Step 5 Preview 登顶 OpenRouter Trending:600B MoE 只激活 27B,10 月 15 日开源值不值得等? 封面
产品发布2026-10-1111 分钟

阶跃 Step 5 Preview 登顶 OpenRouter Trending:600B MoE 只激活 27B,10 月 15 日开源值不值得等?

10 月 10 日,阶跃星辰旗舰基座模型 Step 5 Preview 登上 OpenRouter Trending 榜第 1、日榜全球第 2,官方称将于 10 月 15 日开源。核心规格为稀疏 MoE、总参数 6000 亿、每 Token 激活 270 亿、上下文 1M,Artificial Analysis 综合智能指数 44 分;同一份 AA 数据也给出一条不太好看的记录——输出 token 数 160M 高于中位数近一倍,被标注为「非常冗长」。百器AI 未实测,本文全部数据来自第三方评测页面与媒体报道,厂商自评已单独标注。

阶跃星辰Step 5 PreviewOpenRouter稀疏 MoE开源模型Artificial Analysis国产大模型AI 编程Token 成本帕累托前沿

核心结论

Trending 榜测的是「多少人在用」,不是「模型有多强」——把它当热度信号而非能力信号,是读这条新闻的第一条原则。

AA 页面把 Step 5 Preview 标为 Proprietary,而媒体标题写「开源前三」:这个冲突的根源是权重 10 月 15 日才释放,「开源前三」描述的是预期位次而非当前标签。

低价的另一面是冗长:AA 测得其输出 token 数 160M、近乎中位数 82M 的两倍。忽略这一项去做成本估算,会系统性低估真实账单。

价格三处口径不一致(AA 美元标价 / 阿里云百炼人民币标价 / 厂商自评的 1/8)——三者不可互换,预算要以你实际使用的那个渠道的官方计费页为准。

600B 总参、27B 激活让推理成本接近 30B 稠密模型,但显存仍要驻留 600B 权重——「便宜」是对托管方和 API 用户成立,对个人本地部署不成立。

本文不含任何第一方实测证据。所有厂商数据标注「官方称」,所有第三方数据标注来源,编辑判断单独标注。

对比判断表

对比维度Step 5 Preview(阶跃星辰)AA 全站参照(227 个模型)备注
AA 综合智能指数44 分(第 40 位)中位数 26 分v4.3.2 版,含 10 项评测;「开源前三」为媒体对榜单的排序表述,非 AA 自身标签
每百万 token 输入价US$1.00中位数 US$2.00AA 页面直核;阿里云百炼华北2 报价为输入 7 元/百万 token,渠道口径不同
每百万 token 输出价US$2.70(缓存折扣 90%)中位数 US$10.00AA 页面直核;阿里云百炼华北2 报价为输出 20 元/百万 token、缓存命中 0.35 元
输出速度87 tokens/s(第 77 位)中位数 79 tokens/sAA 页面数值;部分媒体转述为 100 tokens/s,存在差异,以 AA 直核为准
输出冗长度160M token(第 90 位)中位数 82M tokenAA 明确判定「非常冗长」,会部分抵消输出低价带来的成本优势
平均每任务成本US$1.03(第 53 位)—按 Intelligence Index 任务加权;厂商另有「为 Opus 5 的 1/8」的自评口径,无第三方复现
上下文窗口1M token—阿里云百炼文档:最大输入/输出均为 1,048,576
输入 / 输出模态输入文本 + 图像,输出文本—阿里云百炼能力表:联网搜索、前缀续写、模型调优均不支持
权重可得性10 月 15 日开源(当前为专有)—许可证未公布;是否放出完整 600B 权重未知

落地检查清单

把榜单词义先分清:Trending = 用量增长、日榜 = Token 处理量。要能力判断去看 Intelligence Index,不要只看名次。
做预算时把「冗长」算进去:先用自己的高频任务量 100–200 条实测平均输出 token 数,再乘输出单价,别只按输入、输出单价的表面差估算。
确认你要走的渠道:阶跃开放平台(step-5-preview)与阿里云百炼(stepfun/step-5-preview,华北2 RPM 500 / TPM 1000 万)计费与限流不同,按实际接入渠道的官方计费页核对。
需要联网搜索、前缀续写或模型调优的,这一版不支持——在选型表上先排除,别等到联调阶段才发现。
自托管需求先别动:官方开源时点是 10 月 15 日,且许可证未公布,商用授权边界在此之前无法确认。
10 月 15 日之后第一件事看许可证,第二件事找社区在同一 harness 下的独立复现(尤其 SWE-bench 与 Terminal-Bench),厂商自评分不等于复现分。
把它和你正在用的模型在同一批真实任务上做 A/B,而不是在公开基准上比分数。

发生了什么:一次榜单登顶 + 一个已经排好的开源日期

2026 年 10 月 10 日,阶跃星辰的旗舰基座模型 Step 5 Preview 出现在多家媒体报道里:登上 OpenRouter Trending 榜第 1 位,并在按每日 Token 处理量排名的日榜上列全球第 2。报道方包括上海证券报·中国证券网、澎湃新闻(新浪财经转载)、雷峰网、爱范儿、文汇报、观点网,口径一致,均写明「据官方消息,将于 10 月 15 日正式开源」。

先把榜单本身的性质说清楚,因为这决定了这条新闻值多少注意力。OpenRouter 是聚合多模型的开发者平台,Trending 榜按近期用量增长排序,日榜按每日处理的 Token 总量排序。也就是说,这两个榜测的是「多少人在用、用了多少」,不是「模型有多强」。它是采用率信号,不是能力信号。榜单名次本身是动态快照——百器AI 未能归档到静态名次页面(OpenRouter 模型页为 JS 渲染),所以本文不把「第 1 / 第 2」当作可长期引用的结论,只作为 10 月 10 日当天的事实记录。

真正值得关注的部分在模型本身:一个总参数 6000 亿、每 Token 只激活 270 亿的稀疏 MoE 模型,官方称综合智能指数追平了参数量大得多的对手,而价格显著低于行业中位数。选型这件事上,这组数字比榜单名次有信息量得多。

规格拆解:600B 总参数配 27B 激活,意味着什么

据阶跃官方口径(经多家媒体一致转述),Step 5 Preview 采用稀疏 MoE 架构,总参数量 600B,每个 Token 激活约 27B 参数。阿里云百炼的官方模型文档页给出了同一组数字并补充了工程细节:上下文长度 1,048,576 Token(1M),输入模态支持文本与图像,仅输出文本;最大输入与输出长度均为 1,048,576。

「600B 总参数 / 27B 激活」这个比例是理解这款模型的钥匙。推理时每个 Token 只经过约 4.5% 的参数做计算,这让它的推理速度和成本表现接近 30B 级别的稠密模型;但推理时 600B 权重仍需全部驻留显存,所以本地自建部署的硬件门槛并没有因为「激活 27B」而降到个人开发者可承受的范围——对大多数人来说,API 和第三方推理平台才是现实路径。

能力边界上,AA 页面明确标注输入模态为「文本和图像」,输出模态为「文本」。阿里云百炼文档的能力表进一步列出:Function Calling 支持、结构化输出支持、上下文缓存支持、批量推理支持;联网搜索不支持、前缀续写不支持、模型调优不支持。如果你需要的是一个能联网检索的模型,这条路在这一版上不通。

厂商自画像的重点场景是 AI 编程、软件工程、专业知识工作与金融;阿里云文档的表述多了「在金融领域展现出尤为突出的能力」。场景定位属于厂商口径,百器AI 无法验证其在你的任务上的实际表现。

Benchmark:44 分的那张成绩单,和不那么好看的另一半

Artificial Analysis 官方模型页给出的数据是可以直核的:Step 5 Preview 的 Artificial Analysis Intelligence Index 为 44 分,在全站 227 个模型中列第 40 位。AA Intelligence Index v4.3.2 由 10 项评测构成(AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1)。

这里有一处口径冲突必须写清楚:AA 页面把 Step 5 Preview 标记为 Proprietary(专有模型),而多家媒体的标题写的是「全球开源前三」。合理的解释是——截至查询时权重尚未释放,AA 按其当前状态标注;10 月 15 日开源后状态才会改变。换句话说,「开源前三」描述的是开源后的预期位次,不是此刻 AA 页面上的标签。这是二手标题常见的压缩失真,读者容易被误导。

更有价值的是 AA 页面里那条没有被媒体标题带出来的数据:Step 5 Preview 在 Intelligence Index 评测中生成了 160M 个输出 token,而中位数是 82M,AA 明确判定其回答「非常冗长」。这条必须和低价格放在一起读——输出价格便宜,但如果每个任务多吐近一倍 token,账单上的优势会被部分吃掉。只看「输出 $2.70 vs 中位数 $10」会觉得省了 73%,把冗长度算进去才是真实成本。这是编辑判断。

速度方面存在一组不一致数据:AA 页面数值为每秒 87 个输出 token(高于 79 的中位数),部分媒体转述为「每秒 100 Token」。本文按 AA 直核页面的 87 tokens/s 为准,并如实标注差异。

还有一组来自第三方整理(非本次独立复核)的对照:AA 指数上 GLM-5.3 = 45、Claude Opus 5 = 45、Step 5 Preview = 44、Kimi K3 = 44、DeepSeek V4.1 Flash = 40、DeepSeek V4 Pro = 36;Terminal-Bench 4.0 上 Step 5 Preview 为 33.3%。这组数据的采样时间是 9 月中下旬,距今已有变化可能,引用时应标注为「据报道」,且不要把 1 分之差当成能力排序的结论。

价格:三方渠道口径不完全一致,别按一个数字做预算

价格是这次讨论的中心,但三个来源的数字口径不同,必须分开看。

Artificial Analysis 页面给出的是美元标价:每百万输入 token US$1.00、每百万输出 token US$2.70,缓存折扣 90%,Intelligence Index 上平均每任务成本 US$1.03。AA 同时给出参照:输入价格中位数 US$2.00、输出中位数 US$10.00——相比之下它的输入约为中位数一半、输出约为中位数的四分之一多一点。

阿里云百炼官方模型文档给出的华北 2(北京)价格为人民币计价:输入 7 元/百万 token、输出 20 元/百万 token、缓存命中输入 0.35 元/百万 token;限流为 RPM 500、TPM 10,000,000。按当前汇率折算后与 AA 的美元标价处于同一量级但不完全相等——不同渠道、不同区域、不同计费口径本来就不该强行对齐。

阶跃开放平台的官方定价页(platform.stepfun.ai/docs/en/guides/pricing/details)确实存在,但本次抓取只取到导航框架、未拿到逐档价格表。所以本文的价格判断以 AA 页面 + 阿里云百炼官方页为准,并把「官方定价页未直核」如实记录为 limitations 之一。

厂商自评里有一句流传较广的话:单任务成本为 Claude Opus 5 的 1/8。这句话没有说明任务类型、对照配置与 Token 统计方法,也无第三方复现,AA 页面未给出与该模型的成本倍率对照。它属于 OFFICIAL_CLAIM(厂商自评),不是可以写进采购单的结论。

第三方与社区怎么看:一句「帕累托前沿」,和它没说的部分

AI 研究员、DAIR.AI 联合创始人 Elvis Saravia 在试用后评价该模型令人印象深刻,认为其能力可与 GLM-5.3、Kimi K3 媲美,价格具有竞争力,处在成本与能力权衡的「帕累托前沿」,值得开发者在自己常用的编程智能体中接入。这是个人试用评价,属社区级证据,强度低于系统评测,但它的判断方向和多方转载的兴趣点是一致的。

阶跃自己把这条路概括为「智能效率」——从 Step 3.5 Flash、Step 3.7 Flash 到 Step 5 Preview,连续三代基座模型围绕把算力投入转化为有效智能的比例做优化。跳过 Step 4.x 直接命名 Step 5,官方未解释原因,第三方媒体普遍理解为架构与效率路线上的代际跃迁表达,而非实际版本号断层。这是编辑判断,不是厂商声明。

百器AI 未对 Step 5 Preview 做任何第一方测试:没有 API 调用、没有本地部署、没有在自己的任务集上跑过对照。本文所有性能与成本描述均为官方口径或第三方评测/报道的转述。如果你要把它放进生产链路,请以你自己的任务集做 A/B 实测,尤其是要测它在你的场景里的 token 消耗量。

10 月 15 日开源之前:现在能做什么,不能做什么

现在能做的:通过 API 使用。模型已全量开放,阶跃开放平台模型 ID 为 step-5-preview,阿里云百炼的接入路径为 stepfun/step-5-preview,推理服务由阶跃星辰提供。Agent 类任务可以用 Function Calling、结构化输出和上下文缓存。1M 上下文意味着可以一次性装入较大的代码库或资料集,但上下文预算不等于每次都应填满——长上下文的注意力开销会体现在延迟与账单上。

现在还不能做的:拿到权重自行部署。10 月 15 日是官方给出的开源时间点,在此之前 AA 页面仍将其标注为专有模型。也就是说,如果你在意的是自托管与数据不出内网,那么这条路径要等到 10 月 15 日之后,并且要看到实际发布的许可证条款才能判断能不能商用。

需要盯的三个不确定项:一是开源许可证(Apache-2.0、MIT,还是带商用限制的自定义协议),官方尚未公布;二是开源的是否为完整 600B 权重;三是 Trending/日榜的名次是动态的,随时可能被替代。开源落地之后还应该确认一件事:百器AI 手中没有它的第一方测试证据,开源后是否会有社区在同一评测配置下复现 SWE-bench / Terminal-Bench 的独立结果,是判断这份成绩单成色的下一个节点。

最后提醒一个容易混淆的点:榜单登顶是采用率信号,开源是供给事件,两者指向不同结论。开发者在 OpenRouter 上大量调用一个模型,说明它的价格/能力比对当下这批人有吸引力;至于它能不能在你的场景里跑赢你正在用的模型,榜单回答不了。

常见问题

Step 5 Preview 现在开源了吗?

还没有。多家媒体一致报道的官方口径是「将于 2026 年 10 月 15 日正式开源」。在权重释放前,Artificial Analysis 模型页仍将其标注为 Proprietary(专有模型)。许可证类型、是否放出完整 600B 权重,官方均未公布。

「登顶 OpenRouter」是指模型能力最强吗?

不是。OpenRouter 的 Trending 榜按近期用量增长排序,日榜按每日处理的 Token 总量排序,两者测的都是使用热度而非能力。要看能力,应参考 Artificial Analysis Intelligence Index(Step 5 Preview 为 44 分,全站第 40 / 227)。此外榜单是动态快照,名次随时可能变化。

600B 总参数、27B 激活参数,本地部署需要什么条件?

推理时每个 Token 只经过约 27B 参数的计算,速度与成本表现接近 30B 级稠密模型;但 600B 权重需要全部驻留显存,本地部署仍需多卡集群。对个人开发者和中小团队而言,经 API 或第三方推理平台使用更现实。

Step 5 Preview 的价格到底是多少?

取决于渠道。Artificial Analysis 页面为每百万输入 US$1.00、输出 US$2.70、缓存折扣 90%;阿里云百炼华北 2(北京)官方页为输入 7 元、输出 20 元、缓存命中 0.35 元每百万 token。阶跃开放平台官方定价页存在,但本次核验未取到逐档价格表。厂商另有「单任务成本为 Claude Opus 5 的 1/8」的自评,未公开任务类型与统计方法,无第三方复现。

它有什么短板值得注意?

两条来自第三方评测页面:一是输出冗长,AA 测得 Intelligence Index 评测中生成 160M token,中位数为 82M,被标注「非常冗长」,会部分抵消低价优势;二是功能边界,阿里云百炼能力表显示联网搜索、前缀续写、模型调优均不支持,输出仅文本不含多模态生成。

百器AI 实测过这个模型吗?

没有。本文不含任何第一方测试证据:未做 API 调用、未做本地部署、未在我们的任务集上跑过对照。所有性能与成本描述均为官方口径(标注「官方称」)或第三方评测/媒体报道的转述,编辑判断已单独标注。选型请以你自己的任务集实测为准。

为什么叫 Step 5,跳过了 Step 4?

阶跃官方未解释命名原因。第三方媒体普遍理解为强调架构与效率路线上的代际跃迁,而非增量更新——官方表述将其放在「Step 3.5 Flash → Step 3.7 Flash → Step 5 Preview」的序列中。这是编辑判断,不是厂商声明。

可核验来源

相关工具

相关阅读

产品发布

GPT-6.1 Sol Ultrafast 上线:8 倍速 6 倍价,三端同步,值不值?

OpenAI Developers 2026-10-09 宣布在 API、Codex、ChatGPT Work 三端同步推出 GPT-6.1 Sol 的 Ultrafast 极速版:速度最高 8 倍,定价 6 倍(短上下文输入 $12、输出 $60/百万 token,>272K 输入翻倍),Codex/Work 端仅向 Pro 500、按量付费 Enterprise、配额制 Edu 开放。百器AI 未实测。

产品发布

Anthropic 发布 Claude Haiku 5.5:单价砍到十分之一,官方口径平均运行成本降约 75%

Anthropic 发布 Claude Haiku 5.5(官方公告页标注 2026-10-07 美国时间,中文媒体 10-08 报道),定位高吞吐、成本敏感的小模型:1M token 上下文、128K 最大输出、首款支持 effort 五档调节的 Haiku。价格分两档——10 万 token 以内的请求,官方标价输入 $0.10/百万 token、输出 $0.50/百万 token,是 Haiku 4.5($1/$5)的十分之一;超过 10 万 token 后跳到 $0.50/$2.50。官方口径是「平均运行成本降低约 75%」,而不是 90%——差额来自请求长度分布与新分词器(官方文档称同样文本在新分词器下约多 30% token)。同日官方把 Sonnet 5.5 缓存读取价从 $0.20 腰斩至 $0.10。**百器AI 未实测**:本文所有价格、规格与基准数字均为官方口径或第三方转述,厂商基准无第三方复现。

产品发布

谷歌发布 Gemini 4 Argon:输出上限拉到 100 万 token,『迄今最先进』但你还用不上

9 月 30 日谷歌发布 Gemini 4 Argon,官方称『迄今最先进的 AI 模型』:单次输出上限从 6.4 万 token 提至约 100 万,DeepSWE v1.1 软件工程评测 77.9% 官方称超过 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%)。但 Argon 并未面向公众开放——第一阶段仅通过 Fairwind Program 提供给受信任的网络安全防御者,付费 API 与 Google AI Ultra 用户在后续批次、日期未定。初始定价 $2/$10(每百万 token,缓存低 95%),发布期后涨至 $4/$20。同周 OpenAI 刚在 DevDay 发布 GPT-6.1 Sol 与智能体 Dots,彭博社同时报道谷歌内部员工对 Gemini 4 编码稳定性仍有疑问。百器AI 未实测,所有基准为谷歌官方口径。