DeepSeek-V4-Pro 0813 正式版上线:1.6 万亿参数旗舰 GA,Agent 能力对标 Opus 4.8
8 月 13 日 DeepSeek 发布 V4-Pro 0813 正式版:1.6 万亿参数 MoE 旗舰从 Preview 转正,官方宣称能力比肩 Claude Opus 4.8,Agent 向基准(Terminal-Bench、DeepSWE、CyberGym)大幅提升,同时 API 价格上调;SuperCLUE 中文测评拿下总榜第二。
核心结论
旗舰模型进入「按能力定价」阶段:V4-Pro 涨价与 Flash 免费试用收缩共同说明,低价获客期结束,成本-能力匹配成为选型核心。
Agent 向基准(Terminal-Bench、DeepSWE、CyberGym)成为旗舰模型的兵家必争之地,编程与自主执行是当前商业化最确定的方向。
中文评测(SuperCLUE)总榜第二为国产旗舰提供了海外榜单之外的交叉验证,中文场景选型时参考价值更高。
一、正式版(GA)意味着什么
8 月 12 日至 13 日,DeepSeek 官方 API 端点 deepseek-v4-pro 指向全新版本 0813,这是 1.6 万亿参数 MoE 旗舰模型从 Preview 走向正式版(GA)的标志。4 月 24 日发布的 V4-Pro-Base 与 7 月 31 日的 V4-Flash-0731 更新之后,旗舰级正式版是社区期待已久的「压轴」——官方口径中,0813 版本能力「大幅提升,比肩 Opus 4.8」。
与 Flash 系列主打低成本和轻量不同,V4-Pro 定位旗舰推理与智能体任务:官方引用了 Terminal-Bench 2.1、DeepSWE、CyberGym 等 Agent 向基准的大幅提升作为证据,强调其在终端操作、软件工程与网络安全类长链路任务上的可用性。
8 月 21 日,DeepSeek 又发布 V4-Flash-Vision-Exp 实验版,为 Flash 系列补齐多模态视觉能力;至此 DeepSeek 形成 Pro(旗舰推理)/ Flash(低成本轻量)/ Vision(多模态实验)三线并行的产品矩阵。
二、价格上调:告别「白菜价」
与能力同步变化的还有价格:V4-Pro 0813 上线即涨价,延续了 8 月上旬「大模型告别低价模式」的行业趋势——DeepSeek 官宣上调 API 定价,阿里亦传出拟对商用收费。这与 2025 年 DeepSeek 以低价横扫市场的策略形成鲜明对比。
涨价背后是成本结构变化:1.6 万亿参数的旗舰推理成本天然高于 2840 亿参数的 Flash;同时后训练 Scaling 与 Agent 任务对齐需要更大的数据与算力投入。官方并未公布 0813 与 0731 的成本对比,但市场普遍认为,旗舰模型的定价正在从「补贴获客」转向「按能力定价」。
对开发者而言,这意味着选型时要把「单次调用成本 × 任务复杂度」纳入计算:简单问答与代码补全可以继续用 Flash 系列,长链路 Agent 任务再按需升级到 Pro。
三、SuperCLUE 中文测评:总榜第二
8 月 19 日公布的 SuperCLUE 中文大模型测评报告中,DeepSeek V4 Pro 综合排名拿下总榜第二,编程能力被点名「暴涨」。这是中文场景下较有代表性的第三方验证——此前海外榜单(Artificial Analysis、LMArena 等)更侧重英文与代码任务,中文理解、中文指令遵循与中文工具调用一直是国产模型的加分项也是争议项。
结合同周发布的智谱 GLM-5.3(开源编程第一梯队)、Qwen3.8-27B(270 亿参数中端模型),8 月中旬国产模型形成「旗舰(V4-Pro、GLM-5.3、K3)+ 中端(Qwen3.8-27B)+ 轻量(Flash)」的完整分层,中文场景下的选择空间显著扩大。
需要注意:SuperCLUE 榜单为阶段性快照,不同批次题目与评分口径可能调整;生产选型仍应结合自己的中文业务数据做验收测试。
四、开发者该怎么升级
已在 Preview 上跑通流程的团队:0813 是正式版,建议先在 staging 环境用真实任务集做回归——重点验证终端操作(Terminal-Bench 类任务)、代码仓库级修改(DeepSWE 类)与工具调用稳定性,再切生产流量。
纯文本/补全场景的团队:可以继续留在 V4-Flash 系列控制成本,不必为旗舰能力买单;只有当任务需要多步推理、长上下文规划或自主执行时才值得切 Pro。
多模态需求:关注 V4-Flash-Vision-Exp 的稳定版节奏;DeepSeek 的 Vision 系列目前仍标 Exp(实验版),生产环境接入需评估稳定性。
常见问题
DeepSeek-V4-Pro 0813 与 Preview 有什么不同?
0813 是正式版(GA),官方称能力大幅提升并比肩 Opus 4.8,Agent 向基准(Terminal-Bench 2.1、DeepSWE、CyberGym)提升明显;API 价格同步上调。
V4-Pro 和 V4-Flash 怎么选?
复杂推理、长链路 Agent、代码仓库级任务用 Pro;日常问答、补全、轻量任务用 Flash 控制成本;多模态需求可关注 V4-Flash-Vision-Exp。
涨价幅度多大?
官方未公布具体新旧价格对照,建议以 deepseek.com 当前 API 定价页为准;整体趋势是旗舰模型告别低价补贴。