首页AI 资讯Vidu S2 发布:视频生成转向「实时操控」,S2-Avatar 与 S2-Editing 双模型拆解
Vidu S2 发布:视频生成转向「实时操控」,S2-Avatar 与 S2-Editing 双模型拆解 封面
产品发布2026-09-179 分钟

Vidu S2 发布:视频生成转向「实时操控」,S2-Avatar 与 S2-Editing 双模型拆解

生数科技 9 月 16 日发布 Vidu S2,含 S2-Avatar(持续交互数字角色,实时输出 720P、支持互动中加入参考图)与 S2-Editing(视频流实时编辑)双模型,并探索空间视频。发布即全量开放,与同类模型的限量预览策略形成对照。百器AI 未实测,本文区分官方口径与独立事实。

Vidu S2生数科技实时视频视频编辑空间视频

核心结论

S2 的实质变化是交互形态:从「生成一段视频」转向「实时操控持续视频流」,而非单纯的画质提升。

「发布即全量开放」与同类模型的限量预览策略形成对照,降低了用户的验证门槛。

厂商自评基准(StreamAV-Bench 等)无第三方复现,引用时必须标注口径。

空间视频是方向性信号,报道用词为「技术探索」,不应表述为可购买的产品能力。

实时推理的算力成本通常高于离线生成,S2 的计费方式未公开,成本判断缺乏依据。

对比判断表

对比维度Vidu S2可灵 AI(kling-video)Seedance(字节)
本次关注点S2-Avatar 实时数字角色 + S2-Editing 视频流实时编辑(2026-09-16 发布)站内收录的国产视频生成工具,以生成质量见长据彭博社报道正在开发实时空间视频模型,尚未确定发布时间
交互形态面向持续视频流的实时操控:互动中加入参考图、实时改写风格与人物以提交式生成为主报道指向直播、短剧、游戏与 VR 场景的交互式虚拟世界
空间视频展示了技术探索:转为左右眼视频,VR 头显观看未见公开信息报道称基于 Seedance 开发,面向 Pico 等 VR 场景
开放策略发布当天全量开放在线体验具体发布时间尚未确定
百器AI 实测未实测未实测未实测

落地检查清单

先明确你要的是「实时互动/实时改片」还是「稳定产出成片」——只有前者是 S2 的新增价值
去 vidu.com/vidu-stream 用真实任务试一次,重点观察实际延迟而非画质单项
不要以 StreamAV-Bench 的自评结果作为选型唯一依据,等第三方复现
确认你的场景是否需要空间视频;当前该能力仍处探索阶段
关注计费方式:实时生成的算力消耗可能显著高于你的离线工作流
迁移生产流程前先做稳定性压测,实时系统的长时间表现需要时间验证

发生了什么:一次把「生成」变成「实时操控」的发布

2026 年 9 月 16 日,生数科技发布 Vidu S2,并于发布当天全量开放在线体验。此次发布包含两款模型:面向持续交互数字角色生成的 S2-Avatar,以及面向输入视频流实时编辑的 S2-Editing。

理解这次发布的关键,不在于版本号从 Q3 走到 S2,而在于产品形态的变化:以往的视频生成是「提交提示词,等待一段成片」;S2 面向的是**持续的视频流**——S2-Avatar 要在一段持续的互动中不断响应新指令,S2-Editing 要对持续输入的画面实时改写。两者的共同点是「边发生,边改写」,而不是「生成完再看」。

三个核心事实(经 eNet&Ciweek、投资界、北京商报三源一致确认):S2-Avatar 将实时输出提升至 720P,并支持用户在互动过程中随时加入新的参考图,让角色持续响应新的指令和视觉信息;S2-Editing 面向持续输入的视频流,可以实时改变画面中的风格、服装、人物和背景;Vidu S2 还展示了空间视频方向的探索,将实时生成或编辑的视频转换为左右眼视频,通过 VR 头显观看。

一个容易被忽略但值得记录的细节:报道指出,相比部分实时交互模型在发布初期采用「早期体验申请」或「限量研究预览」,Vidu S2 选择**发布即全量开放**。证券日报的标题直接写成《发布即体验》。对用户来说,这降低了验证门槛——你不必先排队。

把「官方口径」和「独立事实」分开看

这条新闻里有两类信息,价值完全不同,必须分开对待。

**第一类是可直接确认的产品事实**:发布了两款模型、各自面向什么场景、720P、支持动态加入参考图、发布即全量开放。这类事实有三家独立媒体一致报道,且北京市科委与中关村管委会网站转载了北京商报的报道,可信度高。

**第二类是厂商自评的性能声明**:生数科技官方技术报告称,S2-Avatar 在实时数字角色生成基准 StreamAV-Bench 的九项指标中均取得报告所列对比模型的最优结果;S2-Editing 在多项视频编辑基准中取得超过报告所列离线与流式对比模型的总体得分。这类声明出自厂商自己的技术报告,目前**没有第三方独立复现**,且原文未给出 S2-Editing 的具体基准名称与分数。

百器AI 的立场是:第一类可以写成事实,第二类必须标注为「厂商口径」。本文对 S2 的性能不作任何独立结论,因为我们没有实测数据。

为什么「实时」比「更强」更重要

如果只看「视频质量又提升了」,S2 不过是常规迭代。真正的变化在交互模型上。

离线生成的工作流是:写提示词 → 生成 → 不满意 → 改提示词 → 重新生成。每次调整都要付出一次完整生成的等待时间和算力成本。实时生成把反馈回路压缩到近乎即时:你可以一边对话一边看角色变化,可以随时丢一张新参考图进去改变方向,可以在视频流输入的同时改写风格与人物。

这意味着适用场景发生了位移:从「制作一段成片」转向「实时演出与实时编辑」。直播数字人、互动内容、需要快速试错的创意验证,是这套能力更自然的落点。而传统的分镜式短片制作,S2 未必比成熟离线模型更有优势——反而要承担实时推理的更高成本。

需要提示的是:实时视频生成的算力成本显著高于离线生成,「实时」本身不保证「便宜」。公开报道未披露 S2 的计费方式,百器AI 也未核验其免费额度,因此本文不对成本作任何判断。

空间视频:方向值得关注,但现在还只是探索

Vidu S2 展示的第三个方向是空间视频:把实时生成或编辑的视频转换为左右眼视频,并通过 VR 头显观看。举例来说,一个由 S2-Avatar 实时生成的角色,可以一边与你对话互动,一边以空间视频形式呈现在头显中。

这条线索需要放在行业背景下看。据彭博社 9 月 7 日报道,字节跳动正在开发一款基于 Seedance 的实时空间视频生成模型,由张一鸣亲自督导,计划面向直播、短剧、游戏以及 Pico 等 VR 场景。两家公司几乎同时指向同一方向,说明「实时空间视频」正在成为视频模型的竞争焦点。

但要克制表述:报道中对 Vidu S2 空间视频的用词是「技术探索」和「展示了类似方向上的技术探索」,并非成熟的产品功能。是否有可用的产品入口、支持哪些头显、效果如何,均无公开信息。把它当作方向性信号是合理的,当作可购买的能力则缺乏依据。

对中文创作者意味着什么:先别急着换工作流

对国内短视频、广告和电商创作者来说,Vidu 一直是「中文场景友好」的选择之一。S2 带来的是新能力维度,而不是对既有工作流的直接替代。

务实的做法是分场景判断。如果你的需求是**快速创意验证、数字人互动、实时改片**,S2 提供的能力此前没有替代品,值得去 vidu.com 亲自试一次——毕竟「发布即全量开放」,试错成本只是时间。如果你的需求是**稳定的成片产出**,那么现有离线工作流并未因此失效,实时能力的成本结构反而可能更高。

还要提醒一点:本文写作时距 S2 发布仅一天。实时视频系统的稳定性、长时间运行表现、并发情况下的实际延迟,都需要更长时间才能有可靠结论。在把你的生产流程迁移过去之前,建议先用真实任务压测。

常见问题

Vidu S2 什么时候发布的?

2026 年 9 月 16 日,生数科技发布并当天全量开放在线体验。百器AI 于 9 月 17 日核验并发布本文。

S2-Avatar 和 S2-Editing 有什么区别?

S2-Avatar 面向持续交互的数字角色生成,实时输出 720P,支持互动中随时加入新参考图;S2-Editing 面向持续输入的视频流做实时编辑,可改变画面中的风格、服装、人物和背景。前者是「生成一个能持续互动的角色」,后者是「实时改写已有视频流」。

Vidu S2 比可灵 AI 强吗?

两者定位不完全重合。Vidu S2 这次主打实时交互与实时编辑,可灵以生成质量见长。百器AI 未对两者做同条件实测,无法给出强弱结论,建议按你的具体场景分别试用。

StreamAV-Bench 上 Vidu S2 拿第一,可以直接采信吗?

不建议直接采信。该结果是生数科技官方技术报告的自我评测口径,目前无第三方独立复现。可以作为厂商声明参考,但不宜作为选型决策的唯一依据。

空间视频现在能用了吗?

公开报道对 Vidu S2 空间视频的表述是「技术探索」,未说明是否有可用的产品入口、支持哪些头显。建议视为方向性信号,而非成熟功能。

Vidu S2 免费吗?

官方口径是「发布当天全量开放在线体验」,但具体免费额度与计费档位百器AI 尚未核验。请在 vidu.com 以官网最新说明为准。

可核验来源

相关工具

相关阅读

产品发布

HiDream-O1-Video-1.0 发布:不做画质军备竞赛,改攻「物理规律 + 音画一体」

智象未来 9 月 15 日发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(HD-V1),支持文本/图片/视频输入,官方称直出 5–20 秒 1080p。差异化不在画质,而在物理规律理解与音画联合建模。Artificial Analysis 图生视频(含音频)全球第四、Arena.ai 第 8。百器AI 未实测,本文区分官方口径与独立事实。

产品发布

DeepSeek-V4.1 Flash 正式发布:552B 新结构性能反超自家 Pro,V4 Pro 请求将被路由降价计费

9 月 10 日 DeepSeek 正式发布 V4.1 Flash:552B 参数 MoE 采用全新 Causal-Encoder-Decoder 结构(输入激活 8B / 输出激活 16B),原生多模态,官方口径性能全面超越 V4 Pro 且定价同步下调。9 月 14 日 12:00 起,deepseek-v4-pro 请求将全部路由到 V4.1 Flash 并按其单价计费——轻量模型反超旗舰后,DeepSeek 用路由策略完成了一次罕见的产品线倒挂。

产品发布

OpenAI 发布 GPT-Image 2.5:Flare/Sunburst 双模型首次拆档,生成速度最高快 50%,新增手绘草图输入

9 月 9 日 OpenAI 发布 ChatGPT Images 2.5:API 首次拆出 gpt-image-2.5-flare(速度档,生成延迟最多减半)与 gpt-image-2.5-sunburst(质量档)两个模型,新增 Sketch 手绘草图参考输入,编辑精度与细节锐度提升。图像生成从「单一模型拼效果」进入「按场景分档」阶段——与 DeepSeek V4.1 Flash 同周,头部厂商不约而同选择了快慢分档的产品策略。