智象未来推出的首个原生全模态视频生成模型,主打物理规律理解与音画一体化生成,支持文本/图片/视频多模态输入。
- 把物理规律与音画同步作为主要方向,与多数「提升画质」路线形成差异
- 第三方榜单(Artificial Analysis、Arena.ai)有排名记录,可交叉参考
- 需要极长单次生成的项目——官方规格为 5–20 秒,长叙事仍需分段拼接
- 要求独立第三方实测结论才决策的场景——该模型发布仅两日,暂无独立复现
HiDream-O1-Video 是什么?
HiDream-O1-Video-1.0(简称 HD-V1)是智象未来于 2026 年 9 月 15 日发布的首个原生全模态视频生成模型,采用自研原生全模态架构,支持文本、图片、视频等多种模态输入,官方称可一键直出 5–20 秒 1080p 视频。
HD-V1 的差异化方向不是画质与时长,而是「意图理解 + 物理规律 + 音画一体」。据官方介绍,模型前置多模态意图理解模块做结构化规划(镜头时长、场景、角色、运镜、台词与音效等),并将重力、碰撞、惯性、光影衰减、空间连续性等物理规律纳入生成逻辑;同时采用原生全模态联合建模,让文本、视频、音频在同一过程中相互对齐,而非先出画面再后期配音。
榜单表现:在 Artificial Analysis Image to Video Leaderboard(With Audio)取得全球第四;在 Arena.ai Image-to-Video 盲测榜取得第 8。两项均为第三方评测平台成绩,但具体分数与评测时间未在报道中完整披露。
需要客观看待的是:上述能力描述与榜单排名均来自官方发布与媒体报道,百器AI 尚未实测,无法独立验证「物理规律理解」与「音画同步」的实际表现;5–20 秒 1080p 为官方规格,实际可用时长与清晰度需以产品体验为准;该模型发布仅两日,长期稳定性与计费方式均无公开数据。
产品截图

主要功能
原生全模态架构:文本、图片、视频多模态输入
物理规律理解:重力、碰撞、惯性、光影衰减纳入生成逻辑(官方口径)
前置意图理解模块:结构化规划镜头、角色、运镜与音效
音画一体化生成:文本/视频/音频联合建模,非后期拼接(官方口径)
内容决定时长:模型按叙事节奏自主规划生成时长,而非固定提示词时长
官方规格:一键直出 5–20 秒 1080p 视频
如何使用
访问智象未来官网了解 HD-V1 的开放方式与额度
准备文本提示词,或上传图片/视频作为输入
描述期望的场景、角色动作与声音要求
生成后检查物理合理性(物体运动、碰撞反馈)与音画同步
重要商用内容人工复核后再使用
核心优势
把物理规律与音画同步作为主要方向,与多数「提升画质」路线形成差异
第三方榜单(Artificial Analysis、Arena.ai)有排名记录,可交叉参考
支持文本/图片/视频多种输入,模态覆盖较全
同类竞品对比
| 对比维度 | HiDream-O1-Video | 可灵 AI | Vidu |
|---|---|---|---|
| 核心方向 | 物理规律理解 + 音画一体化生成;前置意图理解做结构化规划 | 视频生成质量与可控性 | 实时交互与视频流编辑(S2 系列) |
| 模态输入 | 文本、图片、视频(原生全模态) | 文本、图片 | 文本、图片、视频流 |
| 官方规格 | 一键直出 5–20 秒 1080p | 按模型版本不同 | S2-Avatar 实时输出 720P |
| 第三方榜单 | Artificial Analysis 图生视频(含音频)全球第四;Arena.ai 第 8 | 未见本轮更新数据 | 未见本轮更新数据 |
| 百器AI 核验状态 | 已核验来源,未实测 | 已收录,未实测 | 已核验 S2 事实,未实测 |
应用场景
短视频素材
广告分镜
创意样片
音画同步要求较高的内容
标签
注意点
百器AI 未实测,物理规律与音画同步的实际表现无法独立验证
官方称 5–20 秒,长叙事仍受单次时长限制
发布仅两日,稳定性、计费与额度均无公开数据
榜单排名未披露具体分数与评测时间,横向比较依据不足
不适用边界
常见问题
智象未来(HiDream.ai)于 2026 年 9 月 15 日发布的首个原生全模态视频生成模型,官方简称 HD-V1,支持文本、图片、视频多模态输入,官方称可直出 5–20 秒 1080p 视频。