ElevenLabs 发布 Dubbing v2 配音 API:92 种语言、保留情感与声质,全球多语言内容出海提速
8 月 6 日,ElevenLabs 宣布通过 ElevenAPI 提供新一代配音模型 Dubbing v2:支持 92 种语言,基于原始表演生成配音,情感、语气与表达方式完整保留,具备同步感知翻译能力。多语言内容制作从「重新配音」走向「一键本地化」。
核心结论
Dubbing v2 支持 92 种语言,音频转音频模型保留情感、语气与表达方式
多语言内容制作从「重新配音」走向「一键本地化」,成本与周期大幅下降
适合短视频出海、课程本地化、有声书多语言发行等场景
版权授权、口型同步、文化适配是落地三大注意事项
落地检查清单
Dubbing v2 是什么
8 月 6 日,ElevenLabs 宣布通过 ElevenAPI 提供新一代配音模型 Dubbing v2:支持 92 种语言的同步感知翻译,基于原始表演(音频)生成配音,情感、语气和表达方式都能完整保留。与早期「文字翻译 + TTS」的流水线不同,Dubbing v2 是音频转音频模型,直接学习原声表演再生成目标语言配音。
对内容创作者来说,这意味着:一段中文口播视频,可以一键生成情感一致的英文、日文、西班牙语版本,而不再需要重新找配音演员或接受机械的机器翻译腔。
对内容出海的实际价值
三条价值线:一是成本,传统多语言配音按语种计费且周期长,API 化后边际成本趋近于零;二是速度,从「每语种 1-2 周」压缩到「分钟级出初稿」;三是质量,保留原声的情感与节奏,让本地化内容不再是「翻译腔」。
典型场景:短视频出海(抖音/TikTok 多语种矩阵)、课程本地化、影视预告片、有声书多语言发行、企业宣传片国际化。
落地注意事项
第一,版权与授权:被配音的音频素材需拥有原声与翻译的双重授权,涉及名人声音务必确认许可。第二,口型同步:配音后的音频用于视频时,需要配合口型对齐工具,ElevenLabs 生态与主流剪辑软件有集成方案。第三,文化适配:同步感知翻译不等于文化本地化,俚语、梗、敏感表达仍需人工审校。
建议工作流:先用小样(30-60 秒)验证目标语言质量 → 批量生产 → 人工抽查关键片段 → 上线。涉及品牌内容的正式发布,保留人工审校节点。
界面与截图

常见问题
Dubbing v2 支持哪些语言?
92 种语言,具备同步感知翻译能力,基于原声表演生成配音。
配音质量如何?
官方称情感、语气与表达方式完整保留,具体质量建议用自己素材实测。
商用需要注意什么?
确认音频素材授权、名人声音许可,以及平台对 AI 配音内容的标注要求。
和传统配音比成本如何?
API 化后边际成本大幅下降,但正式商业项目仍需预留人工审校与后期成本。