产品解说
视觉配音规划预览
认识新仪表板:一种更平静的方式,用于审查活动表现、审批素材,并在发布前保持团队同步。
- Direction
- 温暖、自信,中等语速。优先考虑清晰度而非戏剧性情感。
- Settings cue
- 从接近中间的稳定性开始,中等相似度,低风格,速度接近 1.0。
- Best for
- SaaS 演示、产品入门、投资者解说和帮助中心导览。
最先进的情感感知语音合成模型。在 29 种语言中生成自然逼真、情感丰富的语音。
创作者规划指南
这些是规划预览,不是存储的模型输出。请用它们来决定脚本语气、节奏和设置,再运行上方的实时生成器。
视觉配音规划预览
认识新仪表板:一种更平静的方式,用于审查活动表现、审批素材,并在发布前保持团队同步。
视觉配音规划预览
欢迎来到音频指南。选择您偏好的语言,并按自己的节奏跟随每一章节。
视觉配音规划预览
在本章中,我们将比较三种常见方法,并展示每种方法在实际生产工作中的失败之处。
何时使用多语言 v2
本页面适用于当前的文本转语音模型,而非已停用的语音转文字或音效工作流。
生成器状态
当前可用的 TTS 生成器
AISnapEdit 将 Multilingual v2 作为文本转语音选项提供,用于多语言配音草稿。
语言覆盖范围
29 种语言
ElevenLabs 将多语言 v2 列为其支持 29 种语言的语音合成模型。
计费依据
Characters
TTS 成本基于文本长度,因此在运行最终生成前,请修剪草稿。
最佳默认设置
Narration
当语音质量、口音匹配度和一致性比原始速度更重要时使用。
营销视频、课程讲解、产品解说和演示旁白受益于有意识的语气和受控的速度。
将每种语言分别准备为独立审核脚本,并选择匹配目标地区的配音。
分段撰写草稿,生成短版本,仅在发音和节奏确认后才消耗积分进行最终脚本生成。
规划脚本,选择配音,然后分可审查部分生成。
为口语而非静读写作。较短的句子通常会产生更流畅的节奏。
先选择语音,然后仅在需要时调整稳定性、相似度、风格和速度。
在将音频用于生产前,注意听名字、数字、语气变化和不自然的停顿。
这些控制选项与 AISnapEdit 当前暴露的请求字段相匹配。
Text
每次生成
使用最终稿,而非草稿笔记。对于长脚本,应在自然段落或章节边界处进行拆分。
Voice
语气和口音选择
在调整其他控制选项之前,先选择适合目标语言、地区和内容类别的语音。
Stability
一致性与变化性
较高的数值有助于重复叙述听起来更稳定;较低的数值可能感觉更具表现力,但预测性较差。
Similarity
语音匹配
使用此功能可使输出更贴近所选语音特征。
Style
富有表现力的演绎
仅在脚本需要更多能量或情感时增加。对于解释类和培训类内容,应保持克制。
Speed
节奏控制
叙述时尽量接近 1.0。对于密集、多语言或包含大量数字的脚本,可适当放慢速度。
两个活跃的 AISnapEdit TTS 页面服务于不同的制作决策。
主要适用场景
以质量为先的叙述及多语言配音规划。
对速度敏感的草稿、代理任务以及高产量的短脚本。
当最终语音质量比处理速度更重要时,使用 Multilingual v2。
语言覆盖范围
ElevenLabs 列出了 29 种支持的语言。
ElevenLabs 文档中提到,v2.5 速度路径使用 v2 语言集,并额外支持匈牙利语、挪威语和越南语。
使用语言覆盖范围和口音行为与您的脚本相匹配的模型。
脚本长度
ElevenLabs 列出的请求字符限制为 10,000 字符。
v2.5 速度路径的文档中提到了更高的字符限制。
无论采用哪种方式,都应拆分生产脚本,使每个生成部分都易于审查。
语言代码
最好通过清晰的文本和匹配的语音选择来处理。
AISnapEdit 为 Turbo 路由暴露了 language_code。
当显式语言强制是工作流程的一部分时,使用 Turbo。
已停用的转录页面仍可被索引为存档指南,但此活跃模型页面仅支持文字转语音生成。
使用权限取决于提供方条款、账户上下文以及您的输入内容。在发布生成的音频前,请审阅相关条款。
Find answers to common questions about this model
ElevenLabs 多语言 v2 是最先进的情感感知语音合成模型,能够在 29 种语言中生成自然逼真、情感丰富且具有上下文理解能力的语音。
支持 29 种语言,包括英语、中文、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、印地语、阿拉伯语、荷兰语、波兰语、瑞典语、土耳其语、印尼语等。
20+ 默认语音包括 Aria、Roger、Sarah、Laura、Charlie、George、Callum、River、Liam、Charlotte、Alice、Matilda、Will、Jessica、Eric、Chris、Brian、Daniel、Lily 和 Bill。还可访问 10,000+ 社区共享语音。
是的,模型可以自动检测书面语言并处理语码转换,在不同语言之间自然过渡,同时保持语音一致性。
调整稳定性(0-1,控制一致性)、相似度提升(0-1,语音匹配)、风格夸张度(0-1,情感强度)和速度(0.7x 到 1.2x)。
单次请求最多可转换 10,000 个字符,可生成约 10 分钟的音频。该模型在长文本内容上最为稳定。
将文字转换为 29+ 种语言的自然流畅语音