AI 语音合成(TTS)在 2026 年已经达到了「难辨真假」的水平。ElevenLabs 是目前语音合成效果最好的平台——不仅能生成自然度极高的语音,还能克隆你自己的声音、做多角色对话配音、控制情感和语速。本教程从零开始,带你做一条完整的配音作品。

ElevenLabs 核心能力一览

  • Text to Speech:文字转语音,支持 29 种语言,中文效果优秀
  • Voice Cloning:上传 1-3 分钟音频克隆声音,免费版可克隆 3 个
  • Voice Design:用文字描述生成全新虚拟声音(如「中年男性,低沉磁性,带轻微英式口音」)
  • Multi-Speaker:一段文字中分配不同角色声音,自动生成对话音频
  • Sound Effects:生成音效(雨声、脚步声、环境音),不限于语音
  • 价格:免费版每月 10000 字符,Starter 版 $5/月 30000 字符,Creator 版 $22/月 100000 字符

第一步:注册并体验基础 TTS

打开 elevenlabs.io 注册账号。进入后默认就是 Text to Speech 界面。

左侧选择声音(免费有约 20 个预制声音),右侧文本框输入要合成的文字。

试试这段中文:

大家好,欢迎收听本期播客。今天我们来聊聊 AI 语音合成技术的最新进展。你可能已经发现,现在的 AI 声音和两年前完全不同了——它不再机械,而是有了情感、有了停顿、甚至能模仿笑声和叹息。

点击 Generate,等待 3-5 秒就能听到效果。免费声音中推荐:

  • Adam:低沉男声,适合纪录片和旁白
  • Rachel:清晰女声,适合教程和新闻
  • Antoni:年轻男声,适合播客和短视频
  • Bella:温柔女声,适合有声书和故事

第二步:调整语音参数

文字框下方有三个关键滑块:

  • Stability(稳定性):越高声音越一致稳定,越低越有表现力但可能不稳定。建议 30-50%
  • Similarity(相似度):越高越像原始声音特征。克隆声音时建议 75-90%
  • Style Exaggeration(风格强度):越高越夸张。0 适合正式内容,高值适合角色配音

进阶技巧——在文本中用标记控制语音节奏:

第一句。---(长停顿)第二句。+++(语速加快)第三句。。。(犹豫停顿)

ElevenLabs 会识别这些标点符号的变化并调整语音节奏。省略号、破折号、感叹号都有不同的效果。

第三步:声音克隆(Voice Cloning)

这是 ElevenLabs 最强大的功能。你只需要 1-3 分钟的清晰录音就能克隆一个声音。

  1. 进入 Voices → Add New Voice → Choose Instant Cloning
  2. 上传音频文件(MP3/WAV,至少 1 分钟,清晰无噪音)
  3. 给声音命名,添加描述标签(如「30岁男性,普通话标准」)
  4. 等待 30 秒处理完成,就可以在 TTS 界面选择这个声音了

录音要求:

  • 环境安静,用手机录音即可,不需要专业麦克风
  • 正常语速朗读,不要刻意模仿播音腔
  • 覆盖常用音节:读一段 300 字的文章就足够了
  • 不要有背景音乐、风扇声等噪音

克隆效果:中文克隆的相似度约 85-90%,英文可达 95%+。个别词的发音可能略有偏差,可以通过调整文本中的拼音标注来纠正。

第四步:制作有声书 / 长篇配音

ElevenLabs 的 Projects 功能专为长篇内容设计:

  1. 进入 Projects → New Project
  2. 上传文本文件(TXT/EPUB)或直接粘贴长文本
  3. 在编辑器中将文本分段,每段可以指定不同的声音
  4. 支持插入停顿标记(---),控制段落之间的间隔
  5. 点击 Generate Audio,等待处理后下载完整音频

有声书制作技巧:

  • 叙述部分用一个声音,角色对话用克隆的不同声音
  • 章节之间插入 2 秒停顿标记(---)
  • 先做 1 分钟的测试片段,确认效果满意后再生成全文
  • 免费版有 10000 字符限制(约 20 分钟音频),Starter 版可做约 1 小时长篇

第五步:播客生成工作流

结合 ChatGPT + ElevenLabs 可以快速生成播客内容:

  • 第一步:用 ChatGPT 写播客脚本,格式为「主持人A:xxx / 嘉宾B:xxx」
  • 第二步:在 ElevenLabs 中为主持人和嘉宾各选一个声音
  • 第三步:用 Multi-Speaker 功能,将脚本按角色标记后一次性生成对话音频
  • 第四步:下载后用 Audacity 加片头片尾音乐,导出最终播客

注意事项:

  • 克隆他人声音需获得本人授权,未经授权使用可能涉及法律风险
  • 免费版生成的音频可以个人使用,商用需 Creator 版以上
  • 中文语速默认偏快,可以在文本中多加逗号和句号来降速
  • 如果个别字发音不准,可以用同音字替换或在旁边标注拼音

到这里,你已经能用 AI 做出专业级的配音和有声书了。建议先用免费版练习,找到最适合你内容风格的声音后,再考虑升级付费版做商用项目。