LabHub

博客

Voice AI 实战完全指南:实时 STT/TTS、语音 LLM、Turn-taking、深度伪造防御(2025)

한국어English日本語中文

Season 4 Ep 9 — 在 Ep 8 里,音频只是多种模态之一。Ep 9 只聚焦语音这一类产品。实时性・自然度・安全性 — 为什么把这三者同时抓住很难,以及该怎么抓。

Prologue — “没有屏幕的 AI”之年

2024 年 5 月 OpenAI 的 GPT-4o 演示是语音 AI 的转折点。延迟 ~300ms、自然的发音、情感表达、打断 — 传统 STT→LLM→TTS 流水线难以抵达的品质,被一个端到端模型呈现了出来。

2025 年现在:

这篇文章一口气梳理“做语音 AI 时该知道的全部”。


第1章 · 两种架构

1.1 传统流水线(STT → LLM → TTS)

[麦克风]VAD[流式 STT][LLM][流式 TTS][扬声器]

1.2 语音 LLM(end-to-end)

[麦克风][语音 LLM:语音 → 语音][扬声器]

1.3 2025 年的混合现实


第2章 · 实时流水线设计

2.1 VAD(Voice Activity Detection)

2.2 流式 STT

2.3 LLM 处理

2.4 流式 TTS

2.5 打断(Barge-in)


第3章 · 延迟预算设计

3.1 目标

研究与业界常引用的数字:人类对话的平均轮次间隔约 200ms。AI 在 500ms–1s 内回应就会让人觉得自然。超过 1.5s 就别扭了。

3.2 预算示例(传统流水线)

VAD end-of-utterance 检测: 150ms
STT 最终结果: 150ms
LLM TTFT(首个 token): 300ms
TTS 首个音频块: 150ms
网络与解码: 100ms
───────────────────
到首次语音播放的合计: 约 850ms

3.3 可压缩的地方

3.4 抖动与稳定性


第4章 · 语音 LLM — GPT-4o Realtime、Gemini Live、Moshi

4.1 GPT-4o Realtime

4.2 Gemini Live

4.3 Moshi(Kyutai,开源)

4.4 差异

项目GPT-4oGemini LiveMoshi
价格自托管
韩语优秀优秀有限
定制有限有限高(开源)
模态混合语音・文本语音・视频・文本以语音为主
企业级API + 日志Google Cloud自行管理

第5章 · 情感・语调・语速 — Expressive Speech

5.1 TTS 的控制轴

5.2 SSML(Speech Synthesis Markup Language)

<speak>
  你好,<break time="300ms"/>
  今天我们来聊一个 <emphasis level="strong">非常重要的</emphasis> 话题。
</speak>

5.3 情感的政治学

不要给所有声音都用同一种语气。按服务场景拆分配置文件。


第6章 · 电话(PSTN)・浏览器・移动端

6.1 电话集成

6.2 浏览器

6.3 移动应用

6.4 汽车・嵌入式


第7章 · 深度伪造・声音克隆的威胁与防御

7.1 威胁

7.2 防御层

  1. 活体检测:是准备好的台词,还是要求实时应答
  2. 声纹生物认证:声纹 + 行为的双重认证
  3. 深度伪造检测:合成语音分类器(准确率 90% 上下,并不完美)
  4. 回拨确认:敏感请求要回拨到已登记的号码
  5. AI 标识义务化:部分国家和州的法规(是 AI 语音时必须告知)

7.3 水印

7.4 运营策略


第8章 · 韩语语音产品的特殊性

8.1 STT

8.2 TTS

8.3 法律与监管

8.4 文化与 UX


第9章 · 成本与运营

9.1 成本构成

9.2 扩容

9.3 可观测性


第10章 · 实战案例 3 则

10.1 客服中心一线应对

10.2 英语会话学习应用

10.3 长者照护与身心健康


第11章 · UX 原则 12 条

  1. 延迟就是一切:超过 1 秒就别扭
  2. 打断:用户一打断就立即停下
  3. 要短:每轮控制在 3–5 句以内
  4. 不确定的信号:不知道就明说“我不太清楚”
  5. 防欺骗:敏感操作不能只凭语音
  6. 克制情感:品牌调性优先,禁止过度演绎
  7. 填充词:用“嗯”“好的”这类短信号传达“我在听”
  8. 重复提问:用户说“你说什么?”时就调整语速和发音
  9. 收尾信号:用“还需要别的帮助吗?”自然收场
  10. 错误恢复:觉得 STT 听错了就用“我这样理解对吗?”反问
  11. 屏蔽个人信息:不鼓励用语音输入卡号・身份证号
  12. 无障碍:为听障人士和长者单独设计 UX

第12章 · 反模式 10 选

12.1 不测延迟就上线

体感品质的 90% 是延迟。以 p95 为准。

12.2 给 LLM 过长的提示词

实时性会崩。系统提示要短而锋利。

12.3 没有打断处理

你说话时还一路硬推的机器人。会毁掉 UX。

12.4 情感与语气不一致

混着用三种声音,品牌就乱了。

12.5 只相信深度伪造检测

检测器并不完美。要与活体检测・回拨・策略并用。

12.6 遗漏法律告知

通话录音与 AI 应对的告知是必需的。

12.7 用批处理 TTS 做实时

需要重写成按块的流式处理。

12.8 敏感交易只走语音

金融・医疗的本人认证要加一条通道。

12.9 无视方言与长者的声音

STT 准确率差异很大。样本多样化 + 定制化。

12.10 没有日志

失去纠纷处理与品质改进的依据。


第13章 · 检查清单 — Voice AI 上线前的 12 项


第14章 · 下期预告 — Season 4 Ep 10:“LLM 安全”

无论语音还是文本,2025 年 LLM 产品最大的威胁都是安全事故

“安全不是功能,而是默认值。” 然而 2024–2025 年,很多 LLM 产品连基本盘都还没搭好。

下篇文章再见。


小结:Voice AI 是实时性・自然度・安全性这三拍。选传统流水线还是语音 LLM,取决于你对延迟・控制力・合规的要求,而 p95 延迟决定了用户体验的 90%。情感・语速・语气要用品牌策略来管理,深度伪造与欺骗则必须靠多层防御。韩语产品会把 Clova・Kakao・Supertone 这类本地资产与全球语音 LLM 组合起来,把品质边界推到最大。“没有屏幕的 AI”时代,如今的极限只剩下做产品的人的想象力。

评论

还没有评论。

登录后即可发表评论