LabHub

ブログ

Voice AI 実践完全ガイド:リアルタイム STT/TTS、音声 LLM、Turn-taking、ディープフェイク防御 (2025)

한국어English日本語中文

Season 4 Ep 9 — Ep 8 ではオーディオは複数のモダリティのうちの一つだった。Ep 9 は音声プロダクト一つに集中する。リアルタイム性・自然さ・安全性 — この三つを同時に掴むのがなぜ難しいのか、そしてどう掴むのか。

Prologue — 「画面のない AI」の年

2024 年 5 月の OpenAI による GPT-4o デモは音声 AI の転換点だった。レイテンシ ~300ms、自然な発音、感情表現、インターラプション — 従来の STT→LLM→TTS パイプラインでは到達しづらい品質を、単一の end-to-end モデルが見せた。

2025 年現在:

この記事は「音声 AI を作るときに知っておくべきすべて」を一息で整理する。


第1章 · 二つのアーキテクチャ

1.1 従来のパイプライン (STT → LLM → TTS)

[マイク]VAD[ストリーミング STT][LLM][ストリーミング TTS][スピーカー]

1.2 音声 LLM (end-to-end)

[マイク][音声 LLM: 音声 → 音声][スピーカー]

1.3 2025 年のハイブリッドな現実


第2章 · リアルタイムパイプラインの設計

2.1 VAD (Voice Activity Detection)

2.2 ストリーミング STT

2.3 LLM の処理

2.4 ストリーミング TTS

2.5 インターラプション (Barge-in)


第3章 · レイテンシバジェットの設計

3.1 目標

研究でも現場でもよく引用される数値: 人の会話の平均的なターン間ギャップは ~200ms。AI が 500ms–1s 以内に応答すれば自然だと感じる。1.5s を超えると不自然になる。

3.2 バジェットの例 (従来のパイプライン)

VAD end-of-utterance 検出: 150ms
STT 最終結果: 150ms
LLM TTFT(最初のトークン): 300ms
TTS 最初のオーディオチャンク: 150ms
ネットワーク・デコード: 100ms
───────────────────
最初の音声再生までの合計: 約 850ms

3.3 短縮ポイント

3.4 ジッターと安定性


第4章 · 音声 LLM — GPT-4o Realtime、Gemini Live、Moshi

4.1 GPT-4o Realtime

4.2 Gemini Live

4.3 Moshi (Kyutai、オープン)

4.4 違い

項目GPT-4oGemini LiveMoshi
価格高いセルフホスティング
韓国語優秀優秀限定的
カスタム限定的限定的高い (オープン)
モーダル混合音声・テキスト音声・ビデオ・テキスト音声中心
エンタープライズAPI + ロギングGoogle Cloud自前で管理

第5章 · 感情・抑揚・速度 — Expressive Speech

5.1 TTS の制御軸

5.2 SSML (Speech Synthesis Markup Language)

<speak>
  こんにちは、<break time="300ms"/>
  今日は <emphasis level="strong">とても大切な</emphasis> お話をしましょう。
</speak>

5.3 感情の政治学

すべての声に同じトーンを使ってはいけない。サービスの文脈に合わせてプロファイルを分ける。


第6章 · 電話(PSTN)・ブラウザ・モバイル

6.1 電話の統合

6.2 ブラウザ

6.3 モバイルアプリ

6.4 自動車・組み込み


第7章 · ディープフェイク・音声クローンの脅威と防御

7.1 脅威

7.2 防御レイヤー

  1. ライブネス検出: 用意されたセリフか、リアルタイムの応答を要求するか
  2. 音声生体認証: 声紋 + 行動ベースの二重化
  3. ディープフェイク検出: 合成音声の分類器(精度は 90% 台、完全ではない)
  4. コールバック確認: 機微な要求は登録された番号にコールバック
  5. AI 表示の義務化: 一部の国・州の法令(AI 音声である場合の告知)

7.3 ウォーターマーキング

7.4 運用ポリシー


第8章 · 韓国語音声プロダクトの特殊性

8.1 STT

8.2 TTS

8.3 法・規制

8.4 文化・UX


第9章 · コスト・運用

9.1 コストの構成

9.2 スケーリング

9.3 オブザーバビリティ


第10章 · 実戦ケース 3 選

10.1 コールセンターの一次対応

10.2 英会話学習アプリ

10.3 シニアケア・ウェルビーイング


第11章 · UX 原則 12 か条

  1. レイテンシがすべて: 1 秒を超えると不自然
  2. インターラプション: ユーザーが遮ったら即座に停止
  3. 短く: 1 ターンあたり 3–5 文以内
  4. 不確実性のシグナル: わからないときは「よくわかりません」と明示
  5. スプーフィング防止: 機微な操作は音声だけでは不可
  6. 感情の抑制: ブランドトーン優先、過剰な演出は禁止
  7. フィラー: 「うん」「はい」のような短い信号で「聞いています」を伝える
  8. 聞き返し: ユーザーが「なんて?」と言ったら速度・発音を調整
  9. 終了シグナル: 「ほかにお手伝いできることはありますか?」で自然に締める
  10. エラー復旧: STT が間違っていそうなら「私の理解で合っていますか?」と聞き返す
  11. 個人情報の遮断: カード番号・住民番号の音声入力は避ける
  12. アクセシビリティ: 聴覚障害者・高齢者向けの UX は別に設計

第12章 · アンチパターン 10 選

12.1 レイテンシを測らずにリリース

体感品質の 90% はレイテンシ。基準は p95。

12.2 LLM に長すぎるプロンプト

リアルタイム性が崩れる。システムプロンプトは短く鋭く。

12.3 インターラプション処理がない

話している最中も押し切ってくるロボット。UX を壊す。

12.4 感情・トーンに一貫性がない

ボイスを 3 つ混ぜて使い、ブランドが混乱する。

12.5 ディープフェイク検出だけを信じる

検出器は不完全。ライブネス・コールバック・ポリシーと併用する。

12.6 法的告知の欠落

通話録音・AI 応対の告知は必須。

12.7 バッチ TTS でリアルタイムを実装

チャンク単位のストリーミングに書き直す必要がある。

12.8 機微な取引を音声だけで

金融・医療の本人確認には追加チャネルを。

12.9 方言・高齢者の音声を無視

STT の精度のばらつきが大きい。サンプルの多様化 + カスタム化。

12.10 ログがない

紛争・品質改善の根拠を失う。


第13章 · チェックリスト — Voice AI ローンチ前の 12 項目


第14章 · 次回予告 — Season 4 Ep 10:「LLM セキュリティ」

音声もテキストも同じで、2025 年の LLM プロダクトにとって最大の脅威はセキュリティ事故だ。

「セキュリティは機能ではなくデフォルトだ」。ところが 2024–2025 年、多くの LLM プロダクトはまだ基本すら備えていない。

次の記事で会おう。


まとめ: Voice AI はリアルタイム性・自然さ・安全性の三拍子。従来のパイプラインと音声 LLM のどちらを選ぶかはレイテンシ・制御・コンプライアンスの要求次第であり、p95 レイテンシがユーザー体験の 90% を決める。感情・速度・トーンはブランドポリシーとして管理し、ディープフェイク・スプーフィングには多層防御が必須。韓国語プロダクトは Clova・Kakao・Supertone のような現地資産とグローバルな音声 LLM を組み合わせて品質の境界を最大化する。「画面のない AI」の時代、限界はもはや作る人の想像力だけだ。

コメント

まだコメントはありません。

ログインするとコメントできます