タグ: #audio-lm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 1 件
SOTA音声認識・合成分析 — Whisperからコーデック言語モデルまで
音声認識(ASR)と音声合成(TTS)の最新の流れを整理します。HMMからCTC/アテンション、Whisperの大規模弱教師あり学習、そしてTacotronからニューラルボコーダとコーデック言語モデルまで、系譜とアーキテクチャの原理を見ていきます。
2026-06-30 · 32 分で読めます #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec