标签: #audio-lm
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 1 篇
SOTA 语音识别与合成解析 — 从 Whisper 到编解码器语言模型
梳理语音识别(ASR)与语音合成(TTS)的最新趋势。从 HMM 到 CTC/注意力机制,从 Whisper 的大规模弱监督学习,到 Tacotron、神经声码器与编解码器语言模型,逐一审视其脉络与架构原理。
2026-06-30 · 30 分钟阅读 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec