标签: #speech-recognition
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
SOTA 语音识别与合成解析 — 从 Whisper 到编解码器语言模型
梳理语音识别(ASR)与语音合成(TTS)的最新趋势。从 HMM 到 CTC/注意力机制,从 Whisper 的大规模弱监督学习,到 Tacotron、神经声码器与编解码器语言模型,逐一审视其脉络与架构原理。
2026-06-30 · 30 分钟阅读 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codectorchaudio 完全指南 — 从音频处理到语音识别、TTS、音乐分析
用 torchaudio 讲透音频加载、频谱图变换、Mel 滤波器组、MFCC、语音识别(Wav2Vec2/Whisper)、TTS、说话人分离、降噪。音频 AI 的方方面面,全部用 PyTorch 覆盖。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchaudio#audio#speech-recognition