标签: #whisper
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 3 篇
SOTA 语音识别与合成解析 — 从 Whisper 到编解码器语言模型
梳理语音识别(ASR)与语音合成(TTS)的最新趋势。从 HMM 到 CTC/注意力机制,从 Whisper 的大规模弱监督学习,到 Tacotron、神经声码器与编解码器语言模型,逐一审视其脉络与架构原理。
2026-06-30 · 30 分钟阅读 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec多模态 LLM 完全指南:Vision、文档理解、OCR、视频、音频、韩语的特殊性(2025)
只处理文本的时代结束了。2025 年的 LLM 能自然地处理图像、文档、视频与音频。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 对比、Document AI 与版面理解、OCR 的现代化、视频与音频、韩语文档的特殊性,以及多模态 RAG。用实战案例梳理的一篇。
2026-04-15 · 18 分钟阅读 #multimodal#vision-llm#document-ai#ocr#whisper语音与音频 AI 完全指南:Whisper、TTS、说话人识别、音乐生成
涵盖 MFCC/Mel 频谱图音频特征提取、Whisper ASR、FastSpeech2/VITS TTS、pyannote 说话人分离,直至 MusicGen 音乐生成的语音 AI 完全指南。
2026-03-17 · 21 分钟阅读 #voice-ai#whisper#tts#화자인식#musicgen