标签: #text-to-speech
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 2 篇
tts-bench:当质量主观时,如何比较本地 TTS
tts-bench 是开发者 5uck1ess 打造的本地基准测试,让你在手头的硬件上比较 55 个 TTS 模型。它把评测拆成三个视角:速度(TTFA、RTF、内存)、试听(用耳朵判断每一个模型)、评分(UTMOS、WER、SIM)。最有意思的是它对主观性的坦诚——没有一个"最好听"的单一分数,因为质量取决于你的耳朵和用途。本文梳理这个工具实际测量什么,客观指标在哪里有帮助、在哪里会误导,以及如何为自己的工作负载挑选合适的 TTS。
2026-07-11 · 8 分钟阅读 #tts#text-to-speech#benchmark#local-ai#evaluationSOTA 语音识别与合成解析 — 从 Whisper 到编解码器语言模型
梳理语音识别(ASR)与语音合成(TTS)的最新趋势。从 HMM 到 CTC/注意力机制,从 Whisper 的大规模弱监督学习,到 Tacotron、神经声码器与编解码器语言模型,逐一审视其脉络与架构原理。
2026-06-30 · 30 分钟阅读 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec