标签: #tts
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 5 篇
tts-bench:当质量主观时,如何比较本地 TTS
tts-bench 是开发者 5uck1ess 打造的本地基准测试,让你在手头的硬件上比较 55 个 TTS 模型。它把评测拆成三个视角:速度(TTFA、RTF、内存)、试听(用耳朵判断每一个模型)、评分(UTMOS、WER、SIM)。最有意思的是它对主观性的坦诚——没有一个"最好听"的单一分数,因为质量取决于你的耳朵和用途。本文梳理这个工具实际测量什么,客观指标在哪里有帮助、在哪里会误导,以及如何为自己的工作负载挑选合适的 TTS。
2026-07-11 · 8 分钟阅读 #tts#text-to-speech#benchmark#local-ai#evaluationVoice AI 实战完全指南:实时 STT/TTS、语音 LLM、Turn-taking、深度伪造防御(2025)
“没有屏幕的 AI”为什么会成为 2025 年最火的产品类别。实时语音流水线(VAD/STT/LLM/TTS)、语音 LLM(GPT-4o realtime/Gemini Live/Moshi)、Turn-taking 与打断、情感与语调控制、电话・浏览器・移动端的实战、深度伪造防御与安全,以及韩语语音产品的特殊性。
2026-04-15 · 16 分钟阅读 #voice-ai#stt#tts#gpt-4o-realtime#moshi语音与音频 AI 完全指南:Whisper、TTS、说话人识别、音乐生成
涵盖 MFCC/Mel 频谱图音频特征提取、Whisper ASR、FastSpeech2/VITS TTS、pyannote 说话人分离,直至 MusicGen 音乐生成的语音 AI 完全指南。
2026-03-17 · 21 分钟阅读 #voice-ai#whisper#tts#화자인식#musicgen开源实时对话式语音聊天机器人构建指南:Barge-In(应答中断)支持架构与实现
仅用开源工具实现实时语音聊天机器人的综合指南。涵盖用 Silero VAD、faster-whisper、Ollama、Piper TTS 组合而成的流水线中实现 barge-in(用户发话时立即中断应答)功能的状态机设计、Python 示例代码、延迟优化,直至韩语质量改善技巧。
2026-03-08 · 32 分钟阅读 #ai-platform#voice-chatbot#barge-in#realtime-audio#stttorchaudio 完全指南 — 从音频处理到语音识别、TTS、音乐分析
用 torchaudio 讲透音频加载、频谱图变换、Mel 滤波器组、MFCC、语音识别(Wav2Vec2/Whisper)、TTS、说话人分离、降噪。音频 AI 的方方面面,全部用 PyTorch 覆盖。
2026-03-02 · 10 分钟阅读 #ai-platform#pytorch#torchaudio#audio#speech-recognition