タグ: #text-to-speech
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
音声モデルの選び方: STTとTTSの実践基準
音声モデルはテキストモデルと違い、対応言語、音声長の制約、リアルタイム性、話者分離の要否が先に決まり、その後にモデルが決まります。この記事は2026-08-12に確認したSTTとTTSのオープンモデルのパラメータ、ライセンス、対応言語、音声制約を整理し、リアルタイムという語をどう分解すべきか、カードに書かれた幻覚と同意に関する警告がなぜ設計制約になるのかを説明します。オープンモデルガイドシリーズ第5回です。
2026-08-12 · 12 分で読めます #ai#huggingface#open-source-llm#speech-to-text#text-to-speech音声認識・合成の技術レポート、何を読むか — WERという一つの数字では見えないもの
音声認識と合成の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。WhisperとOmnilingual ASR、Qwen3-ASR、Open ASR Leaderboard、Seed-TTSとF5-TTS、CosyVoice 2、Qwen3-TTS、Fish Audio S2、Moshi、Qwen2.5-OmniとMOSS-Audioが何を新しく行い、著者がどんな限界を述べたかを読みます。順位ではなく遅延
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#speech-recognition#text-to-speechtts-bench: 品質が主観的なとき、ローカル TTS をどう比べるか
tts-bench は開発者 5uck1ess によるローカルベンチマークで、手元のハードウェアで55の TTS モデルを比較します。評価を三つのレンズに分けます。速度(TTFA・RTF・メモリ)、試聴(すべてのモデルを耳で判断)、スコア(UTMOS・WER・SIM)です。最も興味深いのは主観性に対する正直さです。「最も良く聞こえる」という単一のスコアはありません。品質はあなたの耳と用途に依存するからです。本稿では、このツールが実際に何
2026-07-11 · 9 分で読めます #tts#text-to-speech#benchmark#local-ai#evaluationSOTA音声認識・合成分析 — Whisperからコーデック言語モデルまで
音声認識(ASR)と音声合成(TTS)の最新の流れを整理します。HMMからCTC/アテンション、Whisperの大規模弱教師あり学習、そしてTacotronからニューラルボコーダとコーデック言語モデルまで、系譜とアーキテクチャの原理を見ていきます。
2026-06-30 · 32 分で読めます #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec