タグ: #asr
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 3 件
音声モデルの選び方: STTとTTSの実践基準
音声モデルはテキストモデルと違い、対応言語、音声長の制約、リアルタイム性、話者分離の要否が先に決まり、その後にモデルが決まります。この記事は2026-08-12に確認したSTTとTTSのオープンモデルのパラメータ、ライセンス、対応言語、音声制約を整理し、リアルタイムという語をどう分解すべきか、カードに書かれた幻覚と同意に関する警告がなぜ設計制約になるのかを説明します。オープンモデルガイドシリーズ第5回です。
2026-08-12 · 12 分で読めます #ai#huggingface#open-source-llm#speech-to-text#text-to-speech音声AI & TTS 2026 完全ガイド - ElevenLabs · Cartesia Sonic · OpenAI Voice · Play.HT · Hume · Sesame · Fish Audio · Deepgram Aura 徹底解説
2026年は音声AIが「STT → LLM → TTS」のパイプラインから、フルデュプレックスのリアルタイム音声エージェントへ完全に移行した年だ。ElevenLabs v3が多言語・感情TTSの王座を維持し、Cartesia Sonic 3はTTFW 75msでLiveKit Agentsのデフォルト、OpenAI Realtime API・Google Gemini Live・Anthropic Claude voice modeはL
2026-05-16 · 25 分で読めます #voice-ai#tts#elevenlabs#cartesia#openai-voice音声AI 2026 — ElevenLabs / Cartesia / Sesame / Whisper Turbo / Deepgram / Parakeet 徹底ガイド
2024年10月にWhisper Large v3 Turboが8倍速くなり、Mamba著者たちが立ち上げたCartesiaが90ms未満TTSを出し、Sesame(Brendan Iribe)が「voice presence」で殴り込み、2026年5月時点で音声AIのTTS・STT・リアルタイムエージェントの3軸が同時に爆発した。ElevenLabs V3からNVIDIA Parakeet 1.1、VOICEVOX、F5-TTS、Va
2026-05-15 · 31 分で読めます #voice-ai#tts#stt#asr#elevenlabs