タグ: #whisper
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 5 件
SOTA音声認識・合成分析 — Whisperからコーデック言語モデルまで
音声認識(ASR)と音声合成(TTS)の最新の流れを整理します。HMMからCTC/アテンション、Whisperの大規模弱教師あり学習、そしてTacotronからニューラルボコーダとコーデック言語モデルまで、系譜とアーキテクチャの原理を見ていきます。
2026-06-30 · 32 分で読めます #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec音声AI 2026 — ElevenLabs / Cartesia / Sesame / Whisper Turbo / Deepgram / Parakeet 徹底ガイド
2024年10月にWhisper Large v3 Turboが8倍速くなり、Mamba著者たちが立ち上げたCartesiaが90ms未満TTSを出し、Sesame(Brendan Iribe)が「voice presence」で殴り込み、2026年5月時点で音声AIのTTS・STT・リアルタイムエージェントの3軸が同時に爆発した。ElevenLabs V3からNVIDIA Parakeet 1.1、VOICEVOX、F5-TTS、Va
2026-05-15 · 31 分で読めます #voice-ai#tts#stt#asr#elevenlabsマルチモーダルLLM完全ガイド: Vision、文書理解、OCR、動画、音声、韓国語の特殊性 (2025)
テキストだけを扱う時代は終わった。2025年のLLMは画像・文書・映像・音声を自然に処理する。GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtralの比較、Document AIとレイアウト理解、OCRの現代化、動画・音声、韓国語文書の特殊性、そしてマルチモーダルRAGまで。実戦ケースで整理した一本。
2026-04-15 · 18 分で読めます #multimodal#vision-llm#document-ai#ocr#whisper音声・オーディオAI完全ガイド:ASR、TTS、Whisper、Wav2Vecから音声合成まで
音声・オーディオAIの基礎から最先端技術まで網羅した完全ガイド。音声信号処理、メルスペクトログラム、ASR(Whisper、Wav2Vec2)、TTS(Tacotron、VITS)、話者分離、音楽生成を実践コードで解説。
2026-03-17 · 18 分で読めます #speech-recognition#tts#whisper#wav2vec#audio-processing音声チャットボット構築ガイド:STT/TTSパイプラインとリアルタイム音声インターフェース実装
音声チャットボット構築のすべて。Whisper STT、TTSエンジン比較、リアルタイム音声ストリーミングアーキテクチャ、WebSocketベース双方向通信、LLM連携、レイテンシ最適化とプロダクション運用ガイドまで扱います。
2026-03-08 · 43 分で読めます #chatbot#voice#stt#tts#speech-recognition