タグ: #speech-recognition
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
音声認識・合成の技術レポート、何を読むか — WERという一つの数字では見えないもの
音声認識と合成の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。WhisperとOmnilingual ASR、Qwen3-ASR、Open ASR Leaderboard、Seed-TTSとF5-TTS、CosyVoice 2、Qwen3-TTS、Fish Audio S2、Moshi、Qwen2.5-OmniとMOSS-Audioが何を新しく行い、著者がどんな限界を述べたかを読みます。順位ではなく遅延
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#speech-recognition#text-to-speechSOTA音声認識・合成分析 — Whisperからコーデック言語モデルまで
音声認識(ASR)と音声合成(TTS)の最新の流れを整理します。HMMからCTC/アテンション、Whisperの大規模弱教師あり学習、そしてTacotronからニューラルボコーダとコーデック言語モデルまで、系譜とアーキテクチャの原理を見ていきます。
2026-06-30 · 32 分で読めます #ai-papers#speech-recognition#text-to-speech#whisper#neural-codecWeb Audio API & ブラウザオーディオ 2026 — AudioWorklet / Tone.js / Howler.js / Wavesurfer / Peaks.js / Meyda / Faust / Csound / Web Speech 深掘りガイド
2026年、ブラウザはついに本物のオーディオワークステーションになった。Web Audio APIは W3C Level 2 勧告として安定し、AudioWorklet は ScriptProcessor を完全に置き換えた。Tone.js・Howler.js・WaveSurfer.js・Peaks.js・Meyda などのライブラリが、ゲーム・音楽・DAW UI・解析の各分野を制した。Faust2WebAudio と Csound o
2026-05-16 · 22 分で読めます #web-audio#web-audio-api#audioworklet#audiocontext#offline-audio-context音声・オーディオAI完全ガイド:ASR、TTS、Whisper、Wav2Vecから音声合成まで
音声・オーディオAIの基礎から最先端技術まで網羅した完全ガイド。音声信号処理、メルスペクトログラム、ASR(Whisper、Wav2Vec2)、TTS(Tacotron、VITS)、話者分離、音楽生成を実践コードで解説。
2026-03-17 · 18 分で読めます #speech-recognition#tts#whisper#wav2vec#audio-processing音声チャットボット構築ガイド:STT/TTSパイプラインとリアルタイム音声インターフェース実装
音声チャットボット構築のすべて。Whisper STT、TTSエンジン比較、リアルタイム音声ストリーミングアーキテクチャ、WebSocketベース双方向通信、LLM連携、レイテンシ最適化とプロダクション運用ガイドまで扱います。
2026-03-08 · 43 分で読めます #chatbot#voice#stt#tts#speech-recognitiontorchaudio完全ガイド — オーディオ処理から音声認識、TTS、音楽分析まで
torchaudioでオーディオ読み込み、スペクトログラム変換、Melフィルタバンク、MFCC、音声認識(Wav2Vec2/Whisper)、TTS、話者分離、ノイズ除去まで。オーディオAIのすべてをPyTorchで扱います。
2026-03-02 · 11 分で読めます #ai-platform#pytorch#torchaudio#audio#speech-recognition