タグ: #audio-language-model
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
音声認識・合成の技術レポート、何を読むか — WERという一つの数字では見えないもの
音声認識と合成の技術レポート10本を、arXivの原文アブストラクトで直接確認して整理しました。WhisperとOmnilingual ASR、Qwen3-ASR、Open ASR Leaderboard、Seed-TTSとF5-TTS、CosyVoice 2、Qwen3-TTS、Fish Audio S2、Moshi、Qwen2.5-OmniとMOSS-Audioが何を新しく行い、著者がどんな限界を述べたかを読みます。順位ではなく遅延
2026-08-12 · 13 分で読めます #ai-papers#paper-review#technical-report#speech-recognition#text-to-speechSOTA音楽・オーディオ生成の分析 — ニューラルコーデックと生成モデル
オーディオ表現(波形・スペクトログラム・ニューラルコーデック)から自己回帰オーディオ言語モデル、拡散ベースのオーディオ、テキスト音楽条件付けまで、系譜を中心に整理します。EnCodec、MusicGen、AudioLM系列の原理と商用モデル、評価・著作権の論点をアーキテクチャの観点から分析します。
2026-06-30 · 14 分で読めます #ai-papers#audio-generation#music-generation#neural-codec#audio-language-model