태그: #speech-recognition
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speechSOTA 음성 인식·합성 분석 — Whisper에서 코덱 언어모델까지
음성 인식(ASR)과 음성 합성(TTS)의 최신 흐름을 정리합니다. HMM에서 CTC/어텐션, Whisper의 대규모 약지도 학습, 그리고 Tacotron에서 뉴럴 보코더와 코덱 언어모델까지 계보와 아키텍처 원리를 살펴봅니다.
2026-06-30 · 35 분 읽기 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codecWeb Audio API & 브라우저 오디오 2026 — AudioWorklet / Tone.js / Howler.js / Wavesurfer / Peaks.js / Meyda / Faust / Csound / Web Speech 심층 가이드
2026년 브라우저는 마침내 진짜 오디오 워크스테이션이 되었다. Web Audio API는 W3C 레벨 2 권고로 안정화됐고, AudioWorklet이 ScriptProcessor를 완전히 대체했으며, Tone.js·Howler.js·WaveSurfer.js·Peaks.js·Meyda 같은 라이브러리가 게임·음악·DAW·분석 영역을 각각 장악했다. Faust2WebAudio와 Csound o
2026-05-16 · 26 분 읽기 #web-audio#web-audio-api#audioworklet#audiocontext#offline-audio-context음성 챗봇 구축 가이드: STT/TTS 파이프라인과 실시간 음성 인터페이스 구현
음성 챗봇 구축의 모든 것. Whisper STT, TTS 엔진 비교, 실시간 음성 스트리밍 아키텍처, WebSocket 기반 양방향 통신, LLM 연동, 지연 시간 최적화와 프로덕션 운영 가이드까지 다룹니다.
2026-03-08 · 43 분 읽기 #chatbot#voice#stt#tts#speech-recognitiontorchaudio 완전 가이드 — 오디오 처리부터 음성인식, TTS, 음악 분석까지
torchaudio로 오디오 로드, 스펙트로그램 변환, Mel 필터뱅크, MFCC, 음성인식(Wav2Vec2/Whisper), TTS, 화자 분리, 노이즈 제거까지. 오디오 AI의 모든 것을 PyTorch로 다룹니다.
2026-03-02 · 11 분 읽기 #ai-platform#pytorch#torchaudio#audio#speech-recognition