태그: #whisper
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
SOTA 음성 인식·합성 분석 — Whisper에서 코덱 언어모델까지
음성 인식(ASR)과 음성 합성(TTS)의 최신 흐름을 정리합니다. HMM에서 CTC/어텐션, Whisper의 대규모 약지도 학습, 그리고 Tacotron에서 뉴럴 보코더와 코덱 언어모델까지 계보와 아키텍처 원리를 살펴봅니다.
2026-06-30 · 35 분 읽기 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec음성 AI 2026 — ElevenLabs / Cartesia / Sesame / Whisper Turbo / Deepgram / Parakeet 심층 가이드
2024년 10월 Whisper Large v3 Turbo가 8배 빨라지고, Cartesia가 Mamba 저자들 손으로 90ms TTS를 만들고, Sesame의 Brendan Iribe가 "voice presence"를 들고 나오면서 2026년 음성 AI는 TTS·STT·실시간 에이전트 세 축이 모두 폭발했다. ElevenLabs V3부터 NVIDIA Parakeet 1.1, VOICEVOX
2026-05-15 · 36 분 읽기 #voice-ai#tts#stt#asr#elevenlabs멀티모달 LLM 완전 가이드: Vision, 문서 이해, OCR, 비디오, 오디오, 한국어 특수성 (2025)
텍스트만 다루던 시대가 끝났다. 2025년 LLM은 이미지·문서·영상·오디오를 자연스럽게 처리한다. GPT-4o/Claude 3.5/Gemini/Qwen2-VL/Pixtral 비교, Document AI와 레이아웃 이해, OCR의 현대화, 비디오·오디오, 한국어 문서 특수성, 그리고 멀티모달 RAG까지. 실전 케이스로 정리한 한 편.
2026-04-15 · 19 분 읽기 #multimodal#vision-llm#document-ai#ocr#whisper음성 & 오디오 AI 완전 정복: Whisper, TTS, 화자 인식, 음악 생성까지
MFCC/Mel spectrogram 오디오 특징 추출, Whisper ASR, FastSpeech2/VITS TTS, pyannote 화자 분리, MusicGen 음악 생성까지 음성 AI 완전 가이드입니다.
2026-03-17 · 22 분 읽기 #voice-ai#whisper#tts#화자인식#musicgen음성 챗봇 구축 가이드: STT/TTS 파이프라인과 실시간 음성 인터페이스 구현
음성 챗봇 구축의 모든 것. Whisper STT, TTS 엔진 비교, 실시간 음성 스트리밍 아키텍처, WebSocket 기반 양방향 통신, LLM 연동, 지연 시간 최적화와 프로덕션 운영 가이드까지 다룹니다.
2026-03-08 · 43 분 읽기 #chatbot#voice#stt#tts#speech-recognition