태그: #voice-ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
음성 AI & TTS 2026 완벽 가이드 - ElevenLabs · Cartesia Sonic · OpenAI Voice · Play.HT · Hume · Sesame · Fish Audio · Deepgram Aura 심층 분석
2026년의 음성 AI는 STT → LLM → TTS 파이프라인이 끝나고, 풀듀플렉스 실시간 음성 에이전트가 표준이 된 해다. ElevenLabs v3가 다국어·감정 TTS의 왕좌를 지키는 동안, Cartesia Sonic은 75ms TTFW로 LiveKit Agents의 기본 TTS가 됐고, OpenAI Realtime API · Google Gemini Live · Anthropic Cl
2026-05-16 · 28 분 읽기 #voice-ai#tts#elevenlabs#cartesia#openai-voice음성 AI 2026 — ElevenLabs / Cartesia / Sesame / Whisper Turbo / Deepgram / Parakeet 심층 가이드
2024년 10월 Whisper Large v3 Turbo가 8배 빨라지고, Cartesia가 Mamba 저자들 손으로 90ms TTS를 만들고, Sesame의 Brendan Iribe가 "voice presence"를 들고 나오면서 2026년 음성 AI는 TTS·STT·실시간 에이전트 세 축이 모두 폭발했다. ElevenLabs V3부터 NVIDIA Parakeet 1.1, VOICEVOX
2026-05-15 · 36 분 읽기 #voice-ai#tts#stt#asr#elevenlabsWebRTC 미디어 인프라 2026 — LiveKit·Pion·Daily·100ms·mediasoup·Janus·Cloudflare Realtime와 WHIP/WHEP 심층 탐구
2026년의 실시간 음성·영상은 더 이상 'WebRTC를 직접 짠다'의 게임이 아니다. AI 음성 에이전트가 폭발하면서 LiveKit이 사실상 표준 인프라로 올라섰고, Pion은 Go 진영의 핵심 엔진으로 자리잡았다. Daily·100ms·Twilio Video·AWS Chime SDK는 매니지드 진영을 분점하고, Janus·mediasoup·Jitsi는 자가 호스트 SFU의 세 갈래로 굳어
2026-05-14 · 41 분 읽기 #webrtc#livekit#pion#mediasoup#dailyVoice AI 실전 완전 가이드: 실시간 STT/TTS, 음성 LLM, Turn-taking, 딥페이크 방어 (2025)
"화면 없는 AI"가 2025년의 가장 뜨거운 제품 범주가 된 이유. 실시간 음성 파이프라인(VAD/STT/LLM/TTS), 음성 LLM(GPT-4o realtime/Gemini Live/Moshi), Turn-taking과 인터럽션, 감정·억양 제어, 전화·브라우저·모바일 실전, 딥페이크 방어와 보안, 한국어 음성 제품의 특수성까지.
2026-04-15 · 17 분 읽기 #voice-ai#stt#tts#gpt-4o-realtime#moshi음성 & 오디오 AI 완전 정복: Whisper, TTS, 화자 인식, 음악 생성까지
MFCC/Mel spectrogram 오디오 특징 추출, Whisper ASR, FastSpeech2/VITS TTS, pyannote 화자 분리, MusicGen 음악 생성까지 음성 AI 완전 가이드입니다.
2026-03-17 · 22 분 읽기 #voice-ai#whisper#tts#화자인식#musicgen