태그: #sesame
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
음성 AI & TTS 2026 완벽 가이드 - ElevenLabs · Cartesia Sonic · OpenAI Voice · Play.HT · Hume · Sesame · Fish Audio · Deepgram Aura 심층 분석
2026년의 음성 AI는 STT → LLM → TTS 파이프라인이 끝나고, 풀듀플렉스 실시간 음성 에이전트가 표준이 된 해다. ElevenLabs v3가 다국어·감정 TTS의 왕좌를 지키는 동안, Cartesia Sonic은 75ms TTFW로 LiveKit Agents의 기본 TTS가 됐고, OpenAI Realtime API · Google Gemini Live · Anthropic Cl
2026-05-16 · 28 분 읽기 #voice-ai#tts#elevenlabs#cartesia#openai-voice음성 AI 2026 — ElevenLabs / Cartesia / Sesame / Whisper Turbo / Deepgram / Parakeet 심층 가이드
2024년 10월 Whisper Large v3 Turbo가 8배 빨라지고, Cartesia가 Mamba 저자들 손으로 90ms TTS를 만들고, Sesame의 Brendan Iribe가 "voice presence"를 들고 나오면서 2026년 음성 AI는 TTS·STT·실시간 에이전트 세 축이 모두 폭발했다. ElevenLabs V3부터 NVIDIA Parakeet 1.1, VOICEVOX
2026-05-15 · 36 분 읽기 #voice-ai#tts#stt#asr#elevenlabsAI 음성 2026 — ElevenLabs · OpenAI Realtime · Cartesia · Vapi · Sesame · Deepgram, 보이스 에이전트 스택의 현재
생성형 미디어 4부작의 마지막 — 음악, 이미지, 비디오에 이어 음성이다. 2026년의 AI 음성 풍경을 정직하게 정리한다. ElevenLabs(보이스 클로닝과 Conversational AI), OpenAI Realtime(WebRTC 기반 음성-인-음성-아웃), Cartesia Sonic-2(최저 지연 TTS), Vapi(보이스 에이전트 플랫폼), Sesame(개성 있는 대화 모델), D
2026-05-14 · 54 분 읽기 #ai-voice#elevenlabs#openai-realtime#cartesia#vapi