태그: #TTS
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
실시간 음성 대화, 부품별로 직접 잰 지연: 음성인식 0.2초, LLM 첫 토큰 0.07초, 음성합성은 길이의 절반
외국어 말하기 연습용 실시간 음성 대화의 세 부품(음성인식, 대화 LLM, 음성합성)을 한국어, 일본어, 중국어, 영어로 직접 쟀습니다. 부품별 지연과 GPU 메모리, 오픈 모델 두 쌍의 비교, 한 턴의 첫 소리까지의 계산, 그리고 측정하면서 만나기 쉬운 함정을 정리했습니다.
2026-10-06 · 27 분 읽기 #음성 에이전트#ASR#TTS#지연 측정#LLM 추론실시간 음성 대화 앱을 만들 때 쓸 NVIDIA 오픈소스: Nemotron 음성 에이전트, PersonaPlex, NeMo
실시간 음성 대화 애플리케이션을 만들기 위해 NVIDIA 가 공개한 오픈소스를 조사합니다. 음성인식, LLM, 음성합성을 이어 붙이는 구조와 한 모델이 듣고 말하는 풀듀플렉스 구조를 비교하고, 한국어를 지원하는 조합이 무엇인지, 8GB급 노트북 GPU 와 24GB급 소비자용 GPU 로 어디까지 가능한지 정리합니다.
2026-10-06 · 16 분 읽기 #음성 에이전트#실시간 음성인식#Nemotron#PersonaPlex#Pipecat음성 대화의 원리를 숫자로 확인하기: 디코딩은 메모리 대역폭, 합성은 프레임 수, 스트리밍은 캐시
실시간 음성 대화의 세 부품(대화 LLM, 음성인식, 음성합성)이 왜 그 시간에 끝나는지를 원리로 설명하고, 20편에서 직접 잰 값으로 하나씩 검산합니다. LLM 토큰 속도는 크기와 정밀도가 다른 모델 네 개에서 직접 잰 메모리 대역폭의 86~98%, 동시 요청 16개에서 총 처리량 약 14~15배, 입력 처리는 연산 한계의 약 75~80% 이고, 합성은 프레임당 약 76ms, 스트리밍 음성
2026-10-06 · 31 분 읽기 #음성 에이전트#LLM 추론#메모리 대역폭#스트리밍 ASR#TTS