LabHub

한국어

시작하기
블로그

블로그

실시간 음성 대화 앱을 만들 때 쓸 NVIDIA 오픈소스: Nemotron 음성 에이전트, PersonaPlex, NeMo

상태: 초안 (2026-10-05), 조사 글입니다. 이 글의 모든 내용은 문서 기준이고 직접 실행해 측정한 값이 없습니다(미실측). 아래 사실은 각 프로젝트의 GitHub 저장소와 Hugging Face 모델 카드를 읽고 정리한 것입니다. 페이지 내용을 요약하는 도구를 거쳐 읽었으므로, 숫자와 라이선스 문구는 쓰기 전에 원문으로 다시 확인하십시오. 글 끝의 「확인하지 못한 것」을 먼저 읽으십시오. 작성 규칙: 실측 데이터가 기본이고, 못 잰 것은 「미실측」으로 표시합니다.

1. 결론부터

한국어로 실시간 대화하는 앱을 만든다면, 지금 확인된 범위에서는 음성인식(ASR), LLM, 음성합성(TTS)을 이어 붙이는 방식이 맞습니다. 이유는 한국어를 지원하는 NVIDIA 오픈 모델이 이 방식의 두 부품에 있기 때문입니다.

후보 구조 한국어 한 줄 평가
Nemotron Voice Agent 블루프린트 ASR → LLM → TTS(Pipecat) 부품에 따라 다름(아래 표) 출발점으로 가장 좋음
Nemotron 3.5 ASR Streaming 0.6B 음성인식 부품 ko-KR 지원 한국어 실시간 인식의 핵심 부품
Magpie TTS Multilingual 음성합성 부품 ko 지원 한국어 음성 출력의 핵심 부품
PersonaPlex-7B 한 모델이 듣고 말함(풀듀플렉스) 영어 전용 한국어 앱에는 쓸 수 없음, 구조 학습용
NeMo voice_agent 예제 ASR + LLM + TTS 예제 영어만 구조를 읽기에 좋은 예제

2. 두 가지 구조

2.1 캐스케이드: 듣고, 생각하고, 말하는 단계를 나눈다

마이크 → 음성 구간 검출(VAD)과 발화 종료 판단 → ASR(음성을 글자로) → LLM(답변 글 생성) → TTS(글을 음성으로) → 스피커 순서입니다.

2.2 풀듀플렉스: 한 모델이 동시에 듣고 말한다

PersonaPlex 가 이 방식입니다. 한 모델이 연속된 오디오를 입력으로 받으면서 동시에 음성을 출력하므로 끼어들기와 맞장구, 빠른 말 주고받기가 자연스럽습니다. PersonaPlex 논문(arXiv 2602.06053, 표 6)이 Full-Duplex-Bench 로 보고한 지연은 말 주고받기 약 0.170초, 사용자가 끼어들었을 때의 반응 약 0.240초입니다(영어 모델의 논문 수치이며, 모델 카드는 접근 승인이 필요해 열지 못했습니다).

3. 후보별 정리

3.1 Nemotron Voice Agent 블루프린트

NVIDIA-AI-Blueprints/nemotron-voice-agent는 NVIDIA 가 공개한 참조 구현입니다.

3.2 Nemotron 3.5 ASR Streaming 0.6B (음성인식)

모델 카드에 따른 내용입니다.

3.3 Magpie TTS Multilingual (음성합성)

모델 카드에 따른 내용입니다.

3.4 PersonaPlex-7B

GitHub와 모델 카드에 따른 내용입니다.

3.5 NeMo voice_agent 예제

NVIDIA-NeMo/Speech 의 예제는 NeMo 의 음성인식과 음성합성에 Hugging Face LLM 을 붙인 대화 에이전트입니다. 음성인식은 Parakeet 실시간 모델(기본)과 Nemotron 스트리밍 변형, 음성합성은 Kokoro-82M 부터 FastPitch-HiFiGAN 까지 고를 수 있습니다. GPU 가 한 장 필요하고 9B LLM 이면 21GB, 4B LLM 이면 13GB VRAM 을 권합니다. 현재는 영어 입출력만 지원한다고 밝혔습니다.

4. 소비자용 GPU 에서의 가능성

필자의 실험 환경의 GPU 는 8GB급 노트북 GPU 와 24GB급 소비자용 GPU 입니다. 블루프린트의 단일 GPU 프로필은 28GiB 이상의 VRAM 을 요구해서 어느 GPU 한 장으로도 그대로는 맞지 않습니다. 다만 이 요구량은 30B 급 LLM 을 함께 올리는 기본 구성에 해당하므로, 부품을 나누면 사정이 달라질 수 있습니다.

부품 크기 8GB GPU 에 들어갈 가능성
Nemotron 3.5 ASR 약 0.6B 작아서 가능성이 높음(미측정)
Magpie TTS 약 364M(GGUF 569MB) 작아서 가능성이 높음(미측정)
LLM 소형 모델 vLLM 등으로 따로 서빙하는 소형 모델로 대신할 수 있음

이 표는 모델 크기에서 짐작한 것이고, VRAM 사용량과 지연은 직접 재지 않았습니다(미실측). 블루프린트는 OpenAI Realtime 호환 WebSocket 게이트웨이를 제공한다고 하므로, 기존 LLM 서버를 연결하는 방법도 확인해 볼 만합니다(미시험).

5. 앱 설계 초안 (미시험)

브라우저(마이크, 스피커)
   │  WebSocket 또는 WebRTC
   ▼
Pipecat 파이프라인
   ├─ VAD + 발화 종료 판단
   ├─ ASR : Nemotron 3.5 ASR Streaming (ko-KR)
   ├─ LLM : vLLM 으로 서빙하는 소형 모델
   └─ TTS : Magpie TTS (ko)
   │  끼어들기가 감지되면 TTS 재생과 LLM 생성을 중단
   ▼
스피커

6. 실측 계획

글로 정리한 내용을 숫자로 바꾸는 순서입니다. 8GB급 GPU 에서 임시 파드로 합니다.

  1. ASR 단독: 한국어 음성 샘플로 실시간 계수(처리 시간 대 오디오 길이)와 청크 크기별 지연, VRAM 사용량.
  2. TTS 단독: 한국어 문장으로 첫 오디오까지의 시간과 VRAM 사용량.
  3. 세 부품을 이은 종단 지연과 끼어들기 반응 시간.
  4. 한국어 인식 정확도: 카드의 한국어 CER(FLEURS)은 있지만 우리 환경의 음성으로 다시 확인해야 하므로, 직접 만든 소규모 시험 문장으로 확인하고 표본이 작다는 한계를 함께 적습니다.

7. 면접에서 나올 만한 질문

8. 흔한 오해

확인하지 못한 것

참고 자료

확인한 버전과 날짜

2026-10-05 기준. Nemotron Voice Agent 블루프린트 v2.2.0(2026-09-23), PersonaPlex-7B-v1, Nemotron 3.5 ASR Streaming 0.6B, Magpie TTS Multilingual 357m.

로그인하면 좋아요를 누를 수 있습니다

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다