태그: #text-to-speech
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 4 편
음성 모델 고르기: STT와 TTS의 실전 기준
음성 모델은 텍스트 모델과 달리 언어 지원, 오디오 길이 제약, 실시간성, 화자 분리 여부가 먼저 정해지고 그다음에 모델이 결정됩니다. 이 글은 2026-08-12에 확인한 STT와 TTS 오픈 모델의 파라미터, 라이선스, 지원 언어, 오디오 제약을 정리하고, 실시간이라는 말을 어떻게 쪼개야 하는지, 카드에 적힌 환각과 동의 관련 경고가 왜 설계 제약인지를 설명합니다. 오픈 모델 가이드 시리
2026-08-12 · 13 분 읽기 #ai#huggingface#open-source-llm#speech-to-text#text-to-speech음성 인식·합성 기술 리포트, 무엇을 읽을 것인가 — WER 한 숫자로는 안 보이는 것
음성 인식과 합성 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. Whisper와 Omnilingual ASR, Qwen3-ASR, Open ASR Leaderboard, Seed-TTS와 F5-TTS, CosyVoice 2, Qwen3-TTS, Fish Audio S2, Moshi, Qwen2.5-Omni와 MOSS-Audio가 각각 무엇을 새로 했고 저자들이 어떤
2026-08-12 · 14 분 읽기 #ai-papers#paper-review#technical-report#speech-recognition#text-to-speechtts-bench: 품질이 주관적일 때 로컬 TTS를 비교하는 법
tts-bench는 개발자 5uck1ess가 만든 로컬 벤치마크로, 손에 있는 하드웨어에서 55개 TTS 모델을 비교한다. 평가를 세 렌즈로 나눈다. 속도(TTFA·RTF·메모리), 청취(모든 모델을 귀로 판단), 점수(UTMOS·WER·SIM)다. 가장 흥미로운 건 주관성에 대한 정직함이다. "가장 좋게 들리는" 단일 점수는 없다. 품질은 당신의 귀와 용도에 달렸기 때문이다. 이 글은 이
2026-07-11 · 10 분 읽기 #tts#text-to-speech#benchmark#local-ai#evaluationSOTA 음성 인식·합성 분석 — Whisper에서 코덱 언어모델까지
음성 인식(ASR)과 음성 합성(TTS)의 최신 흐름을 정리합니다. HMM에서 CTC/어텐션, Whisper의 대규모 약지도 학습, 그리고 Tacotron에서 뉴럴 보코더와 코덱 언어모델까지 계보와 아키텍처 원리를 살펴봅니다.
2026-06-30 · 35 분 읽기 #ai-papers#speech-recognition#text-to-speech#whisper#neural-codec