LabHub

블로그

SOTA 음악·오디오 생성 분석 — 뉴럴 코덱과 생성 모델

한국어English日本語中文

들어가며

텍스트·이미지·비디오 생성이 성숙해지는 동안, 오디오와 음악 생성도 빠르게 발전했습니다. 오디오는 고유한 도전 과제를 가집니다. 초당 수만 개의 샘플로 이뤄진 긴 시퀀스이고, 사람 귀는 미세한 왜곡에도 민감합니다. 이 글에서는 오디오 표현 방식부터 뉴럴 코덱, 오토리그레시브 오디오 언어모델, 확산 기반 오디오까지 SOTA 음악·오디오 생성의 공통 원리를 계보 중심으로 정리합니다.

이 분야도 빠르게 바뀝니다. 아래 내용은 널리 알려진 개념·논문·아키텍처 계열을 기준으로 하며, 특정 상용 모델의 세부 스펙이나 순위는 단정하지 않습니다.

오디오 표현: 무엇을 모델링할 것인가

오디오 생성의 첫 질문은 "무엇을 예측할 것인가"입니다. 표현 방식에 따라 모델 구조가 크게 달라집니다.

파형(waveform)

가장 원초적인 표현은 시간에 따른 진폭 값의 나열, 즉 파형입니다. 44.1kHz 오디오라면 1초에 44100개의 샘플이 있습니다. 직접 파형을 예측하는 방식은 품질 상한이 높지만, 시퀀스가 극단적으로 길어 모델링이 어렵습니다.

파형: 시간 -->  ...-0.2, 0.1, 0.4, 0.3, -0.1, -0.5...  (초당 수만 개 샘플)

스펙트로그램(spectrogram)

파형을 짧은 구간으로 나눠 주파수 성분으로 변환한 표현입니다. 시간-주파수 2차원 이미지처럼 다룰 수 있어, 이미지 생성 기법을 빌려오기 좋습니다. 다만 스펙트로그램을 다시 파형으로 되돌리는(보코더) 단계가 필요합니다.

스펙트로그램: 세로축=주파수, 가로축=시간, 값=세기 (이미지처럼 취급)
        --> [보코더] --> 파형

뉴럴 코덱(neural codec)

최근 SOTA의 핵심은 뉴럴 코덱입니다. 오디오를 소수의 이산 토큰(discrete token) 시퀀스로 압축하는 신경망입니다. 대표적으로 SoundStreamEnCodec 계열이 있습니다.

핵심은 잔차 벡터 양자화(residual vector quantization, RVQ)입니다. 오디오를 여러 단계의 코드북으로 계층적으로 양자화해, 짧은 토큰 시퀀스로도 높은 음질을 담습니다.

[파형] --인코더--> [연속 표현] --RVQ 양자화--> [이산 토큰 시퀀스]
                                                     |
[파형] <--디코더-- [연속 표현] <--역양자화-- [이산 토큰 시퀀스]

RVQ 계층:
 1단계 코드북 --> 잔차 --> 2단계 코드북 --> 잔차 --> ... (정밀도 누적)

뉴럴 코덱의 이산 토큰은 언어모델이 다루기에 이상적입니다. 텍스트 토큰처럼 오디오 토큰을 예측하면 되기 때문입니다. 이 다리가 오디오 언어모델의 부상을 이끌었습니다.

오토리그레시브 오디오 언어모델

발상

오디오를 이산 토큰으로 바꾸고 나면, 언어모델과 똑같이 "다음 토큰 예측"으로 오디오를 생성할 수 있습니다. AudioLM 계열이 이 접근을 제시했습니다. 오디오 토큰을 언어모델처럼 자기회귀로 이어 붙여 자연스러운 소리를 만듭니다.

AudioLM 계열은 종종 두 종류의 토큰을 함께 씁니다. 의미(semantic) 토큰은 장기 구조·내용을 담고, 음향(acoustic) 토큰은 세밀한 음색·음질을 담습니다. 큰 구조를 먼저 잡고, 세부 음향을 채우는 계층적 생성입니다.

[의미 토큰 예측] --> 곡의 큰 흐름/구조
        |
[음향 토큰 예측] --> 세밀한 음색/질감 (뉴럴 코덱 토큰)
        |
   [코덱 디코더] --> 파형

MusicGen 계열

MusicGen(arXiv 2306.05284)은 텍스트 조건부 음악 생성을 단일 트랜스포머 언어모델로 다룬 대표 사례입니다. EnCodec 코덱 토큰 위에서 자기회귀 생성을 하되, 여러 RVQ 계층 토큰을 효율적으로 배치(코드북 인터리빙)하는 방식을 사용합니다. 텍스트 설명이나 멜로디를 조건으로 받아 음악을 생성합니다.

[텍스트 프롬프트] --텍스트 인코더--> [조건 임베딩]
                                        |
[코덱 토큰들] --자기회귀 트랜스포머--> [다음 코덱 토큰 예측]
                                        |
                                  [EnCodec 디코더] --> 음악 파형

자기회귀 접근의 장점은 언어모델 인프라를 그대로 재사용할 수 있다는 점입니다. 단점은 토큰을 하나씩 순차 생성하므로 긴 오디오에서 느릴 수 있다는 것입니다.

확산 기반 오디오

또 다른 큰 줄기는 확산모델입니다. 이미지 확산처럼, 오디오(주로 스펙트로그램이나 잠재 표현)에 노이즈를 섞었다가 되돌리는 방식으로 생성합니다.

[순수 노이즈] --> [확산 백본: U-Net 또는 DiT] --디노이즈 반복--> [오디오 잠재/스펙트로그램]
                                                                        |
                                                          [디코더/보코더] --> 파형

확산 접근의 장점은 병렬적으로 전체를 다듬어가므로 자기회귀의 순차 병목이 덜하다는 점입니다. 최근에는 오디오에서도 flow matching / rectified flow 계열을 쓰는 흐름이 나타납니다. 자기회귀와 확산은 배타적이지 않고, 상황에 따라 혼합·선택됩니다.

텍스트-음악 조건화

텍스트로 음악을 제어하려면, 텍스트 설명을 임베딩해 생성 과정에 주입합니다. 이미지·비디오와 원리는 같습니다.

[텍스트/멜로디 조건] --> [조건 임베딩]
                             |
[생성 백본(AR 또는 확산)] <-- 조건 주입
                             |
                    [코덱/보코더] --> 음악

상용과 연구 (개념 중심)

연구 쪽에서는 AudioLM, MusicGen, EnCodec, SoundStream 등이 공개 아이디어의 기반을 제공했습니다. 상용 쪽에서는 Suno, Udio 같은 서비스가 존재하는 것으로 알려져 있으며, 노래(보컬 포함) 생성에서 인상적인 품질을 보이는 것으로 평가됩니다. 다만 상용 모델의 내부 구조는 대부분 비공개이므로, 여기서는 공개된 아키텍처 계열의 원리만 다룹니다.

공통적으로 관찰되는 방향은 다음과 같습니다. (1) 뉴럴 코덱으로 오디오를 이산 토큰화, (2) 자기회귀 또는 확산으로 토큰/잠재 생성, (3) 텍스트·멜로디 조건화, (4) 코덱 디코더나 보코더로 파형 복원. 세부 성능·순위는 프롬프트·장르·평가 방식에 따라 크게 달라지므로 단정은 피합니다.

비교표: 접근별 정리

자기회귀 오디오 LM확산 기반 오디오
표현코덱 이산 토큰스펙트로그램/잠재
생성 방식다음 토큰 예측(순차)반복 디노이즈(병렬적)
대표 계열AudioLM, MusicGen스펙트로그램/라텐트 확산
강점언어모델 인프라 재사용순차 병목 완화
약점긴 오디오에서 느릴 수 있음보코더/디코더 품질 의존
조건화조건 토큰/크로스 어텐션크로스 어텐션

값은 계열의 일반적 경향이며 특정 모델 구성과 다를 수 있습니다.

전체 파이프라인 다이어그램

[텍스트 프롬프트] (+ 멜로디/참조 오디오)
        |
 [텍스트 인코더]
        |
 [조건 임베딩] ---------------------+
                                    |
 [생성 백본]                        |
   - 자기회귀: 코덱 토큰 순차 예측 <--+
   - 또는 확산: 잠재/스펙트로그램 디노이즈
        |
 [뉴럴 코덱 디코더 / 보코더]
        |
   [최종 오디오 파형]

평가

오디오 생성 평가는 주관성이 강합니다.

저작권과 윤리 쟁점

음악·오디오 생성은 특히 저작권과 윤리 쟁점이 첨예합니다.

기술적 성능과 별개로, 이 쟁점들은 상용화의 핵심 제약이자 사회적 논의 대상입니다.

강점

한계와 열린 문제

실무적 함의

마치며

음악·오디오 생성 SOTA의 공통 기반은 "뉴럴 코덱 토큰화 + 자기회귀 또는 확산 생성 + 텍스트·멜로디 조건화"로 요약됩니다. EnCodec/SoundStream이 표현의 다리를 놓았고, AudioLM/MusicGen이 언어모델식 생성을 열었으며, 확산 계열이 병렬적 대안을 제시했습니다. 상용 서비스의 순위와 세부는 빠르게 바뀌지만, 이 원리를 이해하면 새로운 모델의 구조를 빠르게 파악할 수 있습니다.

참고 자료

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다