LabHub

블로그

AI 비디오 생성 2026 완벽 가이드 — Sora 2 · Veo 3 · Runway Gen-4 · Pika · Luma Dream Machine · Kling · Hailuo · Hunyuan Video 심층 분석

한국어English日本語

프롤로그 — Sora 프리뷰에서 Sora 2 앱까지, 2년의 압축

2024년 2월 15일, OpenAI가 Sora 프리뷰를 공개했을 때 영상 업계가 멈춰섰다. 60초짜리 1080p 클립이 "프롬프트만으로" 나왔다는 사실이 충격이었다. 하지만 그 Sora는 1년이 지나도록 일반에게 풀리지 않았다.

그리고 2025년 9월 30일, OpenAI는 Sora 2를 발표하고 동시에 iOS 전용 Sora 앱을 출시했다. 4K · 25초 · 네이티브 오디오 · 카메오(Cameos, 본인 얼굴/목소리를 모델에 등록) · 소셜 피드까지. ChatGPT Pro 구독자에게는 별도 사용량이 함께 따라왔다. 동시에 Google은 Veo 2(2024-12), Veo 3(2025-05 I/O) 순으로 Gemini App과 Vertex AI에 통합했고, Runway는 Gen-3 Alpha를 거쳐 Gen-4(2025-03)로 영화 제작 워크플로로 깊이 들어갔다.

그 사이 중국 진영에서는 Kuaishou Kling, MiniMax Hailuo, Tencent Hunyuan Video, Alibaba Wan 2.1이 빠르게 격차를 좁혔다. 그리고 오픈소스 진영 — Genmo Mochi 1(2024-10, Apache 2.0), Lightricks LTX-Video(2024-11, 실시간 2B), CogVideoX(Tsinghua) — 가 ComfyUI 워크플로 위에 얹히면서 RTX 4090 한 장으로도 cinematic 영상이 가능해졌다.

이 글은 그 두 해의 압축을 — 클로즈드와 오픈, 가격과 라이선스, 그리고 한국·일본 시장의 사정까지 — 한 호흡으로 정리한다.


1장 · 텍스트, 이미지, 비디오 — 세 입력의 분기

AI 비디오 모델을 고를 때 가장 먼저 묻는 질문은 "무엇을 입력으로 받느냐"이다. 세 갈래가 있다.

대부분의 프로 워크플로는 셋을 섞는다. T2V로 초안 → I2V로 캐릭터 고정 → V2V로 스타일 통일 → 립싱크 도구로 입모양 동기화. 그리고 마지막에 Premiere/DaVinci로 잘라 붙인다.


2장 · OpenAI Sora 2 — 4K · 25초 · 카메오 · iOS 앱

2025-09-30, OpenAI가 Sora 2를 발표하면서 동시에 두 가지를 풀었다. 모델과 앱이다.

Sora 2의 진짜 차별점은 두 가지다. 첫째, 다른 모델이 무음 비디오를 만들고 별도로 ElevenLabs/Suno로 사운드를 붙이는 것과 달리, Sora 2는 네이티브로 동기화된 오디오를 함께 출력한다. 둘째, Cameos 기능은 "딥페이크 합의 모델"을 사실상 표준화했다 — 본인이 명시적으로 등록한 얼굴만, 그것도 친구에게 공유 권한을 줘야만 사용 가능하다.


3장 · Google Veo 2 · Veo 3 — Gemini와 Vertex AI의 두 채널

Google의 비디오 모델은 Veo 시리즈로 통합되었다.

Veo 3의 강점은 Google 인프라 — DeepMind의 음성 모델과 결합한 네이티브 사운드 — 와 엔터프라이즈 채널(Vertex AI)이다. Sora 2가 소셜 피드 중심이라면, Veo 3은 제작 파이프라인에 더 가깝다.


4장 · Runway Gen-4 — 영화 제작 워크플로의 침투

Runway의 길은 처음부터 명확했다. "영상 편집 회사가 만드는 AI 비디오 도구."

Gen-4의 References 기능은 영화 제작자가 가장 원하던 기능이다. 캐릭터 시트, 의상 레퍼런스, 환경 무드보드를 입력으로 넣으면 그 일관성을 유지한 채 여러 샷을 만들 수 있다.


5장 · Pika 2.2 · 2.5 — Pikadditions · Pikaffects · Pikaframes

Pika의 전략은 "기능명을 외울 수 있게" 만드는 것이다.

Pika의 매력은 영화적 일관성보다 "한 줄로 설명할 수 있는 효과"에 있다. Pikaffects는 광고·소셜 콘텐츠 제작자에게 매우 강력하다.


6장 · Luma Dream Machine · Ray 2 — 빠르고 루프형

Luma AI의 Dream Machine은 "빠르고 일상적인" 포지셔닝을 잡았다.

Luma의 강점은 두 가지다. 첫째, Image-to-Video 품질이 매우 좋다 — 정지 이미지에서 시작해 자연스러운 모션을 만든다. 둘째, Loop 기능(끊김 없이 반복되는 클립)이 소셜 GIF·배경 영상 용도로 강력하다.


7장 · Kling 1.6 · 2.0 — Kuaishou의 글로벌 진출

중국 Kuaishou(快手, TikTok의 글로벌 경쟁자)가 2024-06에 공개한 Kling은 빠르게 글로벌 사용자를 모았다.

Kling의 차별점은 Motion Brush — 영상 안의 특정 영역만 골라 움직임 방향을 지정할 수 있다. 예: "이 인물의 머리카락만 바람에 날리게."


8장 · MiniMax Hailuo — 빠른 텍스트-비디오

MiniMax의 Hailuo(海螺)는 2024-09에 공개. 초기엔 무료, 이후 유료화되었다.

Hailuo는 영어 프롬프트에 매우 강하고, 빠른 추론 시간(짧은 클립 약 30초~1분)이 강점이다. 다만 25초까지 가는 Sora 2와 비교하면 길이가 짧다.


9장 · Tencent Hunyuan Video — 13B 오픈소스의 시작

2024-12-03, Tencent가 Hunyuan Video를 공개했다. 13B 파라미터, 사실상 오픈 라이선스(상업 사용 가능, 일부 제한). 오픈소스 비디오 모델의 판도를 바꾼 사건이다.

Hunyuan Video의 등장은 오픈소스 비디오 진영을 "실용 가능" 영역으로 끌어올렸다. 그 전까지의 오픈소스 모델은 데모 수준이었다.


10장 · Alibaba Wan 2.1 — 14B 오픈 라이선스

2025-01, Alibaba가 Wan 2.1을 공개했다.

Wan 2.1의 진짜 매력은 1.3B 변형이다. Apache 2.0으로 완전히 자유롭고, 소비자 GPU 한 장에서 돈다. 다만 품질은 14B 또는 Hunyuan에 미치지 못한다.


11장 · Genmo Mochi 1 — Apache 2.0 10B의 등장

2024-10, Genmo가 Mochi 1을 Apache 2.0으로 공개했다.

Mochi 1은 "완전 자유로운 오픈 비디오 모델"이라는 자리를 처음 채웠다. 라이선스 측면에서는 Hunyuan보다 깨끗하다.


12장 · Lightricks LTX-Video — 실시간 2B 모델

2024-11, Lightricks(Facetune·Videoleap 만드는 회사)가 LTX-Video를 공개했다.

LTX-Video는 "품질 vs 속도"의 균형을 속도 쪽으로 옮겼다. 빠른 프로토타이핑·반복 작업에 강하다.


13장 · CogVideoX 5B — Tsinghua의 오픈 베이스

2024-09, Tsinghua KEG Lab과 ZhipuAI가 CogVideoX를 공개했다.

CogVideoX는 ModelScope·Hugging Face에 풀려 있고, 빠르게 ComfyUI 워크플로에 통합되었다.


14장 · Stable Video Diffusion · 그 이전의 유산

비디오 모델의 "전사(prehistory)"를 한 줄로 정리한다.

이들 없이는 ComfyUI 생태계도, 오픈소스 비디오 모델도 자리잡지 못했을 것이다.


15장 · ComfyUI 워크플로 — Wan · Hunyuan · Mochi를 한 자리에

ComfyUI는 노드 기반 워크플로 에디터로, 오픈 비디오 모델의 표준 인터페이스가 되었다.

대표적인 노드 패키지:

전형적인 워크플로는 이렇게 흐른다.

[Text Prompt]
   |
   v
[CLIP/T5 Text Encoder] --+
                          |
[Empty Latent Video] -----+--> [Diffusion Model (Hunyuan/Wan/Mochi)] --> [Latent Video]
                          |                                                  |
[Negative Prompt] --------+                                                  v
                                                                    [VAE Decode]
                                                                              |
                                                                              v
                                                                       [Video Output]

I2V 워크플로는 여기에 Image Encoder 노드와 Conditioning 노드를 추가한다. V2V는 입력 비디오를 latent로 다시 인코딩해서 시작점으로 쓴다.

ComfyUI의 진짜 장점은 노드 단위로 LoRA·ControlNet·IPAdapter·업스케일러를 끼워 넣을 수 있다는 점이다. 클로즈드 모델로는 못 하는 세밀한 통제가 가능하다.


16장 · 립싱크 — HeyGen · Synthesia · D-ID · Hedra

비디오 생성과 립싱크는 다른 문제다. 립싱크 도구는 별도의 카테고리다.

Sora 2 · Veo 3은 비디오와 오디오를 함께 생성하지만, 기존 영상에 다른 음성을 입히는 작업은 여전히 위 도구의 영역이다.


17장 · 스토리보드 · 롱폼 — LTX Studio · Showrunner · Wonder

5초~25초 클립을 모아 더 긴 영상을 만드는 도구가 따로 있다.

이들의 공통점은 "단일 클립이 아니라 시퀀스"를 만든다는 점이다. 그래서 Sora 2 · Veo 3 · Runway Gen-4를 API로 끌어와 위에 얹는 경우가 많다.


18장 · 워터마크와 C2PA — 진위 증명의 새 표준

2024-2025년에 가장 빠르게 자리잡은 표준은 C2PA(Coalition for Content Provenance and Authenticity)다.

2026년 현재 상태:

워터마크는 콘텐츠 신뢰의 마지막 방어선이다. 하지만 오픈소스 모델로 만든 영상은 C2PA가 박히지 않으므로, 이 표준은 클로즈드 생태계 내에서만 작동한다.


19장 · 한국 — VARCO · HyperCLOVA X 비디오

한국 진영의 상황은 텍스트·이미지 모델보다 비디오 쪽이 한 박자 뒤지지만, 빠르게 따라오고 있다.

한국 시장의 특수성은 K-콘텐츠 IP다. 드라마/K-POP/웹툰의 캐릭터 일관성을 유지한 채 영상을 생성하는 워크플로(LoRA 학습 + Runway References + 립싱크)가 빠르게 실험되고 있다.


20장 · 일본 — NTT Tsuzumi · Pikalmer · Sakana

일본 진영도 비디오 모델 직접 개발은 적지만, 인접 분야가 활발하다.

일본은 IP 일관성과 노동조합 이슈로 클로즈드 모델보다 컨트롤 가능한 오픈소스 워크플로에 무게가 실려 있다.


21장 · 비용 — 클립 한 편의 진짜 가격

비교 가능한 가격 표를 한 줄로 정리한다.

가장 싸게 만드는 길은 두 가지다. 하나는 오픈소스 모델 + 본인 GPU. 다른 하나는 Pika · Luma의 저가 구독 + 무리하지 않는 클립 양.


22장 · 한계 — 모션 일관성, 물리, 텍스트

2026년의 비디오 모델은 강하지만 약점도 명확하다.

이 한계가 사라지는 속도는 모델 세대마다 다르다. 텍스트 렌더링은 빠르게 좋아졌고, 물리는 천천히 좋아지는 중이다.


23장 · 활용 사례 — 광고 · 소셜 · 스토리보드 · R&D

2026년 현재 가장 활발한 4가지 활용:

본격적인 장편 영화·드라마 제작에는 아직 도달하지 못했다. 다만 단편/MV/광고/예고편에는 이미 들어와 있다.


24장 · 의사결정 트리 — 어떤 모델을 쓸까

마지막으로, 상황별 추천을 한 페이지에 정리한다.

이 트리는 6개월 안에 다시 갱신될 가능성이 높다. AI 비디오는 여전히 가장 빠르게 움직이는 분야 중 하나다.


에필로그 — 다음 1년의 질문들

2년 만에 60초 1080p에서 25초 4K 동기 오디오까지 왔다. 2027년의 비디오 모델은 무엇을 풀어야 하는가.

답을 가진 사람은 아직 없다. 하지만 2024-2026의 속도라면, 그 답은 또 다른 2년 안에 나올 가능성이 높다.


참고 자료

댓글

아직 댓글이 없습니다.

로그인하면 댓글을 쓸 수 있습니다