태그: #text-to-video
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 3 편
SOTA 비디오 생성 모델 분석 — 시공간 확산 트랜스포머
비디오 생성의 근본 난제인 시간 일관성과 연산 비용을 시공간 라텐트 패치와 확산 트랜스포머 관점에서 정리합니다. Sora가 제시한 개념과 후속 모델 계열, 조건화·평가·물리 일관성 한계를 아키텍처 중심으로 분석합니다.
2026-06-30 · 16 분 읽기 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoWan Text-to-Video/Image-to-Video와 Z Image Turbo 완벽 분석: 차세대 비디오·이미지 생성 모델의 아키텍처와 활용
Alibaba Wan의 Text-to-Video/Image-to-Video 모델 아키텍처, 학습 방법론, 비디오 생성 파이프라인과 Z Image Turbo의 초고속 이미지 생성 기술을 심층 분석하고, Sora/Kling/Runway 등 경쟁 모델과 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 54 분 읽기 #wan#text-to-video#image-to-video#z-image-turbo#video-generationHunyuanVideo와 LTX-2 완벽 분석: 오픈소스 비디오 생성 모델의 아키텍처, 성능, 실전 활용 가이드
Tencent HunyuanVideo(13B)와 Lightricks LTX-2(19B)의 아키텍처, 학습 방법론, 성능 벤치마크를 심층 분석하고, Wan 2.1/CogVideoX/Mochi 등 오픈소스 비디오 생성 모델 생태계 전체를 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 62 분 읽기 #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-video