태그: #video-generation
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 7 편
비디오 생성·이해 기술 리포트, 무엇을 읽을 것인가 — 데모가 아니라 제약을 읽기
비디오 생성과 이해 기술 리포트 열 편을 arXiv 원문 초록에서 직접 확인해 정리했습니다. CogVideoX, Movie Gen, HunyuanVideo, LTX-Video, Wan, Seedance 1.0과 2.0, 그리고 이해 쪽의 Qwen2.5-VL, VideoLLaMA 3, HY-Himmel까지 무엇을 새로 했고 저자들이 어떤 한계를 밝혔는지 읽습니다. 순위는 다루지 않고, 대신 길
2026-08-12 · 13 분 읽기 #ai-papers#paper-review#technical-report#video-generation#diffusion-transformer이미지 한 장으로 영상 만들기 — Kling·Veo·Sora vs Wan·HunyuanVideo, 무엇을 언제 고르나
이미지 한 장과 프롬프트로 영상을 만드는 모델을 고를 때 실제로 결정을 가르는 건 데모 릴의 화질이 아니라 초당 가격, 입력 이미지 제약, 라이선스 세 가지입니다. 2026년 7월 기준으로 각 벤더의 공식 가격표와 문서만 직접 확인해 정리했습니다. 호스티드 쪽은 sora-2가 720p 초당 0.10달러, Veo 3.1 Fast가 오디오 포함 720p 초당 0.10달러이고, Kling은 초 단
2026-07-17 · 39 분 읽기 #ai#video-generation#image-to-video#open-weights#licensingSOTA 비디오 생성 모델 분석 — 시공간 확산 트랜스포머
비디오 생성의 근본 난제인 시간 일관성과 연산 비용을 시공간 라텐트 패치와 확산 트랜스포머 관점에서 정리합니다. Sora가 제시한 개념과 후속 모델 계열, 조건화·평가·물리 일관성 한계를 아키텍처 중심으로 분석합니다.
2026-06-30 · 16 분 읽기 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoAI 비디오 생성 2026 — Sora 2 / Veo 3 / Kling 2 / Hailuo / Runway Gen-4 / Luma Ray 2 / HunyuanVideo 심층 가이드
2024년 2월 Sora 1의 60초 광고가 영상 업계를 뒤집은 지 2년. Sora 2가 정식 출시되고, Google Veo 3는 합성 오디오와 대화까지 만들고, Kling 2는 중국발 최강 영상 모델로 자리잡고, HunyuanVideo가 오픈웨이트 경쟁자를 처음으로 만들었다. 2026년 5월 시점의 AI 비디오 생성 지형도 — 폐쇄형 / 오픈웨이트 / 오디오·음악 결합 / 한국·일본 연구까
2026-05-15 · 43 분 읽기 #ai-video#video-generation#sora#veo#kling2025년 AI 논문 트렌딩 총정리: HuggingFace 인기 논문부터 10대 연구 트렌드까지
HuggingFace 트렌딩 논문 TOP 10과 2025년 AI 연구 10대 트렌드를 개발자 관점에서 리뷰합니다. DeepSeek-R1의 순수 RL 추론, Nemotron-Cascade 30B/3B MoE, GRPO, vLLM PagedAttention, 100만 토큰 컨텍스트의 한계, 비디오 생성 벤치마크까지.
2026-03-21 · 67 분 읽기 #ai-research#papers#huggingface#reasoning#moeWan Text-to-Video/Image-to-Video와 Z Image Turbo 완벽 분석: 차세대 비디오·이미지 생성 모델의 아키텍처와 활용
Alibaba Wan의 Text-to-Video/Image-to-Video 모델 아키텍처, 학습 방법론, 비디오 생성 파이프라인과 Z Image Turbo의 초고속 이미지 생성 기술을 심층 분석하고, Sora/Kling/Runway 등 경쟁 모델과 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 54 분 읽기 #wan#text-to-video#image-to-video#z-image-turbo#video-generationHunyuanVideo와 LTX-2 완벽 분석: 오픈소스 비디오 생성 모델의 아키텍처, 성능, 실전 활용 가이드
Tencent HunyuanVideo(13B)와 Lightricks LTX-2(19B)의 아키텍처, 학습 방법론, 성능 벤치마크를 심층 분석하고, Wan 2.1/CogVideoX/Mochi 등 오픈소스 비디오 생성 모델 생태계 전체를 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 62 분 읽기 #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-video