태그: #dit
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 5 편
파운데이션 모델 아키텍처 2026 — Transformer 이후 / Mamba 2 / Hyena / RWKV / RetNet / Griffin / Jamba / xLSTM / TTT / DiT / MoE / Flash Attention 3 심층 가이드
2026년 파운데이션 모델 세계는 더 이상 Transformer 일변도가 아니다. Vaswani의 2017년 "Attention is All You Need"는 여전히 표준이지만, 그 옆에 Mamba/Mamba 2 같은 상태공간 모델(SSM), RWKV/RetNet/Griffin 같은 선형 RNN 재발견 진영, AI21 Jamba와 Falcon Mamba 같은 하이브리드, Sepp Hochr
2026-05-16 · 34 분 읽기 #foundation-models#transformer#attention-is-all-you-need#vaswani#mambaAI 비디오 생성 2026 — Sora 2 / Veo 3 / Kling 2 / Hailuo / Runway Gen-4 / Luma Ray 2 / HunyuanVideo 심층 가이드
2024년 2월 Sora 1의 60초 광고가 영상 업계를 뒤집은 지 2년. Sora 2가 정식 출시되고, Google Veo 3는 합성 오디오와 대화까지 만들고, Kling 2는 중국발 최강 영상 모델로 자리잡고, HunyuanVideo가 오픈웨이트 경쟁자를 처음으로 만들었다. 2026년 5월 시점의 AI 비디오 생성 지형도 — 폐쇄형 / 오픈웨이트 / 오디오·음악 결합 / 한국·일본 연구까
2026-05-15 · 43 분 읽기 #ai-video#video-generation#sora#veo#klingDiffusion Model 논문 서베이: DDPM에서 Stable Diffusion·DiT·SDXL까지 이미지 생성 모델의 진화
DDPM/DDIM의 확산-역확산 이론부터 Score-based 모델, Latent Diffusion(Stable Diffusion)의 VAE+U-Net 아키텍처, Classifier-free Guidance, DiT(Diffusion Transformer)의 adaLN-Zero, SDXL의 이중 텍스트 인코더와 Refiner 파이프라인, ControlNet의 조건부 제어, 학습 파이프라인,
2026-03-12 · 25 분 읽기 #ai-papers#diffusion-model#ddpm#stable-diffusion#ditDiffusion Transformer(DiT) 아키텍처 분석: U-Net에서 Transformer로의 전환
Scalable Diffusion Models with Transformers(DiT) 논문을 분석합니다. U-Net 기반 디퓨전 모델의 한계를 넘어 Transformer 백본으로 전환한 배경, adaLN-Zero 조건화, 스케일링 법칙, SORA/DALL-E 3로의 영향까지 다룹니다.
2026-03-03 · 12 분 읽기 #ai-papers#diffusion-transformer#dit#generative-ai#image-generationHunyuanVideo와 LTX-2 완벽 분석: 오픈소스 비디오 생성 모델의 아키텍처, 성능, 실전 활용 가이드
Tencent HunyuanVideo(13B)와 Lightricks LTX-2(19B)의 아키텍처, 학습 방법론, 성능 벤치마크를 심층 분석하고, Wan 2.1/CogVideoX/Mochi 등 오픈소스 비디오 생성 모델 생태계 전체를 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 62 분 읽기 #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-video