태그: #diffusion
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 8 편
모두를 위한 AI 6편 — 111만 파라미터 디퓨전으로 단어에서 숫자 그리기
"zero"라고 쓰면 0을 그리는 조건부 디퓨전 모델을 111만 파라미터로 만들었습니다. 노이즈를 섞는 forward는 공식 한 줄이고, 복원하는 reverse는 그 한 줄을 400번 거꾸로 밟는 것뿐입니다. 5편에서 L1 손실이 색을 바래게 만든 문제를 디퓨전이 어떻게 피해 가는지, 그리고 왜 모델이 노이즈를 예측하도록 학습되는지를 실제 생성 결과로 확인합니다.
2026-08-24 · 15 분 읽기 #ai#diffusion#ddpm#generative#pytorch확산 LLM이 CUDA 커널을 쓴다 — DICE와 왜 병렬 생성이 도움이 되는가
DICE는 2026년 2월 프리프린트로, 확산(diffusion) 대규모 언어 모델이 CUDA 커널 생성에서 같은 규모의 자기회귀(autoregressive) 모델을 능가하고 새로운 최고 성능(SOTA)을 세웠다고 주장합니다. 핵심 아이디어는 토큰을 왼쪽에서 오른쪽으로 하나씩 쓰는 대신, 전체 시퀀스를 병렬로 생성하고 어느 위치든 비순차적으로 고쳐 쓸 수 있다는 것 — 전역 구조가 중요한 코
2026-07-11 · 12 분 읽기 #ai#llm#diffusion#cuda#gpuDiffusion LM의 부상 — 자기회귀의 대안이 될 수 있을까
2026년 6월 구글이 DiffusionGemma를 공개하며 텍스트 확산 모델이 GeekNews와 해커뉴스를 달구고 있습니다. 자기회귀 생성의 구조적 한계, 마스킹 기반 디노이징의 원리, 블록 단위 병렬 생성, 4배 빠르다는 주장의 실체와 품질 트레이드오프까지 비판적으로 분석합니다.
2026-06-12 · 32 분 읽기 #llm#diffusion#text-generation#gemma#inferenceDiffusion Models Deep Dive — DDPM, Latent Diffusion, Classifier-Free Guidance, DDIM, Stable Diffusion 완전 정복 (2025)
Stable Diffusion, DALL-E, Midjourney, Sora의 기반이 되는 확산 모델. 이 글은 Diffusion Model을 처음부터 해부합니다. Forward/Reverse diffusion process, DDPM과 variational lower bound, Score-based 관점, DDIM으로의 가속 샘플링, U-Net 아키텍처와 Cross-attention, L
2026-04-15 · 38 분 읽기 #diffusion#generative-ai#stable-diffusion#ddpm#machine-learning2025년 AI 논문 트렌딩 총정리: HuggingFace 인기 논문부터 10대 연구 트렌드까지
HuggingFace 트렌딩 논문 TOP 10과 2025년 AI 연구 10대 트렌드를 개발자 관점에서 리뷰합니다. DeepSeek-R1의 순수 RL 추론, Nemotron-Cascade 30B/3B MoE, GRPO, vLLM PagedAttention, 100만 토큰 컨텍스트의 한계, 비디오 생성 벤치마크까지.
2026-03-21 · 67 분 읽기 #ai-research#papers#huggingface#reasoning#moeWan Text-to-Video/Image-to-Video와 Z Image Turbo 완벽 분석: 차세대 비디오·이미지 생성 모델의 아키텍처와 활용
Alibaba Wan의 Text-to-Video/Image-to-Video 모델 아키텍처, 학습 방법론, 비디오 생성 파이프라인과 Z Image Turbo의 초고속 이미지 생성 기술을 심층 분석하고, Sora/Kling/Runway 등 경쟁 모델과 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 54 분 읽기 #wan#text-to-video#image-to-video#z-image-turbo#video-generationText-to-Image 모델 학습 방법론 완벽 가이드: GAN에서 Flow Matching까지
GAN, VAE, Diffusion, Flow Matching까지 Text-to-Image 생성 모델의 핵심 아키텍처별 학습 방법론을 논문 기반으로 심층 분석한다. Stable Diffusion, DALL-E, Imagen, Flux 등 주요 모델의 학습 전략과 Fine-tuning 기법을 포괄적으로 다룬다.
2026-03-01 · 63 분 읽기 #deep-learning#text-to-image#diffusion#stable-diffusion#generative-aiACE-Step: AI 음악 생성의 새로운 패러다임 — 아키텍처, 학습 방법, 실전 활용 완벽 분석
ACE-Step 음악 생성 모델의 아키텍처, 학습 방법론, 텍스트-투-뮤직 생성 원리를 심층 분석하고, MusicGen, Suno, Udio 등 경쟁 모델과 비교하며 AI 음악 생성의 현재와 미래를 조망한다.
2026-03-01 · 53 분 읽기 #ace-step#music-generation#ai-music#deep-learning#diffusion