태그: #generative-ai
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 14 편
3D를 만드는 두 가지 길 — 복원(NeRF·가우시안 스플래팅)과 생성(TRELLIS·Hunyuan3D)
"3D 모델을 만든다"는 말에는 완전히 다른 두 문제가 숨어 있습니다. 실제로 존재하는 장면을 사진 여러 장으로 되살리는 복원(reconstruction)과, 존재하지 않는 것을 텍스트·이미지 한 장에서 지어내는 생성(generation)입니다. 복원의 계보를 SfM에서 NeRF, 그리고 판을 바꾼 3D 가우시안 스플래팅과 feedforward 복원(Meta MapAnything)까지 따라가
2026-07-09 · 15 분 읽기 #3d#ai#gaussian-splatting#nerf#computer-visionSOTA 음악·오디오 생성 분석 — 뉴럴 코덱과 생성 모델
오디오 표현(파형·스펙트로그램·뉴럴 코덱)부터 오토리그레시브 오디오 언어모델과 확산 기반 오디오, 텍스트-음악 조건화까지 계보 중심으로 정리합니다. EnCodec, MusicGen, AudioLM 계열의 원리와 상용 모델, 평가·저작권 쟁점을 아키텍처 관점에서 분석합니다.
2026-06-30 · 16 분 읽기 #ai-papers#audio-generation#music-generation#neural-codec#audio-language-modelSOTA 비디오 생성 모델 분석 — 시공간 확산 트랜스포머
비디오 생성의 근본 난제인 시간 일관성과 연산 비용을 시공간 라텐트 패치와 확산 트랜스포머 관점에서 정리합니다. Sora가 제시한 개념과 후속 모델 계열, 조건화·평가·물리 일관성 한계를 아키텍처 중심으로 분석합니다.
2026-06-30 · 16 분 읽기 #ai-papers#video-generation#diffusion-transformer#spatiotemporal#text-to-videoAI 이미지 생성 2026 완벽 가이드 - Midjourney v7 · DALL·E 4 · Imagen 3 · FLUX · Stable Diffusion 3.5 · Ideogram · Recraft 심층 분석
2026년 AI 이미지 생성은 한 모델이 모든 것을 다 잘하는 시대가 끝났다. Midjourney v7의 미적 감각, DALL·E 4의 멀티모달 통합, Imagen 3의 사실주의, FLUX의 오픈웨이트 사진실적 품질, Stable Diffusion 3.5의 커뮤니티 베이스, Ideogram의 텍스트 렌더링, Recraft V3의 디자인·벡터 출력, Adobe Firefly 3의 라이선스 안전
2026-05-16 · 47 분 읽기 #ai-image-generation#midjourney#dall-e#imagen#fluxAI 이미지 생성 2026 — Flux · Imagen 4 · Midjourney v7 · Ideogram · Recraft · Firefly · DALL-E · Stable Diffusion 정직 비교
AI 음악 · AI 비디오와 함께 보는 이미지 편. 2025-2026년의 진짜 변화는 두 가지다 — 오픈웨이트 Flux가 SD-XL의 자리를 차지했고, Midjourney가 v7로 컨슈머 미학의 기준을 다시 끌어올렸다. Imagen 4 GA · Ideogram v3의 타이포 · Recraft의 디자이너 워크플로 · Firefly의 라이선스 명료성 · gpt-image-1의 재부상 · Comf
2026-05-14 · 43 분 읽기 #ai-image#flux#imagen#midjourney#ideogramDiffusion Models Deep Dive — DDPM, Latent Diffusion, Classifier-Free Guidance, DDIM, Stable Diffusion 완전 정복 (2025)
Stable Diffusion, DALL-E, Midjourney, Sora의 기반이 되는 확산 모델. 이 글은 Diffusion Model을 처음부터 해부합니다. Forward/Reverse diffusion process, DDPM과 variational lower bound, Score-based 관점, DDIM으로의 가속 샘플링, U-Net 아키텍처와 Cross-attention, L
2026-04-15 · 38 분 읽기 #diffusion#generative-ai#stable-diffusion#ddpm#machine-learning생성형 AI & 디퓨전 모델 완전 정복: Stable Diffusion, ControlNet, 비디오 생성까지
DDPM 수학부터 Stable Diffusion 구조, ControlNet, LoRA fine-tuning, Sora 비디오 생성까지 생성형 AI 완전 기술 가이드입니다.
2026-03-17 · 19 분 읽기 #generative-ai#diffusion-model#stable-diffusion#controlnet#비디오생성Gemini API를 프로덕션에 올릴 때 필요한 Prompt, Guardrails, Evaluation
Gemini API를 실서비스에 붙일 때 필요한 프롬프트 설계, structured output, safety 정책, 평가 루프, 비용 통제 방법을 운영 관점에서 정리한 가이드입니다.
2026-03-17 · 8 분 읽기 #gemini#generative-ai#ai#llmops#prompt-engineering생성형 AI 완전 정복: GAN, VAE, 디퓨전 모델 마스터하기
생성형 AI의 핵심 아키텍처를 완전히 마스터하는 가이드. VAE(변분 오토인코더), GAN(생성적 적대 신경망), DDPM(디퓨전 모델), Stable Diffusion까지 수식과 PyTorch 코드로 완벽히 이해합니다.
2026-03-17 · 32 분 읽기 #generative-ai#gan#vae#diffusion-model#stable-diffusionDiffusion Transformer(DiT) 아키텍처 분석: U-Net에서 Transformer로의 전환
Scalable Diffusion Models with Transformers(DiT) 논문을 분석합니다. U-Net 기반 디퓨전 모델의 한계를 넘어 Transformer 백본으로 전환한 배경, adaLN-Zero 조건화, 스케일링 법칙, SORA/DALL-E 3로의 영향까지 다룹니다.
2026-03-03 · 12 분 읽기 #ai-papers#diffusion-transformer#dit#generative-ai#image-generationWan Text-to-Video/Image-to-Video와 Z Image Turbo 완벽 분석: 차세대 비디오·이미지 생성 모델의 아키텍처와 활용
Alibaba Wan의 Text-to-Video/Image-to-Video 모델 아키텍처, 학습 방법론, 비디오 생성 파이프라인과 Z Image Turbo의 초고속 이미지 생성 기술을 심층 분석하고, Sora/Kling/Runway 등 경쟁 모델과 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 54 분 읽기 #wan#text-to-video#image-to-video#z-image-turbo#video-generationText-to-Image 모델 학습 방법론 완벽 가이드: GAN에서 Flow Matching까지
GAN, VAE, Diffusion, Flow Matching까지 Text-to-Image 생성 모델의 핵심 아키텍처별 학습 방법론을 논문 기반으로 심층 분석한다. Stable Diffusion, DALL-E, Imagen, Flux 등 주요 모델의 학습 전략과 Fine-tuning 기법을 포괄적으로 다룬다.
2026-03-01 · 63 분 읽기 #deep-learning#text-to-image#diffusion#stable-diffusion#generative-aiHunyuanVideo와 LTX-2 완벽 분석: 오픈소스 비디오 생성 모델의 아키텍처, 성능, 실전 활용 가이드
Tencent HunyuanVideo(13B)와 Lightricks LTX-2(19B)의 아키텍처, 학습 방법론, 성능 벤치마크를 심층 분석하고, Wan 2.1/CogVideoX/Mochi 등 오픈소스 비디오 생성 모델 생태계 전체를 비교하며 실전 활용 가이드를 제공한다.
2026-03-01 · 62 분 읽기 #hunyuan-video#ltx-video#ltx2#text-to-video#image-to-videoACE-Step: AI 음악 생성의 새로운 패러다임 — 아키텍처, 학습 방법, 실전 활용 완벽 분석
ACE-Step 음악 생성 모델의 아키텍처, 학습 방법론, 텍스트-투-뮤직 생성 원리를 심층 분석하고, MusicGen, Suno, Udio 등 경쟁 모델과 비교하며 AI 음악 생성의 현재와 미래를 조망한다.
2026-03-01 · 53 분 읽기 #ace-step#music-generation#ai-music#deep-learning#diffusion