태그: #deep-learning
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 75 편
PyTorch 2.13의 torchcomms — c10d를 대체하러 온 새 분산 통신 백엔드
2026년 7월 8일 릴리스된 PyTorch 2.13의 하이라이트 가운데 가장 구조적인 변화는 torchcomms — PyTorch Distributed의 새 통신 백엔드가 코어의 CI와 DeviceMesh 경로에 통합되기 시작한 것입니다. torchcomms는 2025년 10월 Meta가 발표한 실험적 통신 API로, 전역 상태 기반 c10d ProcessGroup의 기술 부채(NCCL 중
2026-07-17 · 19 분 읽기 #pytorch#distributed-training#nccl#deep-learning멀티모달 AI 학습법 — 여러 감각을 하나의 모델로
이미지·텍스트·오디오·비디오를 하나의 모델로 다루는 멀티모달 AI의 학습 원리를 정리합니다. 모달리티 정렬과 대조학습, 융합 방식, 공유 임베딩 공간, 사전학습과 파인튜닝, 데이터와 평가, 그리고 환각 같은 한계까지 학습 파이프라인을 코드와 함께 살펴봅니다.
2026-06-26 · 34 분 읽기 #ai-papers#multimodal#clip#vision-language#contrastive-learningLLM을 바닥부터 만들어보기 — 스탠퍼드 CS336 스타일 학습 로드맵
스탠퍼드 CS336(Language Modeling from Scratch)이 해커뉴스 상위권에 오르며 from-scratch LLM 학습이 다시 화제입니다. 토크나이저부터 어텐션, 분산 학습, 스케일링 법칙, 정렬, 추론 최적화까지 전체 커리큘럼을 해부하고 20주 학습 플랜과 미니 프로젝트 아이디어를 정리했습니다.
2026-06-12 · 27 분 읽기 #llm#transformer#cs336#deep-learning#tokenizerTransformer 아키텍처 완전 가이드 2025: Self-Attention, Positional Encoding, Multi-Head, GPT vs BERT — ChatGPT 뒤의 수학
ChatGPT, Claude, Gemini의 공통 기반인 Transformer를 완전 분석. Attention 메커니즘, positional encoding, multi-head, encoder vs decoder, GPT와 BERT의 차이까지 — Transformer의 모든 것을 720줄로 수학과 함께 파헤친다.
2026-04-15 · 29 분 읽기 #transformer#attention#self-attention#gpt#bertDiffusion Models Deep Dive — DDPM, Latent Diffusion, Classifier-Free Guidance, DDIM, Stable Diffusion 완전 정복 (2025)
Stable Diffusion, DALL-E, Midjourney, Sora의 기반이 되는 확산 모델. 이 글은 Diffusion Model을 처음부터 해부합니다. Forward/Reverse diffusion process, DDPM과 variational lower bound, Score-based 관점, DDIM으로의 가속 샘플링, U-Net 아키텍처와 Cross-attention, L
2026-04-15 · 38 분 읽기 #diffusion#generative-ai#stable-diffusion#ddpm#machine-learning[심층 강화학습] 20. 심층 강화학습 총정리: 알고리즘 비교와 선택 가이드
가치 기반, 정책 기반, Actor-Critic, 모델 기반 등 심층 강화학습 알고리즘의 체계적 비교와 선택 기준
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 17. 모델 기반 강화학습: Imagination-Augmented Agent
모델 기반 RL의 원리와 I2A(Imagination-Augmented Agent): 환경 모델을 학습하고 상상 속에서 계획하는 에이전트
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 14. 연속 행동 공간: DDPG와 분포 정책
연속 행동 공간을 다루는 방법: A2C 확장, DDPG의 결정적 정책 그래디언트, 분포 정책 그래디언트
2026-03-19 · 10 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 11. A3C: 비동기 Advantage Actor-Critic
A2C의 상관관계 문제를 비동기 병렬 학습으로 해결하는 A3C 알고리즘의 원리와 데이터/그래디언트 병렬화 구현
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 08. 강화학습으로 주식 트레이딩 만들기
주식 트레이딩을 강화학습 문제로 정의하고, 커스텀 거래 환경을 설계한 뒤 피드포워드 및 CNN 모델로 트레이딩 에이전트를 학습시킵니다.
2026-03-19 · 30 분 읽기 #reinforcement-learning#deep-learning#ai#finance[심층 강화학습] 05. 벨만 방정식과 가치 반복
상태 가치와 행동 가치의 개념을 이해하고, 벨만 최적 방정식을 기반으로 가치 반복법과 Q-러닝을 FrozenLake에 적용합니다.
2026-03-19 · 11 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 02. OpenAI Gym으로 시작하는 강화학습
OpenAI Gym의 구조와 API를 이해하고, CartPole 환경에서 무작위 에이전트와 래퍼를 활용한 실습을 진행합니다.
2026-03-19 · 14 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 19. 심층 강화학습의 실전 응용 사례
로봇 제어, 자율주행, 자원 관리, 추천 시스템, NLP, 게임 AI 등 심층 강화학습의 다양한 실전 활용
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 16. Black-Box 최적화: 진화 전략과 유전 알고리즘
그래디언트 없이 정책을 최적화하는 방법: 진화 전략(ES)과 유전 알고리즘(GA)의 원리와 구현
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 13. 웹 내비게이션과 강화학습
브라우저 자동화와 강화학습의 결합: Mini World of Bits 벤치마크와 OpenAI Universe를 활용한 웹 에이전트 구현
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 10. Actor-Critic 방법: A2C와 하이퍼파라미터 튜닝
REINFORCE의 분산 문제를 해결하는 Actor-Critic 구조를 이해하고, A2C 알고리즘을 Pong에 적용하며, 학습률, 엔트로피 계수 등 주요 하이퍼파라미터의 영향을 분석합니다.
2026-03-19 · 18 분 읽기 #reinforcement-learning#deep-learning#ai#actor-critic[심층 강화학습] 07. DQN 확장: Double DQN, Dueling DQN, Rainbow
DQN의 성능을 향상시키는 6가지 핵심 확장 기법(N-step, Double DQN, Noisy Networks, Prioritized Replay, Dueling DQN, Categorical DQN)과 이들을 결합한 Rainbow를 구현합니다.
2026-03-19 · 17 분 읽기 #reinforcement-learning#deep-learning#ai#dqn[심층 강화학습] 04. Cross-Entropy 방법으로 CartPole 풀기
강화학습 방법론의 분류를 살펴보고, Cross-Entropy 방법을 이용하여 CartPole과 FrozenLake 환경을 해결합니다.
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 01. 강화학습이란: MDP와 기본 개념
머신러닝의 세 가지 패러다임을 비교하고, 강화학습의 핵심 구성 요소(에이전트, 환경, 보상)와 마르코프 결정 과정(MDP)의 수학적 기초를 살펴봅니다.
2026-03-19 · 14 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 18. AlphaGo Zero: 자기 대국으로 배우는 AI
AlphaGo Zero의 핵심 원리: MCTS와 자기 대국(self-play), 그리고 Connect4 봇 구현
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai