태그: #llm-alignment
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 2 편
강화학습 완전 정복: DQN, PPO부터 RLHF, DPO까지 LLM 정렬까지
MDP 기초부터 DQN, PPO, SAC, RLHF, DPO까지. LLM 정렬에 사용되는 강화학습 기법을 PyTorch Stable-Baselines3 코드와 함께 완전 정복합니다.
2026-03-17 · 22 분 읽기 #reinforcement-learning#ppo#dqn#rlhf#dpoDPO(Direct Preference Optimization) 논문 심층 분석 — RLHF 없이 LLM 정렬하기
DPO의 수학적 원리부터 구현, RLHF와의 비교, IPO/KTO/ORPO 변형까지 — LLM 선호도 최적화의 핵심을 실무 관점에서 심층 분석합니다.
2026-03-09 · 30 분 읽기 #ai-papers#dpo#rlhf#llm-alignment#preference-optimization