태그: #preference-optimization
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 1 편
DPO(Direct Preference Optimization) 논문 심층 분석 — RLHF 없이 LLM 정렬하기
DPO의 수학적 원리부터 구현, RLHF와의 비교, IPO/KTO/ORPO 변형까지 — LLM 선호도 최적화의 핵심을 실무 관점에서 심층 분석합니다.
2026-03-09 · 30 분 읽기 #ai-papers#dpo#rlhf#llm-alignment#preference-optimization