태그: #reinforcement-learning
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 28 편
[심층 강화학습] 18. AlphaGo Zero: 자기 대국으로 배우는 AI
AlphaGo Zero의 핵심 원리: MCTS와 자기 대국(self-play), 그리고 Connect4 봇 구현
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 15. Trust Region 방법: TRPO, PPO, ACKTR
정책 업데이트의 안정성을 보장하는 Trust Region 기법: PPO의 클리핑 목적함수, TRPO의 제약 최적화, ACKTR
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 12. 강화학습으로 챗봇 훈련하기
Seq2Seq 모델과 강화학습을 결합한 챗봇 훈련: RNN 기초부터 Self-Critical Sequence Training(SCST)까지
2026-03-19 · 11 분 읽기 #reinforcement-learning#deep-learning#ai#nlp[심층 강화학습] 09. Policy Gradient: 정책 기반 강화학습
가치 기반 방법과 정책 기반 방법의 차이를 이해하고, Policy Gradient의 수학적 유도 과정과 REINFORCE 알고리즘을 CartPole과 Pong에 적용합니다.
2026-03-19 · 15 분 읽기 #reinforcement-learning#deep-learning#ai#policy-gradient[심층 강화학습] 06. Deep Q-Network: DQN의 원리와 구현
테이블 기반 Q-러닝의 한계를 극복하는 DQN의 핵심 아이디어(경험 리플레이, 타겟 네트워크)를 이해하고, Pong 환경에서 구현합니다.
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai#dqn[심층 강화학습] 03. PyTorch 딥러닝 기초: 텐서부터 신경망까지
PyTorch의 텐서 연산, 자동 미분, 신경망 구성 요소를 학습하고, TensorBoard 모니터링과 Atari 이미지를 활용한 GAN 예제를 구현합니다.
2026-03-19 · 27 분 읽기 #reinforcement-learning#deep-learning#ai#pytorch강화학습 완전 정복: DQN, PPO부터 RLHF, DPO까지 LLM 정렬까지
MDP 기초부터 DQN, PPO, SAC, RLHF, DPO까지. LLM 정렬에 사용되는 강화학습 기법을 PyTorch Stable-Baselines3 코드와 함께 완전 정복합니다.
2026-03-17 · 22 분 읽기 #reinforcement-learning#ppo#dqn#rlhf#dpo강화학습(Reinforcement Learning) 완벽 가이드: 이론부터 최신 알고리즘, 실전 구현까지
강화학습의 핵심 이론인 MDP, Bellman 방정식부터 Q-Learning, DQN, Policy Gradient, A3C, PPO, SAC까지 주요 알고리즘을 수식으로 유도하고, RLHF, AlphaGo, 로보틱스 응용 사례와 PyTorch 구현 예제를 총정리한다.
2026-03-01 · 69 분 읽기 #reinforcement-learning#deep-learning#dqn#ppo#rlhf