タグ: #policy-gradient
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 2 件
[深層強化学習] 09. Policy Gradient:方策ベースの強化学習
価値ベースの方法と方策ベースの方法の違いを理解し、Policy Gradientの数学的導出過程とREINFORCEアルゴリズムをCartPoleとPongに適用します。
2026-03-19 · 9 分で読めます #reinforcement-learning#deep-learning#ai#policy-gradient강화학습(Reinforcement Learning) 완벽 가이드: 이론부터 최신 알고리즘, 실전 구현까지
강화학습의 핵심 이론인 MDP, Bellman 방정식부터 Q-Learning, DQN, Policy Gradient, A3C, PPO, SAC까지 주요 알고리즘을 수식으로 유도하고, RLHF, AlphaGo, 로보틱스 응용 사례와 PyTorch 구현 예제를 총정리한다.
2026-03-01 · 69 分で読めます #reinforcement-learning#deep-learning#dqn#ppo#rlhf