タグ: #dqn
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 4 件
[深層強化学習] 06. Deep Q-Network:DQNの原理と実装
テーブルベースQ学習の限界を克服するDQNの核心アイデア(経験リプレイ、ターゲットネットワーク)を理解し、Pong環境で実装します。
2026-03-19 · 12 分で読めます #reinforcement-learning#deep-learning#ai#dqn[深層強化学習] 07. DQN拡張:Double DQN、Dueling DQN、Rainbow
DQNの性能を向上させる6つの核心拡張技法(N-step、Double DQN、Noisy Networks、Prioritized Replay、Dueling DQN、Categorical DQN)とこれらを結合したRainbowを実装します。
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai#dqn強化学習完全ガイド: DQN・PPOからRLHF・DPOによるLLMアライメントまで
MDPの基礎からDQN・PPO・SAC・RLHF・DPOまで。LLMアライメントに使われる強化学習技法をPyTorchとStable-Baselines3のコードとともに完全解説します。
2026-03-17 · 20 分で読めます #強化学習#ppo#dqn#rlhf#dpo강화학습(Reinforcement Learning) 완벽 가이드: 이론부터 최신 알고리즘, 실전 구현까지
강화학습의 핵심 이론인 MDP, Bellman 방정식부터 Q-Learning, DQN, Policy Gradient, A3C, PPO, SAC까지 주요 알고리즘을 수식으로 유도하고, RLHF, AlphaGo, 로보틱스 응용 사례와 PyTorch 구현 예제를 총정리한다.
2026-03-01 · 69 分で読めます #reinforcement-learning#deep-learning#dqn#ppo#rlhf