タグ: #reinforcement-learning
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 27 件
[深層強化学習] 16. Black-Box最適化:進化戦略と遺伝的アルゴリズム
勾配なしで方策を最適化する方法:進化戦略(ES)と遺伝的アルゴリズム(GA)の原理と実装
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 13. ウェブナビゲーションと強化学習
ブラウザ自動化と強化学習の融合:Mini World of BitsベンチマークとOpenAI Universeを活用したウェブエージェントの実装
2026-03-19 · 10 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 10. Actor-Critic方法:A2Cとハイパーパラメータチューニング
REINFORCEの分散問題を解決するActor-Critic構造を理解し、A2CアルゴリズムをPongに適用し、学習率やエントロピー係数などの主要ハイパーパラメータの影響を分析します。
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai#actor-critic[深層強化学習] 07. DQN拡張:Double DQN、Dueling DQN、Rainbow
DQNの性能を向上させる6つの核心拡張技法(N-step、Double DQN、Noisy Networks、Prioritized Replay、Dueling DQN、Categorical DQN)とこれらを結合したRainbowを実装します。
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai#dqn[深層強化学習] 04. Cross-Entropy方法でCartPoleを解く
強化学習方法論の分類を概観し、Cross-Entropy方法を用いてCartPoleとFrozenLake環境を解決します。
2026-03-19 · 11 分で読めます #reinforcement-learning#deep-learning#ai[深層強化学習] 01. 強化学習とは:MDPと基本概念
機械学習の3つのパラダイムを比較し、強化学習の核心構成要素(エージェント、環境、報酬)とマルコフ決定過程(MDP)の数学的基礎を学びます。
2026-03-19 · 14 分で読めます #reinforcement-learning#deep-learning#ai강화학습(Reinforcement Learning) 완벽 가이드: 이론부터 최신 알고리즘, 실전 구현까지
강화학습의 핵심 이론인 MDP, Bellman 방정식부터 Q-Learning, DQN, Policy Gradient, A3C, PPO, SAC까지 주요 알고리즘을 수식으로 유도하고, RLHF, AlphaGo, 로보틱스 응용 사례와 PyTorch 구현 예제를 총정리한다.
2026-03-01 · 69 分で読めます #reinforcement-learning#deep-learning#dqn#ppo#rlhf