태그: #reinforcement-learning
GPU·LLM·MLOps·쿠버네티스, 그리고 마음가짐에 관한 글 · 28 편
500달러로 파인튜닝한 9B가 프런티어를 이긴 조건 — 그리고 그 조건이 얼마나 좁은가
2026년 7월 28일 Hacker News에서 336점을 받은 글이 있습니다. Fermisense가 Qwen3.5-9B를 GRPO로 약 500달러어치 GPU 시간만큼 학습시켜, 같은 도구와 같은 채점기를 쓴 다섯 개 프런티어 구성을 전자상거래 카탈로그 검수 과제에서 앞섰다는 보고입니다. 달성 가능 점수의 87.3% 대 최고 프런티어 76.9%, 1,000건 처리 비용은 약 0.50달러 대
2026-07-31 · 19 분 읽기 #ai#llm#fine-tuning#reinforcement-learning#inference-cost휴머노이드 전신 제어 — 두 발로 걷고 손으로 다루기
휴머노이드 로봇이 두 발로 걷고 손으로 물건을 다루기까지, 이족보행 제어와 전신 제어(whole-body control)의 핵심 개념을 정리합니다. ZMP와 MPC, 강화학습 기반 로코모션, 균형과 낙상 회복, 보행과 조작의 통합, 그리고 시뮬레이션 학습을 실물로 옮기는 흐름을 다이어그램과 함께 살펴봅니다.
2026-06-29 · 40 분 읽기 #ai-papers#robotics#humanoid#locomotion#whole-body-control로봇 안전과 정렬 — 강력한 로봇을 신뢰하려면
점점 강력해지는 로봇을 어떻게 신뢰할 수 있을까요. 물리적 안전, 제약 강화학습과 안전층, 분포 이탈 대응, 사람-로봇 협업 안전, 검증과 표준, 그리고 임바디드 AI의 정렬 과제까지 균형 있게 살펴봅니다.
2026-06-29 · 34 분 읽기 #ai-papers#robotics#safety#alignment#reinforcement-learning로봇은 어떻게 배우는가 — 모방학습과 강화학습
로봇이 기술을 습득하는 네 가지 방식을 개괄하고, 모방학습(텔레오퍼레이션·행동 복제·DAgger)과 강화학습(보상·정책·탐험)의 원리와 장단점, 데이터 효율의 차이, 그리고 두 접근을 결합하는 방법을 다이어그램과 비교표로 정리합니다.
2026-06-29 · 33 분 읽기 #ai-papers#robotics#imitation-learning#reinforcement-learning#robot-learning모방 기계는 발견할 수 없는가 — Rich Sutton의 도발과 RL의 반격
강화학습의 대부 Rich Sutton이 지도학습 기반 생성 AI는 모방 모델이라 새로운 과학적 발견에 한계가 있다고 주장하며 2026년 6월 커뮤니티를 달궜습니다. Bitter Lesson의 맥락에서 그의 주장을 해부하고, 모방 학습과 강화학습의 본질적 차이, 반론, 그리고 에이전트 설계에 주는 실무적 교훈을 정리합니다.
2026-06-12 · 44 분 읽기 #ai#reinforcement-learning#llm#research#ai-agent모던 강화학습 생태계 2026 완벽 가이드 - RLlib (Anyscale) · Stable-Baselines3 · Tianshou · CleanRL · OpenSpiel (DeepMind) · Gymnasium (Farama) · Acme · PufferLib · Pearl (Meta) · TorchRL 심층 분석
2026년 5월 기준 강화학습(RL) 생태계를 처음부터 끝까지 본다. 범용 RL 라이브러리(RLlib, Stable-Baselines3, Tianshou, CleanRL, TorchRL, PFRL, TF-Agents), DeepMind 스택(OpenSpiel, Acme, Haiku/RLax/Distrax), Meta Pearl, 환경 표준(Gymnasium, PettingZoo, ALE, M
2026-05-16 · 34 분 읽기 #reinforcement-learning#rllib#stable-baselines-3#tianshou#cleanrl[심층 강화학습] 20. 심층 강화학습 총정리: 알고리즘 비교와 선택 가이드
가치 기반, 정책 기반, Actor-Critic, 모델 기반 등 심층 강화학습 알고리즘의 체계적 비교와 선택 기준
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 17. 모델 기반 강화학습: Imagination-Augmented Agent
모델 기반 RL의 원리와 I2A(Imagination-Augmented Agent): 환경 모델을 학습하고 상상 속에서 계획하는 에이전트
2026-03-19 · 13 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 14. 연속 행동 공간: DDPG와 분포 정책
연속 행동 공간을 다루는 방법: A2C 확장, DDPG의 결정적 정책 그래디언트, 분포 정책 그래디언트
2026-03-19 · 10 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 11. A3C: 비동기 Advantage Actor-Critic
A2C의 상관관계 문제를 비동기 병렬 학습으로 해결하는 A3C 알고리즘의 원리와 데이터/그래디언트 병렬화 구현
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 08. 강화학습으로 주식 트레이딩 만들기
주식 트레이딩을 강화학습 문제로 정의하고, 커스텀 거래 환경을 설계한 뒤 피드포워드 및 CNN 모델로 트레이딩 에이전트를 학습시킵니다.
2026-03-19 · 30 분 읽기 #reinforcement-learning#deep-learning#ai#finance[심층 강화학습] 05. 벨만 방정식과 가치 반복
상태 가치와 행동 가치의 개념을 이해하고, 벨만 최적 방정식을 기반으로 가치 반복법과 Q-러닝을 FrozenLake에 적용합니다.
2026-03-19 · 11 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 02. OpenAI Gym으로 시작하는 강화학습
OpenAI Gym의 구조와 API를 이해하고, CartPole 환경에서 무작위 에이전트와 래퍼를 활용한 실습을 진행합니다.
2026-03-19 · 14 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 19. 심층 강화학습의 실전 응용 사례
로봇 제어, 자율주행, 자원 관리, 추천 시스템, NLP, 게임 AI 등 심층 강화학습의 다양한 실전 활용
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 16. Black-Box 최적화: 진화 전략과 유전 알고리즘
그래디언트 없이 정책을 최적화하는 방법: 진화 전략(ES)과 유전 알고리즘(GA)의 원리와 구현
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 13. 웹 내비게이션과 강화학습
브라우저 자동화와 강화학습의 결합: Mini World of Bits 벤치마크와 OpenAI Universe를 활용한 웹 에이전트 구현
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 10. Actor-Critic 방법: A2C와 하이퍼파라미터 튜닝
REINFORCE의 분산 문제를 해결하는 Actor-Critic 구조를 이해하고, A2C 알고리즘을 Pong에 적용하며, 학습률, 엔트로피 계수 등 주요 하이퍼파라미터의 영향을 분석합니다.
2026-03-19 · 18 분 읽기 #reinforcement-learning#deep-learning#ai#actor-critic[심층 강화학습] 07. DQN 확장: Double DQN, Dueling DQN, Rainbow
DQN의 성능을 향상시키는 6가지 핵심 확장 기법(N-step, Double DQN, Noisy Networks, Prioritized Replay, Dueling DQN, Categorical DQN)과 이들을 결합한 Rainbow를 구현합니다.
2026-03-19 · 17 분 읽기 #reinforcement-learning#deep-learning#ai#dqn[심층 강화학습] 04. Cross-Entropy 방법으로 CartPole 풀기
강화학습 방법론의 분류를 살펴보고, Cross-Entropy 방법을 이용하여 CartPole과 FrozenLake 환경을 해결합니다.
2026-03-19 · 12 분 읽기 #reinforcement-learning#deep-learning#ai[심층 강화학습] 01. 강화학습이란: MDP와 기본 개념
머신러닝의 세 가지 패러다임을 비교하고, 강화학습의 핵심 구성 요소(에이전트, 환경, 보상)와 마르코프 결정 과정(MDP)의 수학적 기초를 살펴봅니다.
2026-03-19 · 14 분 읽기 #reinforcement-learning#deep-learning#ai