标签: #reinforcement-learning
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 6 篇
用 500 美元微调的 9B 赢过前沿模型的条件 — 以及这些条件有多窄
2026 年 7 月 28 日,Hacker News 上有一篇拿到 336 分的文章。Fermisense 用 GRPO 训练 Qwen3.5-9B,只花了约 500 美元的 GPU 时间,就在电商目录审核任务上,用同样的工具和同样的评分器,赢过了五套前沿模型配置。可达成分数的 87.3% 对最高前沿配置的 76.9%,处理 1,000 条的成本约 0.50 美元,对 19 到 172 美元。本文既不否定也不放大这个结果,而是把条件拆
2026-07-31 · 16 分钟阅读 #ai#llm#fine-tuning#reinforcement-learning#inference-cost人形机器人全身控制 — 双腿行走,双手操作
从人形机器人双腿行走到用手操作物体,本文梳理双足行走控制与全身控制(whole-body control)的核心概念。我们结合图示,依次讲解 ZMP 与 MPC、基于强化学习的运动控制(locomotion)、平衡与跌倒恢复、行走与操作的整合,以及把仿真中学到的策略迁移到实机的流程。
2026-06-29 · 34 分钟阅读 #ai-papers#robotics#humanoid#locomotion#whole-body-control机器人安全与对齐 — 如何信任强大的机器人
我们要如何信任日益强大的机器人?本文从物理安全、约束强化学习与安全层、分布偏移应对、人机协作安全、验证与标准,直到具身 AI 的对齐难题,进行一次均衡的梳理。
2026-06-29 · 31 分钟阅读 #ai-papers#robotics#safety#alignment#reinforcement-learning机器人如何学习 — 模仿学习与强化学习
概览机器人习得技能的四种方式,深入剖析模仿学习(遥操作、行为克隆、DAgger)与强化学习(奖励、策略、探索)的原理、优缺点、数据效率上的差异,以及如何将两者结合,并用图示与对比表加以梳理。
2026-06-29 · 28 分钟阅读 #ai-papers#robotics#imitation-learning#reinforcement-learning#robot-learning强化学习完全精通:从 DQN、PPO 到 RLHF、DPO 的 LLM 对齐
从 MDP 基础到 DQN、PPO、SAC、RLHF、DPO。结合 PyTorch 与 Stable-Baselines3 代码,完全精通用于 LLM 对齐的强化学习技术。
2026-03-17 · 20 分钟阅读 #reinforcement-learning#ppo#dqn#rlhf#dpo强化学习(Reinforcement Learning)完全指南:从理论基础到最新算法、实战实现
从强化学习的核心理论 MDP、Bellman 方程,到 Q-Learning、DQN、Policy Gradient、A3C、PPO、SAC 等主要算法逐一用公式推导,并系统整理 RLHF、AlphaGo、机器人应用案例与 PyTorch 实现示例。
2026-03-01 · 59 分钟阅读 #reinforcement-learning#deep-learning#dqn#ppo#rlhf