标签: #vla
关于 GPU、LLM、MLOps、Kubernetes 以及心态的文章 · 7 篇
Gemini Robotics 2 与机器人基础模型 —— 全身控制真正改变了什么
2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2,宣布用一个视觉-语言-动作模型来控制人形机器人,从脚尖到指尖一以贯之。有意思的是,随之公布的数字读起来不像是炫耀,反而更像是对当前状态的诚实记录 —— 拧开灯泡的成功率是 92%,拧上去是 36%,从地板上捡东西是 45.7%。本文梳理 VLA 到底是什么、全身控制为什么比上肢操作更难、跨具身泛化为什么才是真正的瓶颈,以及该怎样正
2026-07-31 · 22 分钟阅读 #ai#robotics#vla#foundation-models#evaluation2026年机器人企业地图 — 人形机器人混战与VLA模型,以及工程师的入场路径
2026年是人形机器人出货量同比跃升7倍(预计达5万台)的转折点。从估值390亿美元、拥有自研VLA模型Helix的Figure,到即将于夏季进入量产的Tesla Optimus Gen 3,再到已售出5,500台的价格破坏者Unitree,以及出售机器人通用大脑的Physical Intelligence(π0) — 本文按硬件、大脑、市场三条轴线梳理主要企业,追溯从RT-2到GR00T N2的VLA(Vision-Language-
2026-07-09 · 10 分钟阅读 #robotics#ai#vla#trends#career机器人基础模型 — 一个策略应对多种任务
本文梳理机器人基础模型这一潮流——它试图用一个策略应对多种机器人、多种任务。我们会依次看通用策略的概念、Open X-Embodiment 这类大规模机器人数据、跨具身、与 VLA 的关系、扩展(scaling)视角,以及数据、安全、评估这三大课题,全程配以图示。
2026-06-29 · 34 分钟阅读 #ai-papers#robotics#foundation-model#generalist-policy#open-x-embodiment从人类视频中学习的机器人 — 网络规模数据的梦想
机器人能从人处理物品的视频中学习吗。本文梳理了可供性与轨迹、领域差距、表征学习与预训练、单样本模仿、网络视频规模化、以及与机器人数据的结合,并诚实地列出案例与局限。
2026-06-29 · 33 分钟阅读 #ai-papers#robotics#imitation-learning#representation-learning#video机器人如何学习 — 模仿学习与强化学习
概览机器人习得技能的四种方式,深入剖析模仿学习(遥操作、行为克隆、DAgger)与强化学习(奖励、策略、探索)的原理、优缺点、数据效率上的差异,以及如何将两者结合,并用图示与对比表加以梳理。
2026-06-29 · 28 分钟阅读 #ai-papers#robotics#imitation-learning#reinforcement-learning#robot-learning机器人能看、能听、能动 — VLA 模型 RT-2 与 OpenVLA 评述
视觉-语言-行动(VLA)模型接收摄像头画面和自然语言指令,直接输出机器人的动作。本文以 RT-2、Open X-Embodiment、OpenVLA 为主线,梳理 VLA 范式的思路、架构、动作分词方式,以及优势与局限。
2026-06-27 · 24 分钟阅读 #ai-papers#robotics#vla#rt-2#openvla为人形机器人准备的两个大脑 — GR00T N1与Helix
面向人形机器人的VLA必须同时具备快速反射与缓慢思考的能力。本文以NVIDIA GR00T N1和Figure AI Helix为中心,梳理结合快速低层控制(System 1)与缓慢规划(System 2)的双系统架构、训练方式、面临的课题与展望。
2026-06-27 · 25 分钟阅读 #ai-papers#robotics#humanoid#groot-n1#helix