相比上一代 Gemini Robotics 只能控制机器人上半身完成桌面任务,此次更新的关键变化在于,一个视觉-语言-动作(VLA)模型首次实现了对完整人形机器人的控制,覆盖从双腿到手指的全身自由度,并在多个形态迥异的硬件平台之间共用同一份模型权重。传统路线如波士顿动力(Boston Dynamics)的阿特拉斯(Atlas)等,其行走、平衡等能力由基于模型预测控制或强化学习训练的独立控制器分别负责。此次发布的三个模型在通用性与实用性上仍有明显短板,但从架构层面验证了一个颇具潜力的方向:人形机器人行走与操作的分层拼接,未来将在同一模型内走向协同。
麻省理工科技评论
14 小时前