Gemini Robotics ER 2:视频理解、任务编排与多机器人协作
1 小时前 2 阅读来源:Google DeepMind Blog
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌DeepMind发布Gemini Robotics ER 2,让机器人学会看视频、协作干活
谷歌DeepMind近日推出了新一代机器人基础模型Gemini Robotics ER 2,这并非一个简单的软件更新,而是试图从根本上改变机器人理解和执行任务的方式。对于跨境电商卖家而言,这意味着未来仓储物流、分拣包装等环节的自动化将迎来更智能的解决方案,而AI从业者则能看到多模态大模型在物理世界落地的全新范式。
核心变化在于,Gemini Robotics ER 2将视频理解、任务编排和多机器人协作三大能力深度整合。过去,机器人执行任务往往需要预设程序或依赖单一指令,而ER 2能够通过观看人类操作视频来理解动作逻辑,比如看到工人如何将商品放入不同规格的包装盒,它就能自主拆解出“识别商品尺寸-选择对应包装盒-完成封装”的完整流程。更关键的是,它支持多个机器人在同一场景下协同工作,例如一台负责搬运货架,另一台负责分拣,通过共享视觉信息避免碰撞和重复劳动。这种能力直接对标亚马逊FBA(亚马逊自营物流)仓库中Kiva机器人集群的调度逻辑,但ER 2的通用性更强,无需为每个场景单独训练模型。
对跨境电商卖家的实际影响:仓储自动化门槛将大幅降低。传统上,部署机器人分拣系统需要昂贵的定制化开发和环境改造,而ER 2的“看视频学习”特性意味着卖家只需录制几段真实操作视频,机器人就能快速适应不同尺寸、材质的商品。例如,处理易碎品时,机器人通过观察视频中工人轻拿轻放的动作,就能自动调整抓取力度。此外,多机器人协作能力能解决旺季订单暴增时的产能瓶颈——系统可以动态调配空闲机器人支援最繁忙的工位,而无需人工干预。
对AI从业者的启示:这是多模态大模型从“理解数字世界”向“操控物理世界”的关键跃迁。ER 2本质上是一个基于视频理解的端到端模型,它不再依赖传统的“感知-规划-控制”分离架构,而是将摄像头输入直接映射为机器人动作。这意味着,训练数据不再局限于标注好的机器人轨迹,而是可以大量使用互联网上的操作视频(如YouTube上的仓库作业视频)。这种数据利用方式的转变,可能大幅降低机器人训练成本,并加速通用机器人操作系统的成熟。不过,目前ER 2仍处于实验室阶段,实际部署中面临的硬件适配、实时性延迟等问题,还需要与机器人本体厂商(如波士顿动力、优必选)进一步磨合。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
