点击右上角
微信好友
朋友圈

请使用浏览器分享功能进行分享

今年8月底,小鹏发布第二代VLA(视觉—语言—动作)大模型,端侧参数量扩大3.5倍,端到端响应提速300%,这套物理AI底座同时驱动智能汽车和人形机器人IRON。同期,智元发布GO-2具身基座大模型,云蝶科技发布全球首个系统级具身大脑RoboForge,逐际动力推出全球首个人形机器人操作系统。一时间,“给机器人装一个统一大脑”成为行业最热的方向。人们不禁要问:具身智能的“安卓时刻”到了吗?
所谓“安卓时刻”,指的是像当年安卓系统统一智能手机生态那样,出现一个通用的机器人智能底座,让不同厂商、不同形态的机器人都能在同一个“大脑”上运行。其技术内核就是VLA模型——将视觉感知、语言理解和动作生成统一在一个模型中端到端训练。2023年谷歌RT-2标志着VLA范式确立,短短三年间,OpenVLA、英伟达GR00T N1、智元ACoT-VLA等开源模型层出不穷。模型层的繁荣,确实让人联想到智能手机操作系统诞生前夜的景象。
“统一大脑”的价值是实实在在的。传统机器人开发是“一任务一程序”,换个场景几乎全部重来。VLA模型则像一个受过通用训练的“学徒”,能理解自然语言指令、感知环境变化、自主生成动作序列。云蝶科技的RoboForge在两大国际公开基准评测中全球登顶,同一套系统能适配不同任务、场景和机器人本体。小鹏的实践更证明了“一套底座、多种本体”的可行性:同一套VLA架构向上支撑Robotaxi的L4级自动驾驶,向下蒸馏到L2辅助驾驶,横向迁移到人形机器人IRON上。如果汽车和机器人能共享一个大脑,那离真正的通用机器人平台就不远了。
但冷静来看,“安卓时刻”还没有真正到来,至少有三道鸿沟需要跨越。第一道是数据鸿沟。大语言模型有互联网海量文本数据,而机器人动作数据天然稀缺——一次示教需要硬件、场地、人工、传感器同步,不同机器人的动作空间还完全不同。智元的AgiBot World数据集包含超过100万条轨迹,已是业内最大规模之一,但与大语言模型动辄万亿token的训练数据相比,仍有数量级的差距。第二道是实时性与安全性鸿沟。大模型推理慢几秒无伤大雅,机器人动作错了可能撞伤人。目前行业收敛到“双系统架构”:上层慢系统负责语义理解,下层快系统负责实时运动控制,这本身就说明单一模型还无法同时满足智能和安全。第三道是生态鸿沟。安卓的成功在于完整的开发者生态和硬件适配体系,而机器人领域连统一的硬件接口标准都还没有形成。
具身智能正处在从“技术概念期”进入“产品验证期”的关键节点。“安卓时刻”或许不是某一天突然降临,而是在一次次模型迭代、一个个场景落地中悄然到来。
文/鸣耒
