在人工智能与机器人融合的赛道上,谷歌DeepMind再次投下一枚重磅炸弹。近日,其旗下新一代机器人基础模型Gemini Robotics 2正式亮相,该模型最大的突破在于为机器人带来了前所未有的“全身智能”,使机器人不再局限于单一的“手眼”协作,而是能够实现从指尖到躯干的全身协调控制。
这一发布被视为机器人从“机械执行”走向“通用智能”的关键一步。
从“半身”到“全身”的跃迁
回溯机器人技术的发展历程,过去十年间,工业机器人和服务机器人普遍采用的方案是“本体+小脑”架构。机器人通过视觉模块“看”见物体,再由机械臂或夹爪完成抓取、放置等任务。这种模式虽已成熟,但局限性明显:机器人在面对复杂地形、狭窄空间或需要全身平衡的任务时,往往捉襟见肘。
Gemini Robotics 2的核心创新在于,它将视觉、语言与多模态感知能力与全身运动控制进行了深度耦合。DeepMind研究团队表示,新模型能够同时处理来自头部摄像头、躯干传感器、四肢关节编码器的海量数据流,实时规划出涉及全身20多个自由度的协调动作。
简单来说,旧式机器人是“手足分离”的——眼睛负责看,手负责抓,身体负责站,三者之间缺乏实时联动。而Gemini Robotics 2实现了“手脚并用”的全身智能:当机器人伸手抓桌子底下掉落的零件时,它不仅能精确控制手指的力度,还会自动调整躯干倾斜角度、脚步支撑位置,甚至利用尾部或辅助轮保持平衡,整个过程流畅自然,宛如真人。
核心技术突破:多模态思维链
在技术细节上,Gemini Robotics 2延续了DeepMind在多模态大模型上的优势。该模型并非简单的“感知-控制”闭环,而是引入了“全身思维链”的概念。
具体而言,在面对一项任务时,模型首先会进行全局环境理解,识别出目标物体、障碍物、地面材质、光照条件等因素;随后,它会在虚拟空间中进行数千次运动模拟,规划出最优的全身姿态序列;最后,通过一个专门的运动执行模块,将规划转化为实际的电机控制指令。
以“爬楼梯并搬运重物”为例,传统单任务模型只能分别处理“攀爬”和“搬运”两个动作,机器人往往会在交界处出现姿态断层,甚至导致物品掉落。而Gemini Robotics 2能够在攀爬的每一步中动态调整手臂抱持重物的位置和角度,确保重物重心始终位于机器人支撑多边形内,从而安全高效地完成复杂任务。
DeepMind在官方技术博客中指出,该模型在多个标准基准测试中的成绩均大幅超过前代系统。特别是在“动态平衡力保持”“非结构化地形行走”“多物体同步操作”等指标上,成功率提升了近40%。
应用前景:从工厂到家庭
全身智能的突破,直接拓宽了机器人的应用场景。
在工业制造领域,目前大多数工业机器人被固定在落地底座或移动底盘上,活动范围有限。Gemini Robotics 2驱动的双足或四足机器人,能够在仓库货架间自由穿行,利用全身协调性在颠簸的AGV小车(自动导引运输车)上稳定操作,甚至能够蹲下身子捡取生产线下掉落的小零件,实现人机同工位协作。
在家庭服务场景中,新模型的意义更为突出。过去,扫地机器人无法爬过门槛和地毯;家政机器人无法打开低矮的壁柜门——这些难题的根源在于缺乏全身协调能力。嵌入了Gemini Robotics 2的机器人,将能够像人类一样屈膝、弯腰、侧身穿行,完成整理桌面、取放高柜物品、收拾地面玩具等复杂家务。
医疗康复领域亦有望受益。全身智能控制模型可以被移植到外骨骼机器人或下肢康复训练设备中,帮助行动障碍患者实现自然、稳定的行走姿态。
产业影响:开启新竞速时代
Gemini Robotics 2的发布,势必在全球机器人产业掀起新一轮技术竞赛。此前,波士顿动力、Agility Robotics等公司在运动控制硬件上占据领先地位,但它们在“软实力”即通用智能模型方面相对薄弱。而谷歌DeepMind凭借其在AI大模型上的深厚积累,率先推出全身智能模型,无疑将加速机器人“大脑”的迭代进程。
业内分析人士指出,随着全身智能模型的成熟,机器人的硬件形态也将发生深刻变化。未来,机器人将不再需要为每项任务设计专用机械结构,一个通用硬件平台配以强大的智能模型,即可胜任多种角色。这有望彻底改变机器人的制造成本和部署模式。
当然,全身智能机器人要实现大规模商业化,仍面临成本、安全性和场景适配的挑战。目前Gemini Robotics 2主要在实验室环境中表现优异,在真实世界的随机性和噪声干扰下能否保持稳定,还需要更多验证。
但不容置疑的是,Gemini Robotics 2为机器人行业指出了一条清晰的演进方向:真正的智能机器人,必须拥有一个完整的身体,而不只是一只手、一只眼。
正如DeepMind联合创始人戴密斯·哈萨比斯所言:“AI的下一步,是让机器人真正‘身体力行’地理解世界。” 如今,这一步已经迈出。