随着自动驾驶技术不断向纵深推进,智能座舱与AI大模型的融合正在成为新一轮竞争的焦点。当地时间3月12日,谷歌旗下自动驾驶子公司Waymo正式宣布,其搭载谷歌最新多模态大模型Gemini的车载智能助手已在部分运营车辆上开启乘客端Beta测试。此举标志着AI大模型首次以“原生车载助手”身份进入L4级自动驾驶出租车的实际服务场景,为行业树立了新的技术标杆。
从“驾驶自动化”到“出行智能化”
Waymo作为全球自动驾驶领域的领军者,其无人驾驶出租车已在旧金山、凤凰城、洛杉矶等多个城市实现商业化运营。然而,在过去的发展阶段中,Waymo车辆内的乘客交互主要依赖基础触控屏和语音指令,功能多局限于导航、空调调节、音乐播放等传统车载应用。随着大模型技术的成熟,Waymo决定将更智能、更自然的交互体验引入座舱。
此次Beta测试的核心,是将谷歌Gemini模型深度集成到Waymo车辆的乘客端交互系统中。不同于市面上常见的“AI语音助手”,Gemini具备文本、图像、音频、视频等多模态理解与生成能力,能够在复杂、动态的出行场景下提供即时、个性化的服务。
Gemini车载助手:能“看”、能“听”、能“思考”
据Waymo官方介绍,乘客端Beta测试的主要功能包括:
-
环境感知与实时问答:乘客可以通过语音询问“窗外那栋建筑是什么?”“我们现在正经过哪个区?”“前面堵车的原因是什么?”——Gemini可结合车辆摄像头感知的实时画面与地图数据,给出准确、自然的回答。例如,当车辆经过地标建筑时,助手会主动向乘客介绍其历史背景或相关趣闻。
-
行程交互与个性化推荐:Gemini不仅能理解“帮我找个附近的咖啡店”这类基础指令,还能处理更复杂的自然语言请求,如“我想在20分钟内能到达的、评分4.5以上的日料店,最好有停车位”。系统会综合考虑实时交通、乘客偏好、餐厅评价等多维信息,给出最优建议。
-
多模态娱乐与生产力支持:在长途行程中,乘客可通过语音指令让Gemini生成旅行攻略、摘要播客内容、甚至辅助完成简单的办公任务。例如,“把刚才提到的地址记下来,发到我的邮箱”“帮我读一下最新新闻的要点”。
-
车内状态监控与安全提醒:结合车内传感器,Gemini能识别乘客是否系好安全带、是否有物品遗落,并通过语音或屏幕提示。在紧急情况下,助手可直接与Waymo安全中心联动,快速响应。
Beta测试的细节与规划
Waymo表示,此次Beta测试将首先面向旧金山和凤凰城的部分Waymo One用户开放。受邀乘客在乘车时,可以在车辆后排中央屏幕的界面中启用新助手,无需额外下载应用。系统默认以语音交互为主,同时支持触控反馈。
值得一提的是,Gemini车载助手的所有数据处理均在车辆本地或谷歌云端的加密环境下完成,乘客的隐私数据将遵循严格的安全协议。Waymo强调,AI模型不会录制或储存完整的对话内容,仅提取必要指令进行响应。
测试初期,助手能力将限定在“信息查询、导航、娱乐推荐”等核心场景,更复杂的多模态功能(如图像生成、实时翻译)将在后续迭代中逐步开放。Waymo计划收集测试用户的反馈,在数月后向所有运营区域推送正式版本。
行业影响:AI大模型重塑自动驾驶商业闭环
此次Waymo与Gemini的深度整合,意义远不止于“给乘客配了个聊天机器人”。从行业视角看,它代表自动驾驶公司正在从“解决怎么开”向“解决怎么用”转型。
一方面,AI大模型能显著提升乘客的粘性和付费意愿。当前,自动驾驶出租车在成本和效率上与传统网约车相比仍存挑战,而智能座舱提供的增值服务——如定制化旅游导览、车内办公、移动社交等——有望成为新的收入增长点。Waymo的这一尝试,实质上是在构建“出行即服务”的更高溢价模型。
另一方面,这也给传统车企和第三方智能座舱方案商带来压力。目前,蔚来、理想、小鹏等中国车企已纷纷接入大模型语音助手,而Waymo凭借Gemini在底层技术上的原生优势,有可能在“端到端”AI体验上实现跨越式领先。尤其在自动驾驶场景下,助手需要实时融合环境感知、导航决策与自然语言对话,这恰恰是多模态大模型的强项。
展望:AI将成为自动驾驶的“第二引擎”
Waymo联合首席执行官Tekedra Mawakana在发布会上表示:“未来,每一辆自动驾驶汽车都将成为一个智能个人助理的移动空间。Gemini让Waymo能够理解乘客的意图,而不仅仅是执行指令。”
与此同时,谷歌DeepMind团队也在持续优化Gemini模型在边缘设备上的推理效率,未来有望让部分推理直接在车载芯片上完成,减少对云端依赖,进一步增强响应速度与隐私保护。
可以预见,随着这一Beta测试的推进,一场围绕“AI座舱”的军备竞赛即将拉开序幕。而Waymo与Gemini的组合,或将成为定义下一代智慧出行体验的关键变量。