“现在的大语言模型没有目标,也完全不具备真实体验。”在近日于上海举行的“强化学习暑期学校”结业仪式上,图灵奖得主、强化学习领域奠基人之一理查德·萨顿教授发出上述警示。这一由上海创智学院、上海交通大学人工智能学院与Openmind研究院联合主办的活动,也成为萨顿教授首次在中国系统、完整地讲授其强化学习学术体系的舞台。
真实心智的核心:体验与交互
作为Openmind研究院首席科学家,萨顿在演讲中直指当前人工智能主流范式的核心缺陷。在他看来,心智的本质在于与真实世界的体验交互,而当下大语言模型所代表的路径完全忽略了这一根本性维度。
“心智存在的全部意义,就是从现实世界中获取反馈。”萨顿强调,真正的智能并非源于对海量文本数据的统计模仿,而是在与物理世界的持续互动中,通过不断试错和调整,逐步形成对环境的理解与预测能力。
他指出,当前人工智能领域普遍存在一种简化逻辑:将复杂的学习过程压缩为“奖励信号”,系统的目标被简化为最大化某个标量数值。这套逻辑虽然在某些特定任务上取得了显著成效,但从根本上背离了真实心智的运行机制。
大语言模型的根本局限
萨顿直言不讳地批评了当前备受瞩目的大语言模型。他认为,这些模型本质上并不理解人类的真实诉求,而只是专注于模仿人类生成的文本。“它们可以写出看似合理的文章,生成流畅的对话,但背后缺乏真正的意图和目的。”
这一观点直指大语言模型的根本性盲点:它们是在静态数据集上进行模式匹配,而非在动态环境中主动探索、获取新知识。萨顿将其比喻为“一个永远不会真正触摸世界的学习者”。
与之形成对照的是,真正的心智会主动掌控并理解自身体验,能够预测外部世界的变化,并通过行动干预环境。“这种主动性、目的性和因果推理能力,才是智能的核心特征。”萨顿在讲座中反复强调。
强化学习:通往真实智能的路径
作为强化学习领域的奠基人之一,萨顿此番发言并非全盘否定人工智能的进步,而是呼吁学界和产业界正视当前范式的局限性。他主张,未来的研究应当更加重视强化学习所代表的交互式学习范式,让AI系统在真实或模拟环境中通过试错积累经验,逐步形成对世界的内在表征。
“真正的智能不是被动吸收信息,而是主动构建对世界的理解。”萨顿表示,强化学习的核心价值在于提供了一个框架,让智能体能够在交互中自主发现目标、制定策略,并从中获得有意义的反馈。
学界反响与未来方向
萨顿的演讲在与会者中引起强烈反响。多位人工智能研究者表示,这一观点对当前“大模型狂热”提供了必要而及时的反思。上海交通大学人工智能学院相关负责人指出,萨顿教授的学术体系为突破现有技术瓶颈提供了理论指导,其强调的体验与交互理念,有望在人机协同、自主决策等前沿领域产生深远影响。
分析人士认为,随着人工智能技术从实验室走向大规模应用,如何让系统具备真正的理解能力而非仅仅是模式匹配能力,正成为下一阶段研究的关键课题。萨顿此次在中国的系统性讲授,不仅是对其学术思想的完整呈现,也可能为未来人工智能发展方向提供重要参照。
在当前人工智能技术飞速发展的背景下,图灵奖得主的这一提醒,无疑为整个行业注入了一剂清醒剂:在追求模型规模与计算效率的同时,不应遗忘智能的本质——对世界的真实理解与主动参与。