“Is AI Reasoning Right for the Wrong Reasons?” 这一问题正拷问着蓬勃发展的生成式人工智能行业。随着ChatGPT等大语言模型在数学、法律和科学考试中屡创佳绩,许多人认为AI已经拥有了接近人类的“创造性思维”。然而,顶尖学府的研究人员日前发现,AI在给出正确答案时,其内部推理过程往往并非基于真正的逻辑,而是陷入了一种“高级的海市蜃楼”——它们可能在用错误的逻辑,碰巧得到了正确的答案。
幻觉还是捷径?一项实验的隐喻
以美国麻省理工学院(MIT)的一项科研测试为例,研究者针对AI在算术推理上的表现进行了深度解构。他们向AI提出了大量包含无明显相关数字的数学问题,并获取了AI的“思维链”(Chain of Thought)文本。结果令人玩味:AI的解题过程显示其频繁地“征用”了非关键数字,甚至通过记录“相似解题步骤”的模式来完成运算,而非真正的数学逻辑推导。
事实上,推理错误的AI在答对时,其“思考过程”往往呈现出三个特征:逻辑连接词使用异常频繁、数字会被无端复制粘贴、且引用与问题无关的常识性表述。这种“模型幻觉”表明,AI并非在“算”,而是在“猜”——它们在庞大的训练数据中找到了高频出现的特定词元组合,并依据统计概率生成了看起来合理但缺乏因果律的答案。
为什么会“对”?因为“捷径”也是数据分析
大语言模型的底层逻辑并非像人类大脑一样拥有先验的逻辑模块,而是一个基于海量文本的“预测机器”。当问题涉及“如果A大于B,B大于C,那么谁最大”时,AI并非理解了“传递性”这一数学公理,而是因为在相似文本的语料库中,这类问题大多伴随“A”作为答案出现。如果用一个包含“苹果”“橘子”“香蕉”的语义迷惑题目去测试,AI就会暴露出它只是在进行词序排列,而非运用逻辑。
更值得警惕的是,工程师在训练时并未刻意引导AI学习“为什么”。通过“思维链”的提示工程,AI学会了生成看似合理的中间步骤,但这并非大脑皮层中“先想后说”的体现,而是对数据模式的一种“统计学补全”。这种“先有结论、后找理由”的行为,被称为“伪推理”。
蝴蝶效应:当“错误推理”蔓延至现实场景
这种“正确但错误”的逻辑缺陷,正在数个高专业壁垒的领域埋下隐患。在医疗诊断中,AI虽然在影像判读上表现出高超的“命中率”,但其给出的解释往往忽略关键的阴性特征;在司法辅助系统中,AI能够引用相关法条,但常常混淆了“等同替换”和“基本释义”的界限。一旦我们依赖这些表面正确的答案,却无法核验其推理过程,那么“AI辅助决策”就会升级为“AI代替责任”。
更微妙的是,这种“伪推理”的答案往往具有极强的迷惑性。当模型输出洋洋洒洒、逻辑严密的推导时,用户很难识别出其中的“数据伪影”。法国国家科学研究中心的认知科学家对此警告称:“AI产出的‘糟糕想法’如果被包装得过于完美,反而比明显错误更危险,因为它不是在熵增中学习,而是在熵减中制造另一种无序。”
“会想”的路径在何方?
面对AI“答不对题”的困境,业界提出了两条改进路径。第一是引入“神经符号模型”(Neural-Symbolic),将深度学习的能力与符号逻辑的约束条件结合,强制AI在推理过程中附带可验证的数学或逻辑公式。第二是解释性AI的普及,即要求模型在输出最终答案前,提供“反事实推理”,即如果移除某个变量,答案会如何变化,以此迫使模型检验自己内部的因果联系。
归根结底,AI“答对”并不是终点。当我们高喊人工智能超越人类时,一个会“想错”但“答对”的机器,可能只是语言世界里的一个高级“模仿者”。在通往真正智能的道路上,我们需要AI不仅会“写答卷”,更要会“看题、审题和理解题意”。否则,我们终将在一连串漂亮的正确答案中,失去对真实逻辑的辨别力。这不仅是技术挑战,更是人类认知叙事的挑战——我们是否真的准备好,将命运交予一个“思考方式迥异于我们”的智能体?