近日,一项来自多个研究团队的联合调查揭示了一个困扰人工智能领域已久的隐秘痛点:当前主流嵌入模型(Embedding Models)在处理包含大量科学字符、数学符号、化学公式等特殊字符的文本时,表现出系统性失败——即使PDF文档经过最先进的解析技术处理,这些模型的语义表征能力依然会显著下降。这一发现引发了学术界和工业界的广泛关注,因为它直接关系到AI在科研辅助、文献检索、知识图谱构建等关键场景的应用可靠性。

问题暴露:从“能读”到“理解”的鸿沟

嵌入模型的核心任务是将文本转化为向量,以便计算机能够比较语义相似性、进行聚类或检索。近年来,以OpenAI的text-embedding-ada-002、Cohere的embed-english-v3、以及开源的BGE系列为代表的模型,在普通文本上表现优异,被广泛应用于RAG(检索增强生成)系统和企业知识管理。然而,当输入文本中出现诸如“α、β、γ”、“∑、∫、∂”、“H₂O、CH₃COOH”、“$$\frac{dx}{dy}$$”等科学字符时,模型输出的向量质量急剧下降。

研究人员设计了一个简单的测试:从arXiv论文库中抽取1000篇包含复杂数学公式的PDF,分别使用四种主流PDF解析工具(PyMuPDF、pdfplumber、Grobid、Marker)进行文本提取,然后将提取的文本送入六个不同嵌入模型计算相似度。结果显示,当文本中科学字符密度超过5%时,所有模型的语义相似度评分与人工判断的相关性系数跌至0.3以下,而普通文本通常可达0.85以上。更令人担忧的是,无论采用何种解析策略——包括基于OCR的精确字符识别、保留LaTeX源码、或使用Unicode数学符号——嵌入模型的表征能力均未出现显著改善。

失败根源:分词器与训练数据双重短板

深入分析发现,问题根源于两个层面。首先是分词器(Tokenizer)的局限性。当前大多数嵌入模型基于子词分词(如BPE或WordPiece),对于连续出现的特殊符号组合,分词器常常生成罕见的、甚至从未在训练语料中出现过的token。例如,数学公式“∂f/∂x”可能被切分成“∂”、“f”、“/”、“∂”、“x”五个独立token,然而“∂”这个字符在预训练语料中的出现频率极低,导致模型没有为其学习到有意义的上下文表征。更糟糕的是,某些PDF解析器会将下标、上标转换为Unicode控制字符,进一步混淆分词器,产生大量“未知”token。

其次是训练数据偏差。这些嵌入模型的主要训练语料来自Common Crawl、维基百科、书籍等,其中科学公式的占比极小(通常不到0.1%)。即便模型在训练中见过一些公式,它们大多以LaTeX源码的形式出现(如“\alpha”),而非渲染后的Unicode符号。当输入变成“α”时,模型无法将其与“alpha”建立联系。研究团队通过对比实验发现,若将科学字符全部替换为对应的英文单词(如将“α”替换为“alpha”),嵌入模型的性能几乎恢复到正常水平,这侧面印证了神经网络的“符号盲区”是后天训练不足的产物。

连锁反应:科研场景的AI应用面临信任危机

这一问题的影响远超学术讨论。在科研文献检索领域,用户若是搜索“卷积神经网络中的激活函数”,系统可能因为无法正确表征“ReLU、Sigmoid、tanh”等函数符号而漏掉关键论文。在药物分子发现中,化学式“C6H12O6”与“C6H12O5”仅一个原子之差,但嵌入模型可能将两者视为相同,导致检索专利时出现严重混淆。更危险的场景出现在代码生成辅助工具中,当开发者使用RAG系统参考数学库文档时,模型对“np.einsum”、“scipy.special.gamma”等符号的理解偏差可能引入隐蔽的错误。

目前,已有几家大型AI公司开始内部测试针对科学文本的嵌入模型优化方案,包括:在预训练阶段引入更多LaTeX源码和科学论文数据;设计专门的分词器以保留数学符号的语义结构;以及开发“符号规范化”预处理器,将Unicode符号统一映射为语义等价的文本描述。但研究人员指出,这些方案仅是权宜之计——真正解决问题需要从模型架构层面重新思考离散符号与连续向量空间的映射关系。

未来展望:科学智能需要专属“语言”

“嵌入模型的失败,本质上是语言模型对符号逻辑世界理解不足的缩影。”该研究的主要负责人、来自麻省理工学院计算机科学实验室的Zhou教授表示。“我们或许需要为科学文本构建独立的嵌入生态系统,就像生物信息学领域有专门的序列比对工具一样。”目前,一个名为“SciEmbed”的开放合作项目已经启动,旨在收集超过500万篇包含完整数学公式的论文,并训练一个专为科学字符优化的嵌入模型基线。与此同时,学术界也在探索结合符号计算与神经网络的混合方法,让模型能够像人类一样“看懂”公式背后的代数结构。

对于正在使用AI工具进行科研工作的个人和团队,研究者的建议是:不要完全依赖通用嵌入模型处理专业文档。在构建科研知识库时,建议先将公式区域单独处理——比如使用MathML或LaTeX字符串替代渲染后的符号,或者利用专门的数学表达式检索系统(如arXiv的公式搜索引擎)作为互补手段。毕竟,当AI在数学符号面前“失语”时,人类科学家的严谨判断依然是不可替代的最后防线。

(全文约980字)