近日,人工智能领域两大明星企业OpenAI与Hugging Face联合发布声明,确认双方在协作进行大语言模型联合评估过程中发现了一起安全事件。该事件涉及评估平台的一个底层漏洞,可能导致部分测试数据集和模型输出信息在特定条件下被未经授权的第三方访问。目前,两家公司已迅速启动应急响应机制,完成了漏洞修复,并正在配合专业安全团队进行溯源调查。

据了解,此次事件发生在双方共同推进的“模型安全基准评估”项目中。该项目旨在通过标准化测试流程,客观评估不同大语言模型在对抗性输入、隐私泄露、偏见抑制等维度的表现。然而,就在评估进入关键阶段时,技术人员发现评估平台的数据隔离机制存在异常——部分非公开的评估指标、参考答案以及少量模型推理日志,在特定请求组合下可能被外部接口读取。OpenAI与Hugging Face在第一时间切断了涉及该漏洞的访问通道,并暂时停止了相关评估工作。

“我们高度重视此次发现。虽然目前没有证据表明有恶意行为者利用了该漏洞,但本着对社区和用户负责的态度,我们选择公开这一事件。”OpenAI安全团队负责人在一份内部备忘录中表示。Hugging Face方面则补充说,受影响的评估数据集均不包含任何真实用户个人信息或商业敏感数据,且所有泄露风险仅限于测试环境。

截至发稿时,双方已联合发布技术细节公告,详细说明漏洞原理、影响范围以及修补方案。公告指出,该漏洞源于第三方协作平台的一个权限配置缺陷,并非模型本身的安全问题。OpenAI和Hugging Face均表示,将加强跨平台安全审计流程,并计划引入第三方渗透测试机构定期评估联合基础设施的安全性。

业界对此反应强烈。多位AI安全专家指出,随着大模型评估逐渐从学术机构走向产业联合体,平台层面的攻击面正在扩大。“评估本身就是为了发现模型的漏洞,但如果评估过程自身的安全性得不到保障,就可能出现‘监管漏洞大于模型漏洞’的悖论。”斯坦福大学人工智能安全研究员张明(化名)评论道。他同时提醒,开源社区在协作评估时应格外注意数据隔离与访问控制。

值得注意的是,此次事件也凸显了AI行业日益增长的“供应链安全”需求。OpenAI与Hugging Face的合作模式——一方提供核心模型、一方提供评估基础设施——代表了一种典型的AI生态协作。但若协作平台的任何一个环节出现纰漏,都可能引发连锁反应。有分析认为,行业有必要建立统一的评估安全标准,并鼓励参与者采用“最小权限原则”和“零信任架构”。

目前,双方已经恢复了部分评估工作,并承诺在未来30天内向社区发布完整的事件复盘报告。OpenAI在其官方博客中表示,将以此为契机,与Hugging Face共同推动“透明化安全披露”成为行业惯例。Hugging Face联合创始人则强调:“安全不是一次性的行动,而是需要融入每一步设计、每一次迭代中的文化。”

对于广大开发者和依赖大模型的企业而言,这一事件无疑敲响了警钟:在追求模型能力的“上限”时,绝不能忽视系统安全的“底线”。唯有将安全视为AI发展的基石,才能使技术真正走向可靠、可信的未来。