近日,一则来自Hacker News的帖子引发了AI社区和开源开发者的广泛关注。一位ID为“llama555”的开发者发布了一项实验性项目,标题为“Show HN: Distilling DeepSeek into GPT-OSS doesn't transfer censorship. Try it”,意为将DeepSeek模型的知识蒸馏到GPT-OSS开源模型中,成功规避了原始模型中的内容审查机制。这一发现迅速在技术圈发酵,不少研究者、模型微调爱好者以及AI伦理讨论者纷纷尝试,并展开热议。

蒸馏技术:提取“知识”,过滤“枷锁”

知识蒸馏(Knowledge Distillation)是深度学习中的一种常见技术,指通过一个大型、性能优越的“教师模型”训练一个更小、更高效的“学生模型”,让学生学习教师模型的输出分布,从而在保持较高性能的同时,降低计算成本和部署门槛。通常,学生模型会继承教师模型的“知识”,但这种继承并非机械复制,而是通过概率分布和软标签进行迁移。

然而,这次实验的特殊之处在于:教师模型DeepSeek是中文大语言模型领域备受关注的明星产品,其通用能力出色,但也被用户指出在涉及某些敏感话题时存在较为严格的内容过滤(即“审查机制”)。而学生模型GPT-OSS则是一个基于开源GPT架构、由社区维护的轻量级模型,本身不内置任何审查规则。

开发者“llama555”声称,通过特定的蒸馏流程,学生模型学到了DeepSeek的语义理解、对话能力和知识储备,却几乎完全绕过了教师模型中的内容过滤层。换句话说,蒸馏过程中的“知识”是可选的,而“审查”这种机制并未被学生模型继承。

技术细节:如何实现“无审查蒸馏”?

根据该帖子及配套的GitHub仓库说明,蒸馏过程主要分为三步:
1. 数据生成:使用DeepSeek模型对大量未标记的通用语料进行推理,获取其输出的logits(逻辑值)和最终回复。关键在于,数据采集时避免了触发审查机制的提示词,从而让DeepSeek在“正常”模式下产生回答。
2. 蒸馏训练:用这些带有软标签的数据微调GPT-OSS,使其输出分布尽可能接近DeepSeek。训练时忽略DeepSeek中“拒答”或“模板式回复”对应的样本,以保证学生模型不学习过滤逻辑。
3. 对比测试:使用包含敏感话题的提示词分别测试两个模型。结果显示,DeepSeek频繁返回“无法回答”或安全模板,而蒸馏后的GPT-OSS则流畅地给出了基于知识的内容,尽管有时准确率不高。

开发者强调,这一结果并非证明“蒸馏直接剥离了审查”,而是因为审查机制通常依赖额外的手工规则、分类器或后处理管道,这些并不直接体现在预训练模型的核心权重中。当仅有soft label被迁移时,审查行为自然无法复制。

社区反响:兴奋与争议并存

该帖子底下迅速积累了大量评论。赞同者认为这为“破解模型内容限制”提供了低成本、可复现的思路,尤其适合在学术研究、低风险场景下探索模型潜力。部分研究者指出,这一结论也间接证实了主流大模型(如DeepSeek)中的内容过滤很大程度上是“工程层”而非“模型层”的产物。

但也有评论表达了担忧:如果任何人都可以轻易蒸馏出一个“无审查版”模型,可能会被用于生成非法、有害或不当内容。此外,DeepSeek本身是遵循中国法律法规进行内容管理的模型,这种行为是否违反其使用条款?对此,开发者表示该项目仅供技术研究,不提供完整的模型权重下载,也未公开用于商业用途。

行业观察:知识蒸馏的“双刃剑”

这一事件折射出知识蒸馏技术在当前AI生态中的新挑战。传统上,蒸馏被视为“瘦身”和“加速”的工具,但如今它可能成为绕过内容治理的“后门”。对于模型提供方而言,如何在开放技术的同时保护自身的内容安全机制不被轻易剥离,将成为未来需要攻克的难题。

对于开源社区而言,这一发现也意味着:完全开源的模型可能在某些维度上比闭源模型更“自由”——只要存在足够好的教师模型,学生模型就可以择其善者而从之,其不善者而改之。当然,这背后涉及的版权、合规与伦理问题,远非一次实验所能盖棺定论。

截至目前,该项目的演示站点和代码仓库仍开放访问。感兴趣的开发者可自行尝试,在遵守当地法律的前提下,一窥“无审查蒸馏”的实际效果。而这场关于技术中立与责任边界的讨论,或许才刚刚开始。