近日,人工智能安全初创公司Anthropic公开回应了行业内流传的一则说法——该公司曾主张全面封禁开放权重人工智能模型。Anthropic明确表示,其从未倡导过这样的禁令,但同时也强调了自身在AI安全与开源平衡问题上的独特立场。
这一澄清源自公司首席执行官达里奥·阿莫代伊(Dario Amodei)在一场内部研讨及后续媒体沟通中的表态。阿莫代伊指出,外界某些评论误读了Anthropic的政策倾向。“我们从未主张政府或行业全面禁止公开模型权重,这种做法既不现实,也可能扼杀创新。”他同时坦言,Anthropic并不认同“开放权重模型本身更便于搭建AI安全防护机制”这一流行观点。
开放权重的安全悖论
近年来,随着Meta开源Llama系列模型、Mistral AI等企业推出开放权重模型,业界围绕“开源是否等于更安全”的争论愈演愈烈。支持者认为,透明公开的权重可以让全球研究者共同审查漏洞、训练防范机制,从而提升整体安全性。但阿莫代伊提出了不同看法:“开放权重使得移除模型中已有的安全对齐机制变得更容易。恶意行为者可以微调模型去除防护,而无需从头训练。”他认为,如果安全防护仅依赖于模型的初始训练过程,那么一旦权重公开,这些防护就可能被轻易绕过。
Anthropic的担忧并非空穴来风。已有研究显示,一些开源模型的安全层在微调后可以迅速失效,甚至被用于生成有害内容或制造生物武器。这种“可编辑性”在带来灵活性的同时,也构成了新的治理挑战。
平衡之道:并非非黑即白
Anthropic自成立以来,一直以“安全优先”著称,其开发的Claude系列模型在行业中以强安全性著称。但值得注意的是,Anthropic并未像OpenAI那样完全封闭模型,而是选择有选择地开放部分技术细节,并倡导“分级权重发布”——即根据模型的风险等级决定是否公开权重,配合严格的访问控制和审查机制。
阿莫代伊特别澄清:“我们反对的不是开源本身,而是‘开放权重必然带来安全’的简单化逻辑。”他提议,行业应建立更细致的风险评估框架,对不同能力级别的模型采取差异化的发布策略。例如,对具有极高潜在危害的模型(如可能直接辅助开发大规模杀伤工具的系统),在公开权重前需要进行额外审查;而对风险较低的模型,则可以继续沿用开源文化。
行业持续博弈:共识尚未达成
Anthropic的表态将AI行业由来已久的分歧再次推至台前。一方面,以Meta、Mistral AI为代表的企业强调开源生态对技术民主化和创新的核心价值,认为封闭会强化少数巨头的垄断,反而不利于安全研究的开展。另一方面,OpenAI、DeepMind等公司则倾向于控制模型访问权限,主张通过API接口提供服务以保留安全上的干预能力。
值得关注的是,美国白宫、欧盟AI法案等政策制定者正试图在两者间寻找平衡点。一些专家提出,可以引入“安全泄露审查”机制——在开放权重前由独立第三方验证模型的安全稳定性;另有人主张建立行业自律公约,限制高能力模型的滥用风险。
安全与创新:没有一劳永逸的答案
Anthropic的此次回应,本质上是向行业传递一个更复杂的信号:安全与开放并非零和博弈,但也绝不能混为一谈。正如阿莫代伊所言,“我们需要更聪明、更细腻的规则,而不是简单的‘禁止’或‘放任’。”
当前,AI技术正以前所未有的速度渗透各行各业,从医疗诊断到金融决策,从内容生成到科学研究。如何让这些强大工具既惠及大众,又不沦为失控的风险源,已经成为整个人类社会必须共同面对的一道难题。Anthropic的立场虽未提供终极解决方案,却提醒业界:在呼吁开放的同时,不能回避安全治理的具体挑战。未来的平衡,或许不在于选择一个极端,而在于构建能随技术演进动态调整的监管框架与行业标准。