GlobalSign 博客

AI 模型签名:一个大家即将以惨痛代价发现的安全问题

大多数团队至今仍将AI模型视为带有发布周期的超大附件。一个文件被下载、微调、复制到另一个环境、封装进应用程序,然后部署到生产环境。在这个过程中,大家不约而同地默认它仍是同一个模型,依然安全可靠。这种假设终将难以维系。

如今,AI 模型已深刻影响着审批、排名、推荐、警报、预测以及客户互动。它们不再是实验性的副项目,而是运营资产。然而,在许多工作流中,仍然缺乏有效的方法来证明模型的来源、是否经过修改,以及生产环境中运行的版本是否确实是通过了审核的版本。

模型已进入与软件数年前遭遇的同一风险区域

软件团队是通过惨痛的教训才领悟到这一点的。一旦攻击者意识到,他们无需直接破坏生产环境,而是可以通过篡改构建管道、依赖项或发布工件来达到目的,关于信任的整个讨论就发生了转变。代码签名因此成为解决方案的一部分,因为它为团队提供了一种证软件真实性及完整性的方法

如今,AI 模型也面临着非常类似的情况,只不过许多组织尚未调整其安全策略。在模型最终接触到用户之前,模型文件可能会流经记账文件、训练任务、存储桶、注册表、持续集成工作流、供应商交接环节以及部署系统。这是一条漫长的路径,其中存在大量导致模型漂移、混淆甚至被蓄意篡改的风险。 

更糟糕的是,模型的行为不像普通二进制文件或脚本那样容易检查。被调包的模型可能仍然能运行;被篡改的检查点可能仍会产生看似合理的输出;如果没有人专门检查细微的性能退化、偏见偏移、隐藏触发器或针对性操纵,被植入恶意代码的版本甚至可能通过简单的测试。这正是为什么在此情境下,盲目信任是一种极其危险的习惯。

真正的问题不在于存储,而在于来源 

许多团队认为,只要具备访问控制、加密存储和注册表,就意味着已经解决了模型安全问题。这些措施固然重要,但并不能彻底解决信任问题。锁好仓库并不意味着里面的物品就是真品,它只是证明能接触到它的人变少了。 

安全团队真正需要的是能够验证的溯源信息。该模型源自何处?是由哪次训练生成的?使用了哪个版本的数据集?由谁批准的?评估后是否经过修改?部署到生产环境中的模型是否与通过治理和测试的模型建立了加密关联?对于许多团队而言,要自信地回答这些问题仍然相当困难。

正因如此,模型签名开始不再仅仅被视为一项高级附加功能,而是更像一种基础控制措施。签名提供了一种将身份、完整性和信任与模型工件本身绑定在一起的方式。团队无需再依赖命名约定、内部信任或某人在 Slack 中的记忆,而是能够验证模型是否为已获批准的工件,并确保其在部署过程中未被悄然篡改。

为什么这在分布式人工智能环境中会迅速变得危险

一旦人工智能超出一个严格管控的团队范围,风险就会成倍增加。模型会在数据科学家、MLOps工程师、供应商、产品团队、云环境、边缘设备以及针对特定客户的部署之间共享。副本迅速扩散,细微差异随之出现,临时文件也变成了永久文件。六周后,没有人能完全确定哪个版本正在驱动哪个系统。

这种无序扩张恰恰为攻击者创造了理想条件。无论是被入侵的模型仓库、内部恶意人员、第三方提供的受污染数据,还是传输过程中被悄然篡改的构建产物,都可能造成下游损害。由于模型会直接影响决策和自动化操作,其影响范围绝非抽象概念。它可能波及欺诈检测、承保、内容审核、故障诊断、客户支持或内部风险评分等环节。 

安全问题背后还隐藏着一个治理问题。一旦监管机构、审计机构和企业采购方开始要求提供完整性证明和部署溯源信息,仅靠“我们追踪得相当仔细”这种说法就难以长期站得住脚。各团队将需要更有力的证据,以证明他们验证过的构建产物正是最终发布的版本,并且每个环境都能独立验证这一点,而不是事后仅凭书面文件来信任。

一旦出现首批重大失败,这种签约模式的弊端就会显而易见

安全措施往往看起来可有可无,直到有人因此遭受重创,才迫使大家将其视为常态。这种模式通常是这样的:先是追求速度,接着是规模扩张,随后是混乱,最后发生几起严重的事件,才让所有人都突然开始重视那些此前听起来有些过分的控制措施。 

因此,AI 模型签名几乎完全that pattern符合这一模式。一旦组织发现模型被篡改、未经授权的微调、未经验证的第三方构建产物,或是无法追溯到经批准版本的生产部署等真实案例,相关讨论将迅速发生转变。届时,模型签名将不再只是理论上的概念,而是显得为时已晚。 

最聪明的团队不会坐等那一刻的到来。他们会像成熟的软件团队对待发布工件那样对待模型:即需要具备可追溯的来源、加密完整性,以及贯穿整个交付路径的可验证信任。这种转变虽不能解决所有人工智能安全问题,但能弥补当前管道中最显而易见的漏洞之一。目前,仍有太多模型像那些声誉良好却身份不明的文件一样,在生产环境中流通。

结论

关于人工智能安全的讨论往往聚焦于提示词、数据泄露和运行时滥用。这些威胁固然重要,但还有另一个问题正悄然逼近。各团队在部署会影响实际决策的产出时,却缺乏有效的端到端真实性验证机制。

这一差距不会长期被忽视。一旦模型成为标准基础设施,信任就不能再取决于文件是从哪里找到的,或者是谁说它看起来没问题。它需要证据。

模型签名很快将不再被视为一种小众理念。它似乎正逐渐成为实验性人工智能与生产级信任之间缺失的那一环。


注:本文由客座作者撰写,旨在为读者提供更丰富多样的内容。本文所表达的观点仅代表作者本人,并不一定反映GlobalSign的立场。

近期博客