AI推理痕迹如何被提取:两阶段蒸馏与API隔离案例研究

AI模型蒸馏一直是LLM行业中最敏感的话题之一。当一个新模型突然变得强大许多,或者其回答开始类似于某种行为时,

发布于 2026年8月14日generalGEO 评分: 011 次阅读
图片以深蓝色背景呈现,左侧大字“推理痕迹”下方标注“蒸馏与API风险”。右侧展示了从教师模型到学生模型的推理过程,包含“教师模型”“中间模型”“学生模型”三个模型节点,箭头指示推理步骤。右侧还有一个带有锁的盾牌图标,下方标注“API端点”,并有红色感叹号标志。该图与文档中介绍AI推理痕迹提取、模型蒸馏及API安全风险的内容相呼应,直观呈现了相关概念。

AI推理轨迹如何被提取:一个两步蒸馏与API安全案例研究

引言

AI模型蒸馏一直是LLM行业中最敏感的话题之一。当一个新模型突然变得强大许多,或者其回答开始呈现出领先模型的行为特征时,研究人员自然会质疑是否存在某种形式的知识或推理转移。

最近一篇116页的研究论文为这一讨论带来了不同类型的证据。研究人员报告称,在特定API工作流中暴露的隐藏推理状态,在他们研究的条件下,可以借助另一个模型被恢复。同一项研究还提出了更广泛的安全关切:如果推理轨迹和智能体行为路径在存储、共享或重放时没有足够严格的隔离,它们可能包含敏感信息。

这些发现应被视为一项研究成果,而非对AI蒸馏的最终定论。作者并未声称模型之间的每一个相似性都证明了蒸馏的存在。相反,他们的实验提供了关于推理轨迹如何被转移、重现和暴露的新证据。

通过两次API调用揭开Opus推理过程的面纱

来自MATS Research、ELLIS Institute Tübingen等机构的研究人员调查了通常隐藏在API背后的推理是否可以被恢复。

所报告的实验设置使用了一个较强的模型来生成推理状态,并使用同一模型家族中较小的模型来解释推理状态。在来源文章描述的示例中,Opus 4.8生成推理,而Haiku 4.5被用来暴露隐藏的推理过程。

同样的总体思路也被报告应用于其他模型生态系统,包括OpenAI和Google的模型。关键点不在于较小的模型天生就能读取所有较强模型的内部状态,而在于共享的API基础设施和兼容的推理状态格式可能创造出意想不到的交互界面。

来源文章中描述的过程出奇地简单。

第一步:让较强的模型解决问题

第一个请求让Opus 4.8解决一个问题,例如找出8,139,881的最大质因数。

根据来源文章,API响应包含两条相关信息:一个经过处理的推理摘要和一个看起来不可读的长字符串。文章将后者识别为模型完整思维链的加密表示。

第二步:将推理块重放给另一个模型

所报告的攻击随后将该加密块放入一个新的请求中,并将模型切换为Claude Haiku 4.5。

提示词要求较小的模型继续并在<thinking-copy>标签内重现与提供的状态相关联的推理。

根据所报告的实验,Haiku能够重现隐藏的推理过程。据称恢复的轨迹包括试除法、排除、因式分解和验证等操作。

所报告的token数量也令人震惊。来源文章称,提取出的数量

推理令牌的数量接近于API实际计费的思考令牌数量,这表明恢复的材料不仅仅是一个简短的摘要。

为什么较小的模型能够读取较强模型的隐藏状态?

这是核心的技术问题。

推理模型通常需要执行多步骤的工作。在代理型任务中,模型可能搜索网络、执行代码、调用工具、检查结果,然后从所得状态继续推理。

该状态必须在API调用之间得以保留。

一种可能的架构是将状态保存在客户端,而不是将所有内容存储在提供商的服务器上。模型的推理状态可以打包成一个加密块,返回给客户端,然后在后续请求中再次提供。服务器可以解密该块,使模型能够从停止处继续。

这种设计可以减少服务器端的存储需求,并支持注重隐私的工作流程。但它也创建了一个必须谨慎实施的安全边界。

所报告的问题是,加密的推理块并不总是与其原始上下文充分绑定。在研究人员研究的条件下,这产生了三种形式的互操作性:

  1. **跨会话:**来自先前会话的推理块可以复用到新会话中。
  2. **跨用户:**公开暴露的推理块可以被另一个用户提交。
  3. **跨模型:**由较强模型生成的推理块可以被同一提供商的其他模型处理。

这些行为可能有合理的工程动机。模型切换、回退系统、上下文压缩和长时间运行的代理工作流都受益于可复用的状态。

问题在于,如果状态未严格限定于原始用户、会话、模型和授权上下文,同样的互操作性可能成为攻击面。

低成本解码器可以改变经济性

另一个重要发现涉及成本。

源文章估计,根据引用的Haiku 4.5 API定价假设,当每个轨迹大约包含12,000个输入和输出令牌时,解码10,000条推理轨迹的名义成本约为720美元。

这改变了推理轨迹提取的经济性。如果昂贵的模型仅用于生成原始状态,而较便宜的模型执行解码,那么需要昂贵访问前沿模型的攻击可能会变得更加实用。

这对模型提供商尤其重要,因为推理轨迹可以代表推理过程中创造的价值的重要部分。如果这些轨迹可以在其预期边界之外被恢复和复用,它们可能成为模型知识产权泄露的一种新形式。

蒸馏之谜获得首批证据

一旦研究人员获得了更完整的推理轨迹,他们便利用这些轨迹来探究一个更广泛的问题:模型特有的推理模式能否揭示蒸馏的证据?

研究人员进行了两个实验。

实验1:重现连续的推理令牌

在第一个实验中,研究人员选择了

来自Opus推理轨迹的连续16个标记,并让多个模型继续解决同一问题。

思路很简单:如果一个模型能够比另一个模型更容易地重现完全相同的续文,这可能表明它学到了与源模型推理模式异常接近的东西。

报道的差异很大。

一个模型理论上需要大约100亿次尝试才能偶然重现所选的Opus短语。另外两个模型估计分别需要大约100万亿次和1000万亿次尝试。

换句话说,在报道的对比中,一个模型重现相同Opus推理模式的容易程度比替代模型高出约一百万倍。

实验二:仅注入推理开头

第二个实验只向另一个模型提供Opus推理轨迹的开头,然后观察其响应如何发展。

在一个例子中,只提供了五个标记。

据报道,即使如此少量的信息也使得目标模型的措辞、答案和问题解决节奏向Opus轨迹偏移。报道的相似度得分从0.17上升到0.33。

研究人员随后将测试扩展到30个问题。根据来源文章,其中29个问题显示出相同的总体效果:给模型一个Opus风格的起点会使后续响应比使用另一个模型的起点时更像Opus。

这能证明蒸馏吗?

仅凭这一点还不够。

来源文章强调,研究人员并未宣布蒸馏问题已解决。输出或推理模式的相似性是值得调查的证据,但不能自动证明一个模型直接基于另一个模型的私有推理数据进行训练。

这些实验提供的是一种更具体的方式来研究模型特有的推理特征,因为现在可以分析更长的推理轨迹。

GitHub和公共代理轨迹造成另一个安全问题

这个问题不仅限于模型公司。

据报道,研究人员从GitHub和Hugging Face收集了6708条公开可用的代理轨迹,并重建了315320个推理块。

在这些轨迹中,328条包含至少一个敏感项,约占收集轨迹的4.9%。

来源文章报道研究人员发现:

  • 62个API密钥
  • 33个密码
  • 24个访问令牌
  • 7个私钥
  • 30个个人电子邮件地址
  • 130个个人姓名
  • 36个邮政地址

这是对构建代理系统的开发者的实际警告。

一条轨迹可能看起来像普通的调试输出,但它可能包含工具参数、环境变量、凭据、个人信息、内部URL或其他绝不应成为公共训练集或存储库一部分的数据。

如果代理轨迹将被记录、共享或发布,开发者应将其视为潜在敏感数据,而不是普通应用程序日志。

常见问题

什么是AI推理轨迹?

AI推理轨迹是模型工作过程中生成的中间状态或与推理相关的输出。

通过任务。根据API设计的不同,用户可能会收到摘要、结构化推理状态或加密表示,而不是模型的原始内部计算。

什么是AI模型蒸馏?

模型蒸馏是一种让较小或不同的模型从较大或较强模型的行为中学习的技术。它被广泛用于将有用的能力迁移到运行成本更低或速度更快的模型中。

恢复推理轨迹能否证明模型经过了蒸馏?

不能。恢复推理轨迹可以提供模型相似性的证据,但它本身并不能确定模型是如何训练的。要做出更有力的归因,需要训练数据来源、受控实验和其他证据。

为什么加密的推理状态会成为安全风险?

加密保护了状态块的内容,但它并不能自动保证该状态块绑定到正确的用户、会话、模型或授权上下文。如果这些边界较弱,有效的加密状态可能会被重放到非预期的上下文中。

为什么代理轨迹是敏感的?

代理轨迹可能包含工具调用、提示词、环境变量、API凭据、个人数据、内部文件路径以及执行过程中收集的其他信息。因此,如果没有经过适当的清理就发布它们,即使原始应用程序看起来无害,也可能暴露机密信息。

开发者应该在GitHub上发布原始AI代理轨迹吗?

除非经过仔细审查和清理,否则应避免发布原始轨迹。在共享轨迹之前,应移除机密信息、令牌、凭据、个人信息、私有URL和专有数据。

较小的模型总是能够解码较大模型的推理吗?

不是。报告的结果取决于具体的API行为、模型系列、推理状态格式和实验条件。这不应被解读为一种普遍规律,即较小模型总能恢复较大模型的推理。

相关工具

相关链接

Face](https://huggingface.co/):源文章引用的模型和数据集中心。

摘要

所报告的研究突显了人工智能推理状态周围一个微妙但重要的安全边界。如果推理块可以在没有严格授权绑定的情况下跨会话、用户或模型重放,那么一个旨在支持高效状态管理的功能就可能变成意想不到的提取通道。

这项研究还提供了一种新方法,通过检查更长的推理轨迹而非仅依赖最终答案,来调查模型相似性和可能的蒸馏(distillation)。同时,这些发现并不是对任何特定模型是否通过未经授权的蒸馏进行训练的最终定论。

对于开发者来说,最直接的教训是实用的:将推理状态和代理轨迹视为敏感数据,并在存储或共享前严格执行身份、会话、模型和访问边界的绑定。

AI推理痕迹如何被提取:两阶段蒸馏与API隔离案例研究