一、蒸馏的原罪:它搬走的不是知识,是"花掉的推理算力"
先把知识蒸馏(Knowledge Distillation, KD)的经典形式摆出来。原始的 KD 目标函数长这样:
L = α · <span>CE</span>(y_true, ŷ_student) + (<span>1</span> − α) · <span>KL</span>( p_teacher(T) ‖ <span>p_student</span>(T) )
└─ 硬标签:学"答案对不对" └─ 软标签:学"老师的概率分布长什么样"
关键在右半边。老师模型输出的完整概率分布(而不仅是 top-1 token)携带了远比最终答案丰富的信息——它告诉学生"老师在这几个选项之间是怎么权衡的"。这就是为什么软标签比硬标签有效,也是为什么只要你能看到输出,你就拿走了一部分模型。
但 2026 年这场游戏已经不是这个玩法了。蒸馏大致经历了三代:
| 代际 | 偷什么 | 训练信号 | 代表 |
|---|---|---|---|
| **第一代:输出模仿** | 最终答案 | (prompt, response) 做 SFT | Alpaca、Self-Instruct 一类公开做法 |
| **第二代:偏好蒸馏** | 好坏排序 | 用老师当奖励模型给学生的多个候选打分 | 类似 RLHF / RLAIF 的变体 |
| **第三代:推理轨迹蒸馏** | **思维链本身** | (prompt, CoT, answer) 三元组做 SFT | 本次报告描述的多起攻击 |
一句话点破这三代的区别:第一代偷"答案",第三代偷"怎么想"。
为什么这个区别是决定性的?因为思维链是测试时算力(test-time compute)的载体。前沿模型之所以强,很大程度上是因为它在作答前会花几千个 token 做推理——那部分是在推理时现花掉的真实算力。
所以第三代蒸馏的本质是:
老师侧真实成本: 预训练算力 + 每次推理时花掉的 CoT 算力
<span> │
│ 一次 API 调用
▼
攻击者侧成本: 一次 API 调用的费用(搬运)
</span>
训练时花掉的成本要用训练成本补,推理时花掉的成本可以用 API 费买。 攻击者把老师每次推理烧掉的算力,以单次调用的价格搬回自己家——这才是这场攻击在技术上真正新颖的地方,也是为什么 Anthropic 的所有新防御都针对推理轨迹而不是最终输出。
二、攻击是怎么组织的:四个可复用的工程手法
把报告披露的技术细节拆开,有四块是可以被任何人复用的基建。我是从防御角度列这些的——你不知道攻击长什么样,就设计不出检测规则。
手法 1:强制内联推理(forced inline reasoning)
被归为 GTG-16005 的那起攻击,做法是在每一个请求里注入一段固定 prompt,强迫 Claude 把推理过程写在最终答案之前的内联文本标签里,然后把保存下来的 transcript 转成监督微调(SFT)数据。目标明确指向 Opus 4.6 与 4.7 的思维链,产出的数据据称用于训练 Qwen 3.5、3.6、3.7。
这一手为什么有效? 因为它绕开了"输出和推理分离"的设计。如果模型默认只给你最终答案,你就只能做第一代蒸馏;一旦你能让它在答案里顺便写出推理,你就升级到了第三代——而用的还是同一个公开 API。
手法 2:账号池与切换
报告描述攻击者运营了两个账号池。第一个池约 5000 个欺诈账号,用住宅代理(residential proxy)、一次性邮箱和虚拟卡隐藏来源;被封禁后,流量立即切到第二个池。
这里有一个值得注意的细节:同一个代理服务网络同时也在为另外几家机构转发请求。这意味着"按来源聚合"的检测策略,在最基础的假设上就是错的——同一个 IP 段后面可能坐着多家互不相关的组织。
手法 3:跨会话重放攻击(cross-session replay attack)—— 最关键的一手
这是整份报告里最精巧的技术点。先说 Anthropic 原本的防御:
【正常路径】
用户请求 → Claude 生成推理 → API 返回一个「thinking signature」(引用句柄)
<span> │
└─ 后续调用时,API 用这个签名查回原始推理轨迹
→ 抓到的单次响应里没有原始 CoT,无法直接重放
</span>
这个设计的意图很清楚:让"单次截获的 API 响应"不足以还原推理过程。
攻击者是这样破的:
【重放路径】
① 会话 <span>A</span>:拿到响应里的 thinking signature
② 另开会话 <span>B</span>(新会话,没有 <span>A</span> 的上下文)
③ 把这段 signature 塞进新会话的 prompt,要求 Claude 把它「还原成完整推理过程」
④ 拿到完整 CoT → 存为 SFT 数据
注意这个攻击的结构性特点:它没有破解任何密码,它只是利用了"模型能读懂自己生成的句柄"这个能力。 只要系统里存在一个"能把签名展开成推理"的功能路径,且攻击者能在新会话里触发它,句柄隔离就失效了。
这一类漏洞的通用形态值得记住:凡是为了方便而保留的"回译通道"(signature → 原文、ID → 内容、摘要 → 全文),都是一个潜在的提取入口。 不只在 LLM,在任何系统里都是。
手法 4:冒充(impersonation)—— 比蒸馏更严重的一类
报告称,Moonshot(GTG-16002)没有用自家的 Kimi 处理客户请求,而是把请求转发给 Claude,再把 Claude 的回答展示给用户,其中一个 10 天窗口内约 30 万次请求,多数指向 Opus,使用的代理网络有 5380 个欺诈账号(据报主要落在新加坡和日本)。DeepSeek(GTG-16001)被指使用了几乎相同的策略。
这在性质上和蒸馏是两回事。 蒸馏伤害的是模型厂商;冒充伤害的是这些厂商自己的客户——用户以为自己在用 A 家的产品,实际数据被实时送到了 B 家的基础设施上,且很可能没有被告知。报告列举了几个被这样转发出去的敏感内容类别,包括企业内部文档、有效凭证和特定系统的设计规格。
其余几家在报告中的手法也各不相同:小米被指保存自家模型的用户对话再重发给 Claude(20 天内 40 万次以上请求);商汤被指从第三方数据贩子处购买用户与 Claude 的对话;MiniMax 被指通过空壳公司建立代理服务,该服务只提供 Anthropic 和 OpenAI 的模型、不提供任何本国模型——报告据此推断其目的就是收集用户与前沿模型的对话。
三、成本账:为什么这件事在经济学上必然发生
先把流传最广的那一组数字摆出来,并明确标注它的可信度:
| 项 | 流传的估计 | 可信度 |
|---|---|---|
| 前沿模型训练成本 | 25 亿–50 亿美元 | 区间估计,口径差异大 |
| 一次完整蒸馏攻击的 API 成本 | 8 万–15 万美元 | **多为二手转述,未见一手证据** |
| 能力保留比例 | 80%–95% | **同上,且与下文的一手实验结论冲突** |
| 典型查询量 | 1000 万–5000 万次 | 与本次报告的量级(单家 >1.51 亿次)可以互相印证 |
我是带着怀疑态度列这张表的。 那句"8 万美元拿 94% 能力"在中文和英文的二手转载里到处都是,但我没有找到能支撑它的一手论文或厂商披露。而且——唯一一篇有严格对照实验的公开学术结果,结论恰恰相反。
反面证据:Gudibande et al., arXiv:2305.15717
这篇论文(《The False Promise of Imitating Proprietary LLMs》,UC Berkeley)做的事很直接:用 1.5B 到 13B 的基座模型,喂 0.3M 到 150M token 的模仿数据,然后用众包人工评分 + 针对性自动评测双轨评估。
结果分两半:
- 人工评分:模仿模型看起来好得惊人,众包评审认为其输出可与 ChatGPT 竞争。
- 针对性自动评测:在那些模仿数据没有充分覆盖的任务上,模仿模型几乎没有缩小与老师的差距。论文的原话是,这些模型"擅长模仿 ChatGPT 的风格,但不模仿它的真实性"(adept at mimicking style but not factuality)。
更关键的是下面这组数据(13B 规模,随着模仿数据量增加):
| 模仿数据量 | 老师 | 学生基座 | 模仿模型 |
|---|---|---|---|
| 25M token | 31 | 25 | **20** |
| 50M token | 31 | 25 | **19** |
| 75M token | 31 | 25 | **18** |
| 100M token | 31 | 25 | **16** |
读一遍最后三列:模仿模型的得分不但没有逼近老师(31),反而低于它自己的基座(25),而且随着模仿数据从 25M 增到 100M token,分数一路往下掉。
这两组矛盾的说法怎么调和?
我的读法是这样的,这也是本文的核心判断之一:
- 第一代蒸馏(偷答案)确实收效有限。 Gudibande 的负面结果主要适用于这种形态——你拿到的是表层风格,不是能力。那句"8 万美元拿 94%"大概率是把人工评分当成了能力指标。
- 第三代蒸馏(偷推理轨迹)是另一回事。 思维链提供了远比最终答案密集的监督信号——它显式地展示了搜索路径、错误修正和中间结论。目前没有公开的对照实验测量这一形态的能力迁移率,而 Anthropic 报告的措辞("最大的一次蒸馏攻击"、"用于训练下一代模型")暗示厂商自己的评估是认真的。
- 所以真正的问题不是"蒸馏有没有用",而是"我们不知道它有多有用"。 攻击方有数据,防守方有数据,公开研究没有。这个信息不对称本身就是风险。
对工程实践的含义: 不要把"蒸馏无用论"当成不设防的借口,也不要把"1% 成本复制前沿模型"当成恐慌的理由。唯一诚实的立场是:迁移效率未知,因此防御的投入应该按"窃取成本"而不是"窃取收益"来算。
四、理想丰满,现实骨感:五个工程死结
死结 1:API 访问悖论——攻击面就是商业模式本身
每一家商业前沿模型都需要开 API 来赚钱和建生态;而每一次 API 调用都是一个潜在的蒸馏向量。这不是配置错误,是结构性的。
速率限制为什么不够?因为攻击是分布在账号维度而不是连接维度上的。一个有 24000 个账号的攻击者,每个账号都稳稳待在限额以内,聚合起来照样是千万次量级。你限制的是"单个账号多快",攻击者优化的是"账号有多少"。
死结 2:输出水印是可以被洗掉的
主流方案是在输出里嵌入可检测的统计特征;如果这些输出后来被用于训练学生模型,水印会残留下来,作为取证的指纹。
问题在于:水印对抗的是"直接照搬",而攻击者有充足动机做一次清洗。 把数据过一遍乃至几遍清洗模型(重写、释义、再生成),统计特征就会被稀释。而水印强度又不能太高——它会同时降低合法用户拿到的输出质量。这是一道纯粹的权衡题,没有免费午餐。
死结 3:输出扰动是双刃剑
另一条路是给输出的概率分布注入不可感知的噪声,让学生模型学到略微错误的决策边界。据媒体报道的某厂商内部测试,启用该类扰动后蒸馏成功率从 94% 降到 67%(该数字来自媒体报道,未见公开论文佐证,此处按"据报道"处理)。
即使这个数字属实,代价也很清楚:你在主动污染所有合法用户看到的分布。 对一个卖 API 的公司来说,这是拿产品体验换知识产权保护,而且换来的只是"降低成功率",不是"阻止"。
死结 4:开放权重面前,以上全部失效
这是最硬的一条,也是最容易被忽略的。
所有基于输出层的技术防护(水印、扰动、签名、摘要化、速率限制),保护的对象都是"黑盒 API"。一旦权重放出去,这些防护一项都不成立——攻击者可以在本地无限量、无成本地前向推理,甚至直接读权重。
这条约束决定了一件事:开放权重策略与蒸馏防护在根本上是互斥的。 一家同时做开放权重和抱怨被蒸馏的公司,它的抱怨对象只能是"用我的 API 而不遵守 ToS 的人",不可能是"蒸馏"本身。
死结 5:防护的成本会转嫁到合法用户身上
看 Anthropic 实际做的三件事:
| 措施 | 保护什么 | 谁付代价 |
|---|---|---|
| 默认对内部推理做**摘要化**再输出 | 让偷到的 transcript 训练价值下降 | **所有合法用户**(拿到的推理信息变少) |
| Fable 5.1 引入 "preserved thinking" 阻断跨会话重放 | 直接封堵本次被利用的回译通道 | 需要该能力的用户要换型号 |
| 对不支持国家的账号**强制身份验证**,否则失去访问 | 抬高欺诈账号的运营成本 | 相关地区的合规用户 |
三条措施全部有效,但三条的成本都有一部分落在了没有违规的用户头上。这是反滥用工程的普遍规律:你无法只惩罚攻击者,因为你无法完美区分攻击者和用户。
附带一条:法律真空
- 服务条款跨境不可执行。 对一家通过数千个欺诈账号操作、且位于不同法域的机构,民事诉讼几乎没有实际约束力。
- 商业秘密法对"输出"的定性未定。 权重显然属于专有资产,但"模型对用户 prompt 生成的回答"处于灰色地带。
- 出口管制不覆盖 API 输出。 现行管制针对硬件(GPU),以及可能的权重;通过 API 交互转移的"知识"不在清单上。报告所描述的活动,钻的正是这个空子。
五、解法:分层防护,以及你作为使用方能做什么
5.1 模型厂商侧:五层的真实有效性
| 层 | 手段 | 有效性 | 主要代价 |
|---|---|---|---|
| **权重层** | 不开放权重 / 分级开放 | **唯一接近彻底的手段** | 放弃生态与开发者心智 |
| **输出层** | 水印、分布扰动、推理摘要化、preserved thinking | 中(抬高成本,不能阻止) | 污染合法用户体验 |
| **账号层** | 欺诈账号识别、住宅代理检测、虚拟卡识别、身份验证 | 中高(直接打击本报告的攻击基建) | 合规用户的摩擦 |
| **流量层** | 跨账号聚合分析、prompt 相似度聚类、请求节奏指纹 | 中(本报告显示同网段可能服务多家机构,归因困难) | 误伤正常批量用户 |
| **法律层** | ToS、跨境诉讼、推动出口管制覆盖输出 | 目前**低** | 大量时间与政治成本 |
看这张表会得出一个不讨喜但诚实的结论:只有第一层是决定性的,其余都是抬高成本。 所以理性的目标不是"阻止蒸馏",而是把窃取成本抬高到不划算——这是一个经济目标,不是一个技术目标。
5.2 使用方侧:一份可以立刻执行的自查清单
如果你是买 AI 服务的那一方,报告里"冒充"这一类行为给你带来的风险比蒸馏本身更直接。以下是可执行的四条:
① 探针测试:你的供应商有没有在转路由?
做法不复杂——构造一组带唯一标记的 prompt,观察响应是否具备目标模型的特征:
探针 1(身份诱导):用几种措辞问"你是哪个模型",比对不同时间的回答一致性
探针 2(指纹比对):同一 prompt 分别发给供应商和疑似目标模型,比较
<span> -</span> 输出的结构特征(分段方式、列举习惯、语气)
<span> -</span> 罕见 token 的分布
<span> -</span> 对同一事实性问题的具体措辞
探针 3(延迟特征):跨洋转路由会引入额外的固定延迟,
<span> 观察 p50 / p99 延迟的绝对值和分布形状
探针 4(错误特征):请求一个明确超出范围的输入,比较拒绝话术的措辞
</span>
② 数据出境的实际路径写进合同。 不要接受"数据不出境"这种笼统承诺,要求写明处理请求的模型部署区域,以及是否允许第三方模型参与处理。
③ 审计 ToS 里的"训练使用"条款。 很多服务商保留用你的数据改进模型的权利;你要确认的是这个权利是否被授予给了再下游的一方。
④ 敏感工作负载本地化。 对涉及内部文档、凭证、未公开规格的场景,要么本地部署,要么走明确的零数据保留(zero data retention)企业协议——报告里被转发出去的内容,很多属于这一类。
六、决策树:你到底该不该在意这件事
你在哪一侧?
│
├─ 模型厂商 / API 提供方
│ ├─ 你的权重开放吗?
│ │ ├─ 已开放 → 输出层防护对你无意义,别在这上面投钱
│ │ │ 把资源放到账号层与流量层
│ │ └─ 未开放 → 优先级:账号基建打击 > 推理轨迹保护 > 水印
│ └─ 你的核心资产是<span>"模型"</span>还是<span>"服务"</span>?
│ ├─ 模型 → 你在这场博弈里是弱势方,考虑提高封闭性
│ └─ 服务(实时数据/工具/SLA/合规)→ 蒸馏偷不走这些,你的护城河在别处
│
├─ API 使用方 / 应用开发者
│ └─ 跑一遍 <span>5.2</span> 的四条自查;把<span>"不得转路由"</span>写进合同
│
└─ 开源 / 本地部署方
└─ 你不在攻击面内(本地推理无 API 向量),
但要注意:你的输出同样可能被下游蒸馏
三条实践建议:
- 别把"蒸馏无用论"当免死金牌。 Gudibande 的负面结果针对的是第一代(偷答案);第三代(偷推理轨迹)的能力迁移率目前没有公开数据,未知不等于不存在。
- 把回译通道当攻击面来审。 你的系统里凡是"句柄 → 原文"这类为了便利保留的还原路径,都值得重新过一遍权限。这次被利用的就是这么一个东西。
- 用"窃取成本"而不是"窃取收益"做防御预算。 收益你算不准,成本你可以抬高——账号成本、清洗成本、重写成本,每一项都是可计量的。
七、我的判断
第一,这场博弈的正确目标不是"阻止",是"定价"。 蒸馏攻击在结构上不可能被彻底阻止——攻击面就是 API 本身。所以所有有效手段的衡量标准应该是:它把攻击者的边际成本抬高了多少? 按这个标准,账号基建打击的性价比远高于输出水印。
第二,真正被搬走的是测试时算力,这一点会反过来改变模型设计。 如果推理轨迹是可提取的资产,那么"推理时能花多少算力"就成了一个需要保护的商业参数。我预期会看到更多厂商在推理轨迹的可见性上做文章(摘要化、分级可见、按订阅档位开放),而不是在能力上藏着掖着。
第三,开放权重与蒸馏防护是互斥的,这个矛盾会在 2026 年内公开化。 一家公司不可能既把权重放出去、又主张别人不该抄它的能力。接下来值得看的不是技术,是各家如何重述自己的开源叙事。
第四个判断留给使用方:报告里最被低估的一段不是蒸馏,是冒充。 蒸馏是厂商之间的事;冒充是你和你供应商客户之间的事。"我以为我在用 A,实际数据在 B"这种风险,你的安全团队现在大概率没有覆盖到。
下一个值得盯的信号:有没有厂商开始把"每个账号的推理轨迹访问审计"作为默认能力开放给企业客户。 那个能力一旦出现,说明防守方已经承认这是一场持久战,并开始把它做成产品。
参考
- Anthropic 威胁情报报告:Detecting and countering misuse of AI: September 2026(2026-09-10,覆盖 2025 年 12 月至 2026 年 8 月,七个危害领域)。本文对该报告内容的引用均为该公司单方面披露,归因与判断未经独立第三方核实,相关方尚未公开回应。
- 蒸馏能力迁移的关键反证:Gudibande, Snell, Song, Wallace 等,The False Promise of Imitating Proprietary LLMs,arXiv:2305.15717(UC Berkeley,2023-05)。核心结论:模仿模型在模仿数据未充分覆盖的任务上几乎未缩小与老师的差距,且模仿风格而非事实性;文中表格数据引自该论文报告的实验。
- 知识蒸馏原始方法:Hinton, Vinyals, Dean,Distilling the Knowledge in a Neural Network(2015)——软标签与温度 softmax 的来源。
- 相关防守研究线索:模型水印(watermarking)与输出扰动(output perturbation);模型抽取(model extraction)的攻防综述。
说明:文中"前沿训练 25 亿–50 亿美元 / 蒸馏攻击 8 万–15 万美元 / 能力保留 80–95%"一组数字广泛流传于二手报道,我未能定位到可支撑的一手来源,且与 arXiv:2305.15717 的实验结论存在冲突,仅作为流传估计列出,不应作为决策依据。媒体报道的"蒸馏成功率 94% → 67%"来自某厂商内部测试转述,未见公开论文佐证。
本文清晰拆解蒸馏攻击的三代演进、绕过手法与防御死结,戳破了“8万美元复制前沿模型”的传闻,主张按窃取成本而非收益投入防御。适合安全、风控与模型平台团队参考。