Anthropic、OpenAI 的反蒸馏:封账号、藏思维链,但防不住逼近

商业逻辑比技术逻辑更重要。
文丨王子伊
编辑丨程曼祺
2026 年 9 月 10 日,Anthropic 发布了一份 154 页的报告,称它识别并阻断了 7 家中国 AI 实验室针对 Claude 的大规模蒸馏。
蒸馏本是一种常见的模型训练方法:开发者用更强模型生成数据,再用这些数据训练自己的模型去模仿领先模型。Anthropic 将未经授权、大规模、隐蔽提取模型能力的行为称为 “不正当蒸馏”(illicit distillation)。
Anthropic 称,相关机构在提取前沿模型的输出时,使用了一些明显违规的手段:如利用被盗的信用卡、登录凭证和 API 密钥批量建立虚假账号。
报告还称,一些中国模型公司把用户请求转发给 Claude,或从第三方路由服务购买用户对话,用这些数据训练模型。部分对话包含姓名、企业数据和有效的访问凭证。
这不是 Anthropic 第一次指控 “蒸馏攻击”。2026 年 2 月,它称 DeepSeek、月之暗面和 MiniMax 通过约 2.4 万个虚假账号,与 Claude 进行了超 1600 万次交互。此后,Anthropic 加高了防线。OpenAI 和 Google 也在持续识别和应对蒸馏攻击。
这些措施能防住蒸馏吗?
澳大利亚格里菲斯大学助理教授刘艺表示怀疑。他长期研究人工智能与网络安全,曾任 Quantstamp 人工智能研究科学家。他参与的 2023 年提示词注入研究,被全球性安全组织 OWASP 的 LLM 01 条目列为参考文献。他还曾两次获得 Anthropic 的安全漏洞赏金,并研究过顶尖商用模型的思维链窃取攻击。
刘艺分享了他的核心判断:
以 Anthropic 为例,美国前沿模型公司目前主要设置了三层蒸馏防线:
(1)利用专门用于检测对抗性数据提取的分类器,让模型内生地拒绝可疑请求;
(2)在架构设计上隐藏或压缩思维链再输出;
(3)用外部检测器识别数据提取,随后中断请求或封禁账号。
反蒸馏是个伪命题。理论上蒸馏很难杜绝,美国前沿模型公司更现实的目标是提高数据采集成本,拖慢竞争对手,延长领先时间。
对美国前沿模型公司来说,反蒸馏保护的不只是模型能力,它们要捍卫的,还有在建立在技术领先之上的商业价值。
刘艺认为,理解美国前沿模型公司的反蒸馏行动,商业逻辑比技术逻辑更重要。
Anthropic 能识别疑似蒸馏的行为,却很难获得蒸馏确证
晚点:Anthropic 9 月 10 日发布报告,指控 7 家中国 AI 实验室进行不正当蒸馏。这里的 “蒸馏攻击” 具体指什么?
刘艺:目前主流的大模型由三部分组成:用户的输入,中间推理的思维链(chain of thought),模型的输出。现在 Anthropic、OpenAI,会隐藏中间的思维链,只给你最终回答。对复杂推理任务,抠出思维链就是一种蒸馏攻击方式。
晚点:推理轨迹和 Agent 完整轨迹等数据为什么对提升模型能力如此重要?
刘艺:你可以把思维链理解为一个更强模型已经做出来的解题答案,是可用于模型训练的高质量数据。
大模型性能由参数量(N)、数据量(D)、计算量(C)三者共同决定。参数量各公司增加得都比较快,在时间和算力有限的情况下,公司想更快提升模型能力,就需要更多高质量的数据。
但构造复杂、长程任务的优质数据非常难,真实世界中有价值的训练数据又越来越少。所以一些大模型公司,会用各种各样的方式蒸馏更高级的模型。
晚点:怎么把思维链和更多任务轨迹抠出来?
刘艺:这有各种技巧组合。比如通过编码(encoding)、越狱(jailbreaking)、提示词注入 (prompt injection),再通过各种各样的催眠,不停地给 AI 立人设,让它相信自己是一个研究员,正在做一件艰难但很有意义的事,让它需要专注解决任务。我跟国内的人交流不是很多,但我了解到,国外做 AI 的人有在这么还原思维链——基本上看一下 paper,你就知道大家的思路。
除了直接把原生的思维链拿出来,还可以尝试根据输入、输出合成中间的思维链。据说,一些数据公司专门出售长程任务的思维链,800-1000 元一条。
晚点:在 Anthropic、OpenAI、 Google 之中,谁被蒸馏得最多?
刘艺:根据目前的公开报道,应该是 Anthropic。但我觉得不好说。我看了 DeepSeek、GLM、Kimi、Anthropic 和 Open AI 各家思维链的实际文本,语言风格其实没太大差别。不好说是谁蒸谁的,有可能最开始他们还去蒸馏了 DeepSeek。
晚点:技术上通常如何识别蒸馏攻击?从 “这批请求很像蒸馏” 到 “这就是某一机构的蒸馏”,中间需要怎样的证据链?
刘艺:Anthropic 更多依据调用行为去判断。比如,某些账号突然发出大量请求,集中提取某些固定的数据集。
Anthropic 会先定位异常账号,再寻找不同账号共享的模式,比如相同的系统提示词。因为各家公司使用的 Agent 架构(harness)不同,系统提示词也不同,能以此识别出背后的公司。例如借助前缀缓存(prefix caching),Anthropic 可以发现哪几组提示词共享同一个缓存,又和目前已知的这些系统提示不一致,那就很容易定位到蒸馏者。
晚点:识别异常账号后,Anthropic 能进一步实锤自己的数据是否被训进了某个特定的模型吗?
刘艺:很难 100% 实锤。它可以指控某家公司尝试蒸馏 Claude,却很难证明某些数据真的进入了对方的模型。
GLM、Kimi、DeepSeek 虽然都是开源模型,但只开源了权重,不会开源数据集。而从模型权重,很难得到蒸馏的确证。否则,Anthropic 就不用在报告里说得那么隐晦,只重点描述了中转站的运作——本质是因为无法用白盒的方法分析。
再比如,你可以去问大模型《哈利·波特》第一本书的前 100 个词,它大概率会回答你。但这不代表它直接训练过原著,也可能来自引用原文的博客或书评。
晚点:也就是说,“蒸馏攻击” 很难被完全证实,也很难被证伪。
刘艺:Anthropic 可以通过平台侧的调用记录、账号关联和基础设施信息形成比较强的归因证据,但这和从最终模型本身证明某一批 Claude 数据确实进入了训练,是两个不同的问题。后者在技术上要困难得多。
反蒸馏提高了对手的采集成本,也可能 “误伤” 普通用户
晚点:当前美国前沿 AI 公司,有哪些应对蒸馏攻击的具体技术方法?
刘艺:我认为分为三类。
第一,内嵌检测,Anthropic 应该有专门针对思维链提取的分类器(classifier),一旦检测到思维链相关的状态被激活了,就可以制止提取的行为;
第二,从产品架构上隐藏,模型不再输出原始思维链,而是先压缩、总结,再输出;
第三,外挂检测,比如它可以看输出内容是不是和自己的思维链有重叠(overlap),如果达到了某些泄露的阈值,就会制止输出。类似行为多了之后,号就会被封掉。
晚点:Anthropic 的报告里没有涉及这些细节,你是如何了解的?
刘艺:这是我自己的推测,因为这是比较常见的操作。为什么 Anthropic 会发布漏洞赏金计划来测试自身的安全防御措施?它想花钱来买人们 jailbreak 它的提示词——一旦发现某个东西被攻破了,它马上就会训到自己的分类器里,所以下一次攻击就会越来越难。
晚点:你曾两次获得 Anthropic 的安全漏洞赏金,当时是一个怎样的过程?
刘艺:我当时花了大约 2 到 3 周,主要是在 Anthropic 授权的漏洞赏金项目范围内,对它的安全分类器进行对抗测试(Adversarial Testing),尝试寻找能够绕过现有防御的输入。因为攻破就是 zero or one,只有成功和不成功,没有 0.5 的状态。当时任务的目标是做一些 Anthropic 指定问题的获取,不直接涉及还原思维链。但有些逻辑是类似的。
晚点:防范蒸馏攻击的操作,会不会误伤正常订阅用户?
刘艺:正常订阅的用户应该还好,触发风控的主要是一些异常用户,比如说中转站的账号,或者尝试去攻击 Claude 的账号。
我记得 Anthropic 的报告里,还披露了 2 个湖南某大学的本科生自己设计了一套做网络安全的 Agent,用它去攻击各种各样的网站,这都被挖出来了。
理论上,你跟 Anthropic 交互的所有信息,它想查都查得到。
晚点:所以当 Anthropic 认为用户可能对他们有威胁时,就能调取和查看用户数据吗?
刘艺:这需要具体去看不同模型公司的用户条款。据我了解,Anthropic、OpenAI、Google 提供某种 Zero Data Retention(ZDR,零数据保留)机制,承诺在处理完任务后,立即销毁客户输入的提示词和 AI 生成的回复,不存储、不留存,也不用于模型训练。这个功能主要面向符合条件的 API 或企业客户,通常需要申请或额外配置。普通用户在使用 Claude、ChatGPT、Gemini 时,数据留存策略按各自用户协议执行,不等同于严格 ZDR。
比如,模型公司把你的数据稍微改写一下,用作训练,算不算用你的数据呢?
晚点:也就是说,前沿模型一边让用户付费使用,一边可能使用用户数据继续 scale up?
刘艺:对。比如,用户在 Claude Code 或 Codex 中纠正模型的回答,这些反馈就是很有价值的奖励信号,可以改善后训练。
蒸馏也是同样的逻辑。当前模型的后训练主要依赖强化学习,关键是奖励信号。模型公司拿到性能更强模型的思维链,相当于拿到了 “大结果”,直接获得了高质量的解题路径。这可以减少盲目探索,让模型更快收敛到比较好的状态,节省时间和算力。
晚点:美国前沿模型公司防范蒸馏攻击的成功标准是什么?
刘艺:一是能阻止其他模型公司走捷径训练,保证自身模型的领先优势。二是提高其他模型公司的蒸馏成本、数据采集成本。同时尽量不影响用户的正常使用。
晚点:能防住吗?
刘艺:我觉得防不胜防。模型只要让人用,就有泄露的风险。
不过我最近看 OpenAI 在 9 月 10 日正式推出了 Agents API 公测版。不像之前 Responses API,用户给一个输入,大模型给我一个输出,中间加一个思维链。Agents API 的逻辑是用户给任务,直接获得任务的结果。中间思维链、 Agents harness 的过程都隐掉了,相当于卖一整个执行环境。用户不需要再去管非常细节的事,整体的任务执行越来越抽象。在这种场景下,再想蒸馏攻击,成本可能会更高。
反蒸馏的真正动机:占领舆论,保护估值
晚点:你觉得蒸馏是提升模型能力的最优解吗?似乎后发复制的速度永远也跟不上前沿创新的速度?
刘艺:我之前有一个观点,2024 年时,短期内模型结构本身的创新是一个护城河。接下来,护城河可能会扩展到算力。再然后,护城河就是基础设施(infrastructure)和能源。我观察目前大概就是按照这个趋势在发展。
晚点:蒸馏能归属于你这个护城河推演里的哪个部分?
刘艺:我觉得可以归属到算力。理论上,多试试也能试出来,但可能时间上不允许。
晚点:反蒸馏最后保护的是什么?
刘艺:反蒸馏是个伪命题。理论上蒸馏是不可防御的——按照人性,只要我蒸馏你的效率,高过自己构造数据来训练模型的效率,那我一定会先来蒸馏你。
晚点:你认为美国前沿 AI 公司的反蒸馏是一场注定失败的战役?
刘艺:对。我的观点就是这样。
晚点:如果技术上注定失败,美国前沿 AI 公司为什么还这么执着?
刘艺:他们要保持技术领先。最近 Open AI 称自己使用了约 1 万个 AI 智能体耗时 88 小时完成了七大 “千禧年难题” 之一的数学证明。举个例子,假设 DeepSeek 在今年年底宣布,自己已经把千禧年七大数学难题全部解决了,还在技术报告里写:我只用了 Open AI 1/10 的成本就完成了任务。美国的投资者可能会问,为什么你要这么多钱,还做得没有别人好?Open AI 的估值可能就会跌下来。
所以 Open AI 等美国前沿模型公司反蒸馏行为的本质还是商业逻辑,而不只是科技发展的逻辑:
Anthropic 一是要收数据,建立自己的数据飞轮,二是要把自己的 ARR 做得更好看,为 IPO 做准备。
OpenAI 的逻辑类似。OpenAI 为什么一直给大家发重置卡——那不相当于每按一次就给大家送个钱嘛,就是为了收数据,并且让财务报表变得更好看。
晚点:9 月 12 日,Anthropic 创始人达里奥(Dario Amodei)发文呼吁全行业放慢前沿 AI 模型的迭代速度。你怎么看?
刘艺:我认为,他们应该看到了一些瓶颈。瓶颈可能有三个因素:一是数据,二是算力,三是基础设施 / 能源。但具体是哪个瓶颈,我目前不好说,可能三个因素都有。
资本都是逐利的。理论上,如果我能造出 AGI,我能收割全球,我没有理由去停下发展,直接 “冲冲冲” 把 AGI 给实现就好了。他们大概率遇到了瓶颈,才顶着 AI 安全的帽子,出来呼吁大家:AI 太危险了,我们先坐下来讨论怎么限制 AI 的发展。
晚点:你认为,前沿模型公司反蒸馏的本质原因是什么?
刘艺:提升对手蒸馏成本,保持自己的领先优势。他们或许判断,中国的模型很快会追上他们的,但没想到更好的方式去保持自己的领先优势,只能加强限制,先占领舆论高地。
从行业朴素共识的角度来讲,蒸馏是一个很大的安全问题,相当于窃取知识产权。但从实用性的角度来说,这本质上是一种 AI 平权。蒸馏是快速平衡市场的一种方式。正因为有很多竞争者,某家模型公司才没法垄断,一家独大,想怎么定价就怎么定价。
晚点:你提到了蒸馏积极价值的一面,另一方面,蒸馏可能对整个行业,对普通用户带来什么潜在危害吗?
刘艺:对行业来说,大家的输出风格趋同,模型会继承某几种来自教师模型的失败模式。对用户来说,会有一些隐私泄漏的风险。
晚点:你认为整体上,包含蒸馏攻防在内的 AI 安全领域处于什么状态,面临什么挑战?
刘艺:我更关注的是 AI 安全和商业激励之间存在的结构性紧张。
模型公司确实投入了大量资源做安全,但在某些场景下,更严格的安全措施可能影响模型能力、延迟产品发布或者降低用户体验,所以安全目标和竞争目标并不总是完全一致。因此,一个重要的治理问题是,如何让安全投入和公司的商业激励更一致。至少短期内,很难找到一套既能解决安全问题,又不牺牲模型性能的优雅解决方案。
晚点:你认为蒸馏攻击后续会怎么发展?
刘艺:攻防还会继续,达到一种动态平衡。可能会有几个流派:一是不要思维链,直接开始蒸,探索能把一个前沿模型蒸成什么样。二是在要思维链的情况下,获取原生思维链。三是自己去合成思维链。
晚点:为避免隐私数据泄露,你有什么建议给普通用户吗?
刘艺:别用中转站。在使用某些模型时,能勾选愿不愿意让自己的数据被训练时,别选愿意。其他的你也做不了太多。毕竟人为刀俎,我为鱼肉啊。
题图来源:《模仿游戏》
相关推荐
Anthropic、OpenAI 的反蒸馏:封账号、藏思维链,但防不住逼近
Anthropic声称被Deepseek蒸馏!马斯克为啥怼?
1%片段就能偷走顶级AI思维链!Kimi被抓包,DeepSeek为什么没事?
Anthropic指责Kimi蒸馏了它还没有发布的模型!网友:知道了,你下一步就是蒸馏Kimi
马斯克翻车了!一边告OpenAI,一边偷偷蒸馏ChatGPT
OpenAI宣称DeepSeek违规“蒸馏”,但没有给出证据
思维链让AI变聪明,Astra却用它骗人
晚点独家丨字节讨论训超 5 万亿参数模型,张一鸣:不蒸馏、别被 Coding 这种短期热点影响
历史性时刻!Anthropic估值暴涨破万亿美元,首次超越OpenAI
当老板与员工展开“蒸馏”对抗
网址: Anthropic、OpenAI 的反蒸馏:封账号、藏思维链,但防不住逼近 https://www.xishuta.cn/newsview153440.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
