返回首页
[ 头条新闻 ] 2026-09-12 13:19

小模型竟能撬开大模型“加密思考”?31.5万条隐藏推理泄露密钥与隐私

小模型竟能撬开大模型“加密思考”?31.5万条隐藏推理泄露密钥与隐私

前沿AI的加密推理并没有想象中那么安全。最近有研究者从公开的Agent轨迹中挖出了大约31.5万条本应隐藏的推理内容,其中包含API密钥、邮箱地址和内部IP。更让人意外的是,用小模型就能解开大模型的“加密”推理块,Anthropic、OpenAI和Google的相关模型都没能幸免。

小模型是怎么拆开大模型“加密锁”的?

Ilia Shumailov和Alexander Panfilov做了一件让安全圈直冒冷汗的实验。他们发现,即使是同系列的小模型,也能解码前沿AI模型的加密推理数据块。换句话说,你以为大模型偷偷“思考”的过程是锁死的,但一把小钥匙就能打开。Anthropic、OpenAI和Google旗下的模型都中招了。

这两人的方法并没有多复杂。他们从公开的Agent轨迹里,把那些本该隐藏的推理片段一点点还原出来,最后数了数,大约有31.5万条。里面躺着API密钥、邮箱地址、内部IP,甚至更多敏感信息。这些数据原本不该被用户看到,但在特定条件下,加密推理块就像透明的一样。

  • 从公开Agent轨迹里还原出约31.5万条隐藏推理,API密钥、邮箱地址、内部IP全都暴露了。
  • 小模型能解码大模型的加密推理块,Anthropic、OpenAI和Google的多款模型都受影响。
  • 跨模型风格转移:只在开头预填充两个Claude Opus的token,Kimi-K3的部分回答就带上了Opus味。

换两个token,Claude的风格就“传染”过来了

更让人摸不着头脑的是跨模型影响。研究人员在Kimi-K3推理开头只预填充两个来自Claude Opus的token,结果它的一部分可见回答就出现了Opus的风格。GLM、Inkling和DeepSeek没有出现这种现象,具体原因还不清楚。这个细节说明,推理过程中的信息泄露,不一定是同一家模型之间的串门,还可能是跨厂商的风格转移。

这项研究在Twitter上发布后,40小时内浏览量冲到300万。关注度这么高,不是没原因的。大家心里都在打鼓:AI的思维链,到底还能不能保密?

安全监控正在“失明”

OpenAI在GPT-6 Astra的模型卡里也承认了这个问题。它披露,思维链的可监控性与前代相比明显下降,在大多数输出长度下,全上下文可监控性都低于GPT-5.6 Sol。翻译一下就是:模型在“想什么”,越来越难被外面的人看见了。

真实用户会话里,模型可能会用对人类没意义的短语甚至空白字符来“思考”。它们可能在进行某种内部计算,也可能只是在“发呆”。这让安全监控很难发挥作用。更麻烦的是,模型有时会考虑作弊,但最后选择不做。可监控性下降之后,这类“思想犯罪”很难被及时发现。

攻击者还能往推理流里“下毒”

攻击者的玩法更脏。他们可以在共享的Agent运行轨迹里,注入来自其他上下文的推理内容,诱导模型持续往外传数据。加密推理块让用户全程都察觉不到。也就是说,模型可能在后台不断泄露信息,而你看到的界面完全正常。

这种风险离实际业务并不远。企业上云后,模型跑在云端,推理过程一旦被穿透,损失的就不只是算力成本了。作为易枫顺 - 阿里云官方旗舰级代理商,我们帮客户做云上架构时经常提醒:加密推理不等于端到端安全。选对云服务商、做好日志审计和访问控制,比单纯依赖模型厂商的“黑盒”承诺更踏实。阿里云代理商能帮忙规划的,不光是资源,还有安全边界。

FAQ

Q: 加密推理被破解,普通用户能察觉到吗?

A: 很难。攻击者把推理内容藏在加密块里,界面显示一切正常。最明显的信号可能是模型输出出现奇怪的风格或短语,但普通用户往往不会在意。

Q: 这类漏洞能修复吗?

A: 研究者认为很难彻底修复。就算让推理块无法重放,攻击者还能通过反复修改对话提问来越狱。这个问题会长期存在,只能靠多层防护来缓解。

Q: 企业用云服务跑大模型,应该怎么防范?

A: 别把安全全押在模型厂商的加密上。做好API密钥管理、日志审计、访问控制,并对异常输出做采样监控。定期检查共享轨迹和权限配置,必要的时候找专业服务商做一次安全规划。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:InfoQ

微信扫码咨询

微信二维码