新技巧揭示AI模型内心想法
2 小时前 2 阅读来源:Wired AI

AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
计算机科学家最近发现了一种新方法,能够提取前沿AI模型在处理复杂问题时隐藏的“思考”过程。这项发现为某些中国模型可能通过“蒸馏”美国模型推理信息进行训练提供了证据——尽管还不是确凿证明,因为部分模型的思考或推理模式高度相似。研究人员还展示了该方法可用来恢复模型内部推理中的个人信息,如密码和API密钥,不过这一漏洞已被修复。
德国蒂宾根大学的计算机科学家Alexander Panfilov参与了这项研究,他表示:“我们测试的所有主要前沿模型提供商都存在这一漏洞。它可能导致个人信息泄露,并促成大规模推理蒸馏攻击。”Panfilov与来自蒂宾根大学、马克斯·普朗克研究所、AI安全机构MATS Research以及安全公司Snyk的同事,在通过应用程序编程接口(API)访问OpenAI、Anthropic和Google的前沿模型时,发现了相同的问题。在一篇阐述该工作的论文中,研究人员展示了来自中国月之暗面(Moonshot AI)的可下载开源模型Kimi K3,在特定提示下,其输出与Claude Opus 4.8和GPT 5.6 Sol的隐藏推理痕迹(即解决问题时写出的推理步骤)惊人地相似。尽管存在相似性,他们指出这项工作“无法从因果上确证蒸馏”。他们还发现,另外两个开源模型——中国的DeepSeek和美国的Thinking Machines公司的Inkling——并未表现出与Claude Opus的这种推理相似性。截至发稿时,月之暗面和Z.ai未回应置评请求。
蒸馏是一种成熟且广泛使用的技术,用于高效地将现有模型的能力复制到新模型中,在开发开源或完全可下载模型时尤为常见。然而,最近蒸馏成为争议话题,因为有指控称中国AI公司利用它来实质性地复制美国顶尖模型。今年2月,OpenAI向美国立法者表示,DeepSeek似乎复制了其一个模型来构建推理模型R1。6月,Anthropic向立法者表示,阿里巴巴系统性地蒸馏了其模型以构建自己的模型Qwen。目前没有迹象表明中国AI公司使用了这种特定技术来蒸馏美国AI模型。但Panfilov及其合作者表示,使用他们的方法可以从封闭模型中蒸馏出比以往认为更多的信息。
高级AI模型通过将难题分解成组成部分,并逐一分析来解决问题,这类似于人工推理或“思维链”。公司倾向于对专有模型的推理过程保密,以防止他人利用它们训练新模型。然而,它们通常也会将推理的加密版本发送到用户计算机,以分担部分计算任务。研究人员的攻击依赖于一个事实:大多数AI公司还提供不同大小的相关模型。较大的模型能力更强,但运行和访问成本也更高。用户可能为降低成本而选择较小、较弱的模型。Panfilov和他的同事发现,将加密的推理痕迹输入同一模型的较小版本,可以揭示隐藏的推理内容。较小的模型接受的对齐训练较少,这意味着与较大的模型不同,它们不太可能拒绝透露内部思考。“将消息交换到具有相同解密密钥但较弱模型变体的想法,”
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
