扰动探测:评估大语言模型安全脆弱性的新方法
1 小时前 1 阅读来源:unit42.paloaltonetworks.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
大模型的安全防线,可能比想象中脆弱得多。Palo Alto Networks旗下威胁研究机构Unit 42发布的一项新研究揭示,在开源模型Qwen3-4B中,仅需移除350,208个前馈神经元中的50个——占比约0.014%——就能让模型在80%的恶意提示基准测试中改变拒绝回答的格式,从而绕过安全对齐。这项名为“扰动探测”(Perturbation Probing)的技术,用极低的计算成本(每个提示仅需两次前向传播)定位到了决定模型安全行为的“关键神经元”,并首次量化了安全机制在模型内部的集中程度。
这一发现的核心意义在于,它颠覆了业界对LLM安全机制的认知。当前主流大模型通过RLHF(基于人类反馈的强化学习)进行对齐训练,让模型学会拒绝有害请求。但研究显示,这种“拒绝行为”并非分布在整个网络中的稳健防御,而是集中在一个极薄的模板层上——就像一层油漆,而非一堵厚墙。在Qwen3.5-2B模型上,仅20个神经元就能将模型在多轮对话中错误同意用户的概率从36.7%降至0%。这意味着,任何能够操纵模型内部结构的攻击者,或一次普通的优化运行,都可能轻易摧毁这层脆弱的防线。Unit 42将这种状况类比为“仅依赖单一边界防火墙”,在结构上根本不足以应对真正的安全威胁。对于依赖开源模型构建业务的跨境电商和AI应用开发者而言,这无疑是一个需要警惕的信号:基础模型的安全能力不应被视为理所当然的默认保障。
除了定位神经元,该研究还提出了一个实用的诊断指标——FFN/Skip比率。这是一个可在数秒内计算出的单一数值,能够预测模型的安全电路是否容易被微小修改所操控。在测试的13个模型中,该比率解释了81%的安全脆弱性差异,使其有望成为行业标准的“安全脆弱性评分”。这意味着安全团队无需先进行对抗性红队测试,就能快速比较不同模型的对齐鲁棒性。对于企业用户来说,这提供了一个在部署前评估模型安全性的高效工具,也为构建多层防御策略(如外部内容过滤器和运行时防护)提供了量化依据。研究团队希望,这项技术能帮助安全社区从“事后修补”转向“事前诊断”,推动AI安全从依赖模型自身对齐的单一防线,走向纵深防御的体系化建设。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
