AI工具AI评分 一般 (60)AI 中文改写

烧掉117亿token,选出最强网络AI模型 | GLM5.3与DeepSeek跻身前沿

17 小时前 1 阅读来源:aikido.dev

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

在网络安全领域,大语言模型(LLM)的“幻觉”和“随机性”通常被视为需要克服的缺陷,但最新的研究却反其道而行之,利用这种不稳定性来提升漏洞挖掘的效率。知名AI安全公司aikido.dev近日公布了一项大规模基准测试结果,他们烧掉了117亿个token(约合人民币数百万元计算成本),对10款主流AI模型进行了严格的“夺旗”式测试,最终得出结论:以DeepSeek为代表的开源模型,在漏洞发现能力上已经全面超越GPT-4.5等闭源前沿模型,且成本仅为后者的零头。 这项测试的核心是让每个AI模型在32个真实世界的开源代码库中,尝试“重新发现”32个近期披露的安全漏洞(CVE)。为了确保公平和新鲜度,这些漏洞都是最近才公开的,模型在训练时大概率没见过相关补丁或分析报告,从而测试的是模型的推理能力而非死记硬背。每个模型被给予30轮交互机会,且无法访问互联网,整个测试流程、提示词和评估标准完全冻结。结果显示,DeepSeek V4 Pro 0813版本表现最为抢眼,在三次独立运行中,通过汇总结果成功找出了28个漏洞。更令人惊讶的是,其成本效益极高:三次运行的总花费仅约295美元(约合2100元人民币),而性能却超过了价格昂贵的Opus 5、Grok 4.6等闭源模型。即便是更便宜的DeepSeek V4 Flash版本,三次运行花费108美元,也能找到24个漏洞,与Grok单次最佳表现持平,但成本仅为后者的四分之一。 核心变化: 这项研究揭示了一个关键趋势——开源模型正在从“追赶者”变为“领跑者”。在汇总三次运行的漏洞召回率(Recall)上,DeepSeek V4 Pro击败了所有接受测试的闭源模型。紧随其后的是Qwen3.8-Max、Kimi K3和GLM-5.3,这些国产开源模型在保持高召回率的同时,也展现出了极强的结果一致性。这意味着,对于预算有限的安全团队或跨境电商卖家来说,使用开源模型进行代码审计和漏洞扫描,已经完全可以替代昂贵的商业API服务。然而,这种“廉价覆盖”也带来了代价:开源模型在产出大量有效发现的同时,也制造了最多的误报(False Positive),需要后续的流水线进行更多筛选和人工复核。研究者指出,模型单次运行的结果往往不完整,但通过多次运行并汇总结果,可以显著提升漏洞发现的覆盖面,这为AI在安全审计中的实际应用提供了新的方法论。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · aikido.dev

内容版权归原作者及 aikido.dev 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容