AI工具AI评分 一般 (67)AI 中文改写

NVIDIA SkillEvaluator评估AI智能体技能表现

2 天前 2 阅读来源:developer.nvidia.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

NVIDIA 发布 SkillEvaluator:用数据证明 AI Agent 技能包到底有没有用 AI Agent 的能力上限,很大程度上取决于它接收到的上下文质量。即便模型再强、NVIDIA 的库文档再完善,Agent 在实际执行任务时仍可能因为找不到合适的工具而多走弯路,在死胡同里白白消耗 token,或者在处理专业任务时力不从心。为了解决这个问题,NVIDIA 推出了“技能包”(Skills)机制,把指令、示例和工具调用指南打包在一起,帮助 Agent 从“理解意图”到“给出解决方案”的路径大幅缩短。但一个关键问题随之而来:这些技能包真的有效吗?为此,NVIDIA 构建了一个开源的评估层——SkillEvaluator,用静态检查和真实任务跑分的方式,量化技能包对 Agent 性能的实际影响。 SkillEvaluator 的核心逻辑很简单:对同一个任务,分别在安装技能包和不安装技能包的情况下运行 Agent,对比两次得分,差值就是“技能提升度”(Skill Lift)。NVIDIA 官方验证的技能包是经过签名、包含能力描述符的,能精确告诉 Agent 某个 NVIDIA 产品是做什么的、什么时候该调用它、以及如何调用。本次发布的基准测试结果覆盖了 30 多个 NVIDIA 产品、超过 300 个已验证技能包,每个技能包都在两个独立的测试框架(harness)上进行了评估。目前,这些技能包已支持 Claude Code、Codex 和 Cursor 等主流 Agent 工具,用户也可以通过 Skills.sh、ClawHub 和 Hermes Hub 获取。 技能包的评估分为三个层级,每一层回答不同的问题,且可独立运行。第一层是安全与结构检查,包括 schema 和 frontmatter 验证、质量评分、针对提示注入和数据外泄的安全扫描、密钥和 PII 检测、许可证检查以及脚本 linting。第二层是区分度检查,通过嵌入相似度识别单个技能包内部的重复指导,以及整个技能库中不同技能包之间的重叠覆盖。第三层是实时评估,在隔离的沙盒环境中,让 Agent 分别带着技能包和不带技能包执行生成的任务,并测量两者差异。 第三层实时评估是重头戏,它基于 Harbor 这个开源框架运行,能在可重复、隔离的环境中执行 Agent 评估。SkillEvaluator 负责 Harbor 的配置,将评估用例转化为任务,在沙盒中运行 Agent,收集结果并计算技能包的影响。每个评估用例都会在同一个 Agent 框架下运行两次:一次安装技能包,一次不安装。两次运行使用相同的提示词、模型、任务输入和评分标准,唯一的变量就是是否安装技能包。这种受控对比会在两个不同的 Agent 框架中重复进行,最终得出技能包的贡献值,即 Skill Lift 分数。 从实际使用来看,整个流程相当简洁。用户只需运行 `skillevaluator create-eval-dataset ./my-skill --full` 生成评估数据集,其中包含显式、隐式、上下文和负向用例,然后运行 `skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker` 即可启动实时对比。SkillEvaluator 会将用例转换为 Harbor 任务包,分别运行带和不带技能包的测试,自动评分并输出 Skill Lift 结果。所有数据均基于 2026 年 8 月 12 日的 benchmarks.json 快照,分数采用宏平均方式计算,每个技能包-框架组合权重相同。 对于中国跨境电商卖家和 AI 从业者来说,这套评估体系的价值在于:它提供了一种可量化的方法来判断“AI 技能包”这类工具的实际效果,而不是凭感觉或厂商宣传做决策。随着 Agent 在电商运营、客服、内容生成等场景的深入应用,技能包的质量直接关系到自动化流程的效率和成本。NVIDIA 将评估工具开源,意味着开发者可以自行验证技能包的有效性,甚至为自己的业务场景定制技能包并评估其价值,这无疑会推动整个 Agent 生态向更务实、更可度量的方向发展。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · developer.nvidia.com

内容版权归原作者及 developer.nvidia.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容