解读前沿实验室内部AI发展速度的衡量标准 - Anthropic
6 小时前 1 阅读来源:anthropic.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
Anthropic 首次公开内部 AI 研发自动化指标,揭示 AI 正在多大程度上“自己造自己”
Anthropic 近日发布了一份颇为罕见的技术透明度报告,首次对外披露其内部用于衡量 AI 研发进度的三项核心指标,并给出了截至 2026 年 8 月的实测数据。这家以 Claude 系列模型闻名的前沿实验室试图回答一个越来越紧迫的问题:当 AI 开始参与构建下一代 AI 时,人类距离“递归自我改进”——即模型完全自主地造出自己的继任者——究竟还有多远?报告的核心结论是,Claude 目前在公司内部 AI 研发工作中的自动化程度已达到“协作”级别(AL3),即能在人类密切指导下完成大块研发任务,但尚未进入“主导”级别(AL4),距离完全自主的 AL5 仍有明显距离。
这套评估体系来自 Epoch AI 开发的自动化等级量表,从 AL0(无 AI 参与)到 AL5(AI 完全自主运行、无需人类介入)共分六级。Anthropic 据此构建了一个名为“Anthropic 研发自动化指数”的原型工具,做法是先把公司内部所有类型的 AI 研发工作逐一编目,再对每项任务当前的自动化程度打分,最后汇总成整体指数。报告同时披露了另外两个维度的测量:一是人类对 AI 智能体在 Anthropic 系统上所执行操作的监督与干预能力,二是支撑更强模型开发的算力与资源投入情况。Anthropic 强调,这些指标衡量的是“模型如何被造出来”,与衡量“模型能做什么”的能力评估互为补充,后者已通过其负责任扩展政策(RSP)风险报告单独发布。
值得关注的是,Anthropic 明确表示这些数字并非一成不变。公司 CEO 达里奥·阿莫代伊此前多次呼吁对前沿 AI 发展速度进行协调管控,Anthropic 称若业界真就“减速”达成协同,上述指标预期将随之变化。为此,公司计划引入来自多家机构的独立第三方评估者常驻内部,给予他们与内部风险评估团队同等级别的流程、系统和数据访问权限,由第三方核实安全实践、报告事件并监控关键指标。这一安排对跨境电商和 AI 从业者的现实意义在于:前沿实验室的研发节奏正从“黑箱”走向可被外部验证的量化披露,未来各国政府若采纳类似高级 AI 框架(AAIF)的透明度义务,模型发布前的风险报告和研发进度指标可能成为行业标配,出海企业在选择底层模型供应商时,也将多出一个判断其技术迭代速度与安全合规水平的参考维度。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
