AI工具AI评分 头条 (76)AI 中文改写

Claude Fable 5.1:ARC-AGI测试结果

8 小时前 1 阅读来源:arcprize.org

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

Anthropic 旗下 Claude 系列模型在 ARC-AGI 基准测试中再创佳绩。根据 ARC Prize 基金会今日公布的数据,最新发布的 Claude Fable 5.1 在 ARC-AGI-1 Semi-Private 测试中取得了 97.5% 的最高成绩,在难度更高的 ARC-AGI-2 Semi-Private 测试中也达到了 90.0% 的得分率。这一成绩将 Anthropic 的模型能力推至该基准测试的历史新高,也使其在 ARC-AGI-2 排行榜上超越了 OpenAI、Google 和 DeepSeek 等竞争对手的旗舰模型。 ARC-AGI 基准测试由 ARC Prize 基金会设计,旨在衡量 AI 系统在抽象推理和泛化能力上的表现,被视为评估通用人工智能(AGI)进展的重要参考。与传统的语言理解或知识问答测试不同,ARC-AGI 要求模型解决从未见过的视觉推理任务,无法依靠训练数据中的记忆来“作弊”。ARC-AGI-2 作为 2025 年推出的升级版,进一步提高了任务难度,增加了干扰项和更复杂的规则组合,此前大多数模型在该测试上的得分率都远低于 50%。 Claude Fable 5.1 之所以能取得如此亮眼的成绩,核心在于其采用了多阶段推理机制。根据 ARC Prize 公布的数据,该模型在“Max”推理强度下能达到 97.5% 的得分率,但即便在最低推理强度“Low”下,也能在 ARC-AGI-1 上保持 90% 的成绩。这种可调节的推理深度设计,让用户可以根据任务复杂度和成本预算灵活选择运行模式。值得注意的是,模型在 ARC-AGI-2 上的表现同样呈现出明显的推理强度梯度:从 Low 模式的 78.3% 到 Max 模式的 90.0%,说明更强的推理计算量确实能带来显著的性能提升。 从成本角度来看,Claude Fable 5.1 在 ARC-AGI-1 上每任务推理成本约为 1.40 美元,在 ARC-AGI-2 上则为 4.49 美元。这一价格水平在同类高推理模型中属于中上区间,但考虑到其突破性的得分率,性价比仍然相当突出。对于中国跨境电商卖家和 AI 应用开发者而言,这一进展意味着 Claude 系列在处理需要复杂逻辑推理的任务——比如供应链优化、多语言客服对话、市场趋势分析等场景——时具备了更强的能力基础。不过需要指出的是,ARC-AGI 衡量的抽象推理能力与实际商业应用中的任务表现并不完全等同,卖家在选择模型时仍需结合具体场景进行测试。 ARC Prize 基金会同时公布了 Claude Fable 5.1 在公开评测集上的逐任务表现数据。在 ARC-AGI-2 Public Eval 的 120 个任务中,模型在 Max 模式下仅出现少量失败案例,其中编号为 88e364bc 的任务在所有推理强度下均未能通过,显示出该任务对当前模型仍构成挑战。在 ARC-AGI-1 Public Eval 的 400 个任务中,模型同样表现出色,绝大多数任务都能在低推理强度下正确完成。这些细粒度数据为开发者评估模型在特定类型推理任务上的强弱提供了参考。 Anthropic 此次发布的 Claude Fable 5.1 还提供了 5 种推理变体配置,从 Low 到 Max 覆盖不同的计算预算需求。这种产品策略与 OpenAI 的 GPT-5.6 系列和 Google 的 Gemini 3.x 系列形成直接竞争,各家都在通过可调节推理深度来满足从轻量级应用到高难度推理任务的不同需求。随着 ARC-AGI-2 排行榜上各家的分数差距逐渐缩小,推理效率和成本控制将成为下一阶段模型竞争的关键维度。对于关注 AI 技术演进的中国出海企业来说,持续跟踪这些基准测试结果,有助于在模型选型和成本规划上做出更明智的决策。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · arcprize.org

内容版权归原作者及 arcprize.org 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容