OpenAI GPT-6 Astra通过ARC-AGI-3测试
2 天前 1 阅读来源:arcprize.org
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
OpenAI最新一代模型GPT-6 Astra在ARC-AGI-3基准测试中交出了一份令人瞩目的成绩单:在标准测试环境下得分62.7%,成本约2.6万美元;而在使用Provider Adapter适配器后,得分飙升至99.9%,成本反而降至1.9万美元。更值得关注的是,Astra在行动效率上已经超越了人类基线——在96%的关卡中,它使用的操作次数少于测试人类的中位数。
ARC-AGI-3是ARC-AGI基准系列的第三代产品,专门用于评估AI的智能体能力。与侧重模式识别的ARC-AGI-1和ARC-AGI-2不同,这一代测试聚焦于四个核心维度:探索能力(主动获取信息而非被动接收)、建模能力(将原始观察转化为可预测的通用模型)、目标设定(在稀疏奖励下识别目标状态)以及规划执行(从当前状态规划路径并实时纠偏)。测试环境全部基于抽象回合制场景,人类参与者可以100%完成,但AI必须在不接受明确指令的情况下自行推断游戏规则和目标。
GPT-6 Astra在测试中展现出一个关键行为特征:它能够将陌生环境转化为紧凑的符号世界模型。具体来说,模型会把游戏机制表示为逻辑规则,并开发出自己的领域专用语言简写来追踪状态和规划行动。这种能力让它在面对未知环境时,不是盲目试错,而是先构建内部模型再高效行动。值得注意的是,推理等级越高,成本反而越低——因为Astra用更少的行动解决问题,减少了模型调用次数和token消耗。例如,在标准测试中,max推理等级成本为2.6万美元,而medium等级虽然得分只有38.6%,成本却高达4.8万美元。
对于跨境电商卖家和AI从业者而言,这一结果传递了几个信号。首先,AI智能体的"行动效率"正在成为比单纯"智商"更重要的衡量标准——在真实商业场景中,一个能用更少步骤完成任务的AI,意味着更低的API成本和更快的响应速度。其次,Provider Adapter这类保留推理状态的技术,让AI能够在长对话中复用之前的工作成果,这对需要多轮交互的客服、运营自动化场景有直接价值。最后,ARC-AGI-3的测试设计本身也值得借鉴:它模拟了真实世界中信息不完整、目标不明确的环境,这正是卖家在选品、广告投放、供应链管理中最常遇到的挑战。随着AI从"聊天工具"向"自主执行体"演进,理解这些基准测试背后的能力维度,将帮助从业者更准确地评估和选择适合自身业务的AI方案。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
