AI工具AI评分 头条 (72)AI 中文改写

山姆·奥特曼终极之战:四个月内交付AGI——独家揭秘

11 小时前 2 阅读来源:eu.36kr.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

OpenAI的AGI豪赌:四个月倒计时,Sam Altman的背水一战 AGI竞赛正进入白热化阶段,科技巨头们纷纷抢滩卡位,而这场竞赛的赢家似乎将通吃一切。就在本周三的财报电话会上,英伟达CEO黄仁勋抛出一枚重磅炸弹:“对于许多任务,我们可以说已经实现了AGI。”同一天,Sam Altman一段长达两个多小时的访谈也对外发布,他将AGI实现的时间线锁定在2026年底。对于Altman而言,这四个月远不止是一场技术冲刺——在OpenAI明年上市之前,他必须先打出AGI这张王牌。如果无法如期交付,等到他敲响上市钟声时,一个更早上市、市值翻倍且已实现盈利的竞争对手,将早已挡在他面前。这场战役,OpenAI已无路可退。 黄仁勋率先开炮:AGI已经实现了。在那场财报电话会上,有人问他如何看待OpenAI等公司对AGI的疯狂追逐。黄仁勋的回答是,这个问题目前没什么好争论的——整个行业连“智能”是什么都尚未达成共识,更遑论用什么标准来衡量AGI。但他手里握着另一张牌:英伟达的AVO架构在ARC-AGI-3测试中拿下了100%的满分。这项测试专门用来评估智能体能否长时间自主工作。基于这一结果,他抛出了一个极具野心的预测:不久的将来,英伟达可能只需要维持约4万名人类员工,却将拥有40万甚至400万个数字员工。 但那张满分试卷,其实只是一层光鲜的外壳。众所周知,ARC-AGI-3的玩法相当“不按常理出牌”——智能体被直接扔进一个陌生环境中,完全不提供规则和目标,全靠自主探索、观察和猜测。它们只有一块64×64的网格和几个按钮,每个环境至少六层关卡:第一层五步能过,第六层则需要五十步才能完成。这对人类来说都很难,模型也好不到哪去。关键在于:AVO使用的驱动模型是Claude Opus 5,英伟达只是给它套了一层外壳——没有修改任何权重参数,分数就直接从30.16%跳到了满分。真正起作用的有两样东西:一是持久记忆,即使上下文满了也不会清除,智能体能从当前状态继续工作,不会重蹈覆辙;二是监督者,它自己不干活,只监控整个搜索轨迹,一旦发现智能体在原地打转,就会把主智能体拉到其他策略上。 然而,严格来说,这个满分成绩并不算数。英伟达官方发布三个多小时后,ARC-AGI之父François Chollet就在推特上泼了一盆冷水:在公开演示集上拿到100%,并不意味着在ARC-AGI-3基准测试上拿到100%。这就像你说自己通关了一款游戏,实际上只打完了新手教程。根据ARC Prize官方的说明,公开集根本就不是用来评分的,半私有集和私有集才是唯一有效的部分,而AVO的成绩单上这两项都是空白。更微妙的是,这已经是六周内第三个满分结果了——Tycho在七月底率先拿下,VISTA在8月5日又拿了一个满分,AVO是第三个。三方解决方案完全不同,但驱动模型全都是Claude Opus 5。越来越多的人在宣布AGI已经实现,但真正有能力造出AGI的,似乎还是只有那两家公司。而这张王牌,至今还没有人真正打出来。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · eu.36kr.com

内容版权归原作者及 eu.36kr.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容