AI模型在这些智力测试中失手,你能做得更好吗?
2 天前 1 阅读来源:MIT Technology Review
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
AI再聪明,也怕这几道“脑筋急转弯”:从空间推理到文字陷阱,人类依然有优势
人工智能的发展史,几乎就是一部与谜题较量的历史。早在1959年,IBM计算机科学家亚瑟·塞缪尔就通过一个会下跳棋的算法普及了“机器学习”这一概念。此后,国际象棋、围棋等棋类游戏,以及各类逻辑谜题,都成了检验AI智能水平的“试金石”。从纯粹的解题能力来看,AI的进步速度惊人。2024年底,哥伦比亚大学的科学家团队发现,即便是最顶尖的模型,也只能解开18%的《纽约时报》经典连线谜题;而到了2025年初,部分模型已经能近乎完美地解答这类题目。
然而,谜题的价值远不止于展示AI能力的突飞猛进。通过观察AI在哪些题目上栽跟头,哪些题目上人类依然能碾压机器,我们得以一窥这项技术的真实短板。尽管模型能力不断跃升,但它们在处理经典谜题的细微变体时依然会犯糊涂,尤其是在视觉和空间推理领域,表现堪称“灾难”。以下这些曾让AI“卡壳”的题目,你不妨也来试试看,是能轻松过关,还是和AI一样陷入思维盲区。
空间推理:人类碾压AI的“主场”
如果你做过智商测试,大概率接触过“心理旋转”类题目:判断不同角度的图像是否为同一物体。这类题目对人类来说或许需要一点想象力,但对当前的大语言模型而言,简直是“噩梦”。尽管现在的模型普遍具备图像识别能力,但在处理三维物体的旋转和空间变换时,它们依然表现得极其糟糕。无论是号称能理解物理世界的“世界模型”,还是参数庞大的前沿大模型,都无法像建筑师或机械工程师那样,在脑海中灵活地操纵三维物体。这恰恰说明,AI对物理空间的理解,还停留在非常初级的阶段。
记忆与适应力:训练数据的“双刃剑”
前沿大模型的记忆力堪称“过目不忘”,它们在训练时接触了海量信息,能一字不差地复述大量事实。这在知识问答中是无敌的优势,但在解谜时却可能成为“绊脚石”。当一道新题目与训练数据中的某道经典题高度相似时,模型往往会忽略其中的关键差异,直接套用“背下来”的答案。2024年,谷歌和伊利诺伊大学厄巴纳-香槟分校的研究人员就发现,在经典的“骑士与无赖”逻辑谜题上,只要对题目做微小的改动,模型的正确率就会大幅下滑。同样,在名为SimpleBench的测试中,人类一眼就能看穿的文字陷阱,却能让顶级模型纷纷“翻车”。这提醒我们,AI的“聪明”有时只是基于统计的“死记硬背”,而非真正的逻辑推理。
抽象与视觉推理:二维世界的“盲区”
AI不仅在三维空间上犯难,在二维的抽象图形推理上同样力不从心。最著名的AI谜题基准测试ARC-AGI,要求模型从一系列示例中推断出抽象的、通用的规则。这类题目对人类来说,往往是一眼就能看出的规律,但对模型而言却极具挑战。模型在ARC-AGI上的表现,直接反映了它们在抽象思维和模式识别上的局限。这些测试共同揭示了一个事实:AI的智能是“偏科”的,它在处理语言、数据和已知模式上远超人类,但在面对需要真正理解物理世界、进行逻辑变通和抽象归纳的任务时,依然与人类智能存在显著差距。所以,如果你在这些谜题上战胜了AI,不必谦虚,这恰恰证明了人类认知的独特性和灵活性——至少在目前,这是机器难以企及的。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
