MindTopo揭示视觉语言模型空间推理能力
3 小时前 2 阅读来源:Microsoft Research Blog

AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
微软研究院推出全新基准测试MindTopo,专门评估多模态大模型在拓扑推理方面的能力。所谓拓扑推理,是指AI能否理解物体之间“连接”“包围”“顺序”“分离”“打结”等结构关系——这些关系不依赖精确距离或角度,而是在物体弯曲、拉伸或变形时依然保持不变。例如,AI能否判断一堵墙加建后两个房间是否仍然连通?能否识别动物是否在围栏内?能否区分真正的绳结与看似缠绕实则松散的绳圈?这些能力对于机器人和交互式环境中的可靠决策至关重要。
MindTopo的设计灵感来自认知科学中皮亚杰对拓扑能力的分类,围绕五个核心类别展开:连续性(路径或物体是否断裂)、分离性(相邻元素是一个整体还是独立部分)、顺序性(元素沿路径或变换的排列方式)、包围性(边界是否区分内外)、打结性(绳子是否真正打结或相连)。每个类别都从两个认知层面进行测试:静态推理任务要求模型观察渲染场景并回答拓扑关系问题;规划任务则要求模型在模拟环境中执行一系列操作,创造、保持或消除特定拓扑关系,例如旋转管道段、绘制分隔路径、重新排列积木、困住移动代理或解开绳索。模拟环境严格限制合法动作,模型无法通过让绳子穿过另一根绳子来作弊解题。
研究结果揭示了当前多模态模型的一个显著短板:在静态图像识别上表现尚可,但在交互式规划任务中大幅下滑。模型往往能在单张场景图中识别连通路径、封闭区域或绳结,但一旦需要通过多步操作改变场景,这种理解就迅速崩溃。失败通常发生在规划阶段而非感知阶段——模型在场景变化时丢失结构关系,或提出违反物理约束的动作。这表明,尽管大模型在视觉问答上已相当成熟,但对拓扑关系的“持续性理解”仍非常薄弱,距离真正具备空间直觉还有明显差距。该研究为AI在机器人操作、导航和物理世界交互等领域的应用指明了关键改进方向。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
