Echoverse:为计算机代理打造深度演化环境
1 小时前 1 阅读来源:Microsoft Research Blog

AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
微软研究院近日发布了一项名为Echoverse的新研究,专门为“计算机使用代理”(computer-use agents)构建了12个高保真训练世界。这项研究的核心思路是:与其堆砌大量低质量的模拟环境,不如精心打造少数几个深度、逼真的世界,让AI代理在其中真正学会操作复杂的软件界面。实验结果显示,一个原本表现平平的9B参数模型,在Echoverse中训练后,其基准得分从36.5%飙升至67.1%,性能几乎翻倍,与GPT-5.4的差距缩小到仅14个百分点。
为什么Echoverse如此有效?关键在于它解决了当前AI代理训练中的一个根本矛盾:人们真正希望自动化的操作,如电子邮件、银行系统、健康记录和云服务后台,都是封闭的、有状态的系统。在这些真实系统上训练AI,每一次点击都会产生实际后果,无法重置,风险极高。因此,Echoverse的做法是重建这些系统的“合成世界”,在这个世界里,数据库是可控的,状态是真实的,但可以安全地破坏、快速重置,并且通过底层数据而非截图来评判AI的操作是否正确。这12个世界被分为两类:10个“深度领域世界”和2个“能力世界”。每个世界都专注于一个特定的、AI代理普遍感到棘手的UI控件,比如日期选择器和嵌套筛选器,并以多种形式反复出现,迫使代理真正理解其底层逻辑,而非死记硬背。
这项研究对跨境电商卖家和AI从业者有着直接的启示。对于卖家而言,这意味着未来可能出现更强大的自动化工具,能够可靠地操作各种复杂的后台系统,如亚马逊卖家中心的广告管理、库存调整或客户服务界面,而不仅仅是简单的网页抓取。对于AI从业者,Echoverse的核心理念——即“环境-模型-验证器”三者协同进化——提供了一种新的训练范式。研究团队发现,仅仅增加世界的数量并非关键,关键在于不断迭代已有的世界,让任务变得更难、更精确,同时让验证器(verifier)能更准确地判断结果。通过强化学习(RL)而非简单的模仿学习,模型不仅学会了如何完成任务,还学会了用更少的步骤达成目标。目前,微软已在GitHub和Hugging Face上开源了其中四个世界及其代码、数据和验证器,供社区研究使用,这无疑将加速整个领域在“高保真计算机使用世界”上的探索。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
