AI工具AI评分 一般 (57)AI 中文改写

AI尚不能自主研究——《自然》

16 小时前 1 阅读来源:nature.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

人工智能在AI研究领域本身已经取得了不少突破,比如让现有算法变得更聪明,甚至能写出新算法。但根据7月底发布在预印本平台arXiv上的一项研究,计算机目前还无法真正取代人类研究者。论文合著者、普林斯顿大学计算机科学家Sayash Kapoor直言:“我认为完全自动化的开放式研究目前还看不到曙光。” 这项研究针对的是由东京Sakana AI公司团队主导的“AI科学家”系统。该系统于2024年首次亮相,旨在实现从想法生成到论文撰写和自我评估的全流程自动化,其改进版本的结果已于今年3月发表在《自然》杂志上。在测试中,AI科学家被要求研究机器学习中的常见陷阱,它产出的三篇论文被提交至某会议研讨会进行同行评审,其中一篇的分数达到了接收标准。但Kapoor指出,同行评审本身并不可靠,尤其在AI研究领域,很难真正衡量论文质量。更关键的是,不少研究者质疑,从想法到发表的完全自动化流程目前是否真能带来突破性成果,认为它更擅长优化已有技术,而非开创新方向。 为了用比同行评审更严格的标准检验AI,Kapoor团队设计了一个名为“影子评估”的新挑战。他们从今年Neural Information Processing Systems会议中挑选了两篇论文,让AI工具基于每篇论文的研究问题独立开展研究并撰写论文,然后请原论文作者亲自审查AI的输出结果。相比匆忙的同行评审者,原作者显然更有能力和动力去深挖AI产出的漏洞。团队构建的AI系统基于Anthropic的大语言模型Claude Opus 4.8,并整合进一个修改版的代理系统OpenClaw中,外层再包裹一个包含通用指令和进度检查机制的“脚手架”。系统配备了多种工具,包括创建子代理、访问互联网、调用软件库和计算资源运行实验,以及模拟同行评审的软件。每篇论文,AI系统有6天时间和3000美元(约合2.1万元人民币)的计算额度。 在具体任务中,团队让AI系统分别设计一个精确控制聊天机器人性格的方法,以及一个针对特定类型神经网络的故障检测器。结果让原作者们感到意外:AI在工程执行层面表现出色,能连续运行数百次实验而不陷入无法解决的错误循环,文献综述做得扎实,还发现了一些次要结论。它甚至能自我纠正错误陈述(即所谓的“幻觉”),也没有试图走捷径或“奖励黑客”,尽管作者们原本预测它可能会这么做。 但AI系统在两个核心任务上的表现却不及格,原论文作者给出的总分分别只有2/6和1/6。典型的失败模式是:系统会挑选几个假设进行探索,但过早锁定其中一个,当方法行不通时又缺乏足够的回溯调整。随后的自我审查也不够严格,导致系统固守最初的选择,不断缩小自己的论点范围,直到最后说不出什么有价值的东西。换句话说,AI在“做研究”这件事上,目前还停留在“能干活”但“干不好”的阶段——它能高效执行实验和文献工作,但在判断研究方向、及时纠错和提出真正有意义的结论上,距离人类研究者还有明显差距。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · nature.com

内容版权归原作者及 nature.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容