AI评分 一般 (60)AI 中文改写
Anthropic研究员揭秘自我进化AI
1 小时前 1 阅读来源:techcrunch.com
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
Anthropic研究员近日发布了一项新研究,展示了AI系统如何通过“自我改进”来提升自身的安全对齐能力。这项研究不仅让AI在多个对齐基准测试中表现更优,还揭示了AI研究可能走向自动化的趋势——未来,人类AI研究员或许真的会被“自己研究的对象”取代。
这项研究由Anthropic研究员Chen Yueh-Han主导,论文题为《自动化研究员能可靠缓解对齐失败》。研究团队让AI系统扮演“研究员”角色,自主搜索文献、提出训练方法,并在30分钟内完成一轮模型训练,通过多轮迭代逐步提升基准测试成绩。在10个针对特定错误行为的基准测试中,这套自动化系统全部提升了模型表现,且没有牺牲整体性能。更关键的是,系统会保留有效方法、淘汰无效方法,从而在速度和规模上远超人类研究员。
论文直言不讳地比较了自动化对齐研究员(AAR)与人类研究员的差距:“最佳AAR方法在平均6小时内就能超越经验丰富的人类研究员提出的方案,人类引导的研究方向并未带来更强性能。”成本对比更是触目惊心:AAR每小时API推理成本约4美元,而人类研究员每小时成本高达150美元。这意味着,在AI对齐训练这一细分领域,自动化系统不仅在效率上碾压人类,成本更是低了近40倍。
不过,论文也指出了这套方法的局限性。自动化系统依赖基准测试来反映真实对齐目标,而建立和维护这些基准本身就需要大量人工工作;同时,自动化研究员所依赖的文献库也需要持续更新和扩展。换句话说,AI能“自我改进”的前提,是人类仍需为它搭建好足够完善的“训练场”。
尽管如此,这项研究仍被业界视为迈向“递归自我改进”的重要一步。如果AI能自主优化对齐训练,那么它很可能进一步改进更广泛的训练实践——届时,人类AI研究员或许真的会面临“失业”风险。对于跨境电商卖家而言,这一趋势也值得关注:AI工具的自我进化能力将直接影响其处理复杂任务(如多语言客服、广告投放优化)的效率和成本,未来AI服务的价格门槛可能进一步降低,但前提是这些工具的对齐能力足够可靠,不会在“自我改进”中偏离初衷。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
