AI工具AI评分 头条 (69)AI 中文改写

微软高管称AI抓取是“人类史上最大规模劳动力盗窃”

6 小时前 1 阅读来源:techcrunch.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

微软高管曾私下把AI抓取内容称为“人类历史上最大的劳动窃取”,这一说法随着纽约时报诉OpenAI和微软版权案的最新解封文件被曝光。三年前,纽约时报起诉两家公司未经授权使用其内容训练生成式AI模型,如今案件进入新阶段,一批此前被涂黑的内容被公开。文件显示,微软高层内部将公司的AI训练实践描述为“盗窃”,OpenAI自己的领导层也承认其AI模型对出版商和记者构成“生存威胁”——而这些人的作品正是训练这些模型的原料。更关键的是,文件详细披露了两家公司如何绕过付费墙、通过大规模抓取构建训练数据集,并故意从训练数据中删除版权声明。需要注意的是,这些新信息大多来自纽约时报自己的陈述文件,而非仍处于密封状态的基础证据,引述内容也脱离了原始语境。 这起诉讼的核心争议在于:AI公司能否合法使用受版权保护的材料训练模型。目前法律上没有明确答案,但法官总体上倾向于支持AI公司关于训练属于“合理使用”的主张——这一法律原则允许在特定情况下未经许可使用版权作品,比如戏仿、新闻报道或批评。本月早些时候,特朗普政府还提交了一份简报,为OpenAI未经授权使用版权材料训练大语言模型辩护。然而,最新曝光的内部承认与OpenAI的合理使用抗辩存在明显矛盾,尤其是合理使用原则要求使用行为不能替代或损害原作品的市场。微软自己的数据显示,其Copilot“答案引擎”导致纽约时报域名的点击率相比传统必应搜索下降了高达93%。微软应用科学总监Brent Hecht在2024年1月撰写的内部演示文稿将这种下滑描述为“末日循环”,会“同时损害我们模型的性能和整个网络”。文件引述的微软文档写道:“一个终端产品威胁到其核心供应商的经济基础,这是极不寻常的,但这正是我们为LLM业务在‘内容供应链’上创造的局面。”微软CEO萨提亚·纳德拉今年早些时候在证词中也表示,“任何付费墙后的内容都应该由想要使用它的人获得许可……用于 grounding 或训练”,并明确如果他知道OpenAI抓取并训练了付费墙后的信息,他会“行使微软的权利要求OpenAI重新训练其模型”。其他承认则冲击了合理使用测试的其他支柱:OpenAI的ChatGPT负责人Nick Turley在内部沟通中写道,出版商面临来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上具有替代性”,并且“随着它们变得更好,替代性会越来越强”。OpenAI总裁Greg Brockman称这些模型“非常擅长新闻”。纳德拉今年早些时候在宣誓后也同意,与聊天机器人对话“已经替代了……在AI平台上直接给你信息,而不是需要去原始来源”。这种措辞说明该技术可能直接与原作品竞争,而非转化它。一份微软文档指出,生成式AI存在“真实风险”,可能“严重扰乱那些生成了基础模型训练数据的人们的就业”。复制的规模也令人震惊。文件首次披露,仅OpenAI的中期训练数据集就包含超过91,692份作品副本。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · techcrunch.com

内容版权归原作者及 techcrunch.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容