AI工具AI评分 一般 (50)AI 中文改写

书商误将大单当垃圾邮件,实为AI公司扫描并摧毁它们

2 小时前 1 阅读来源:fortune.com

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

荷兰哈勒姆的一个寻常夏日,古籍书商皮特·德·弗里斯(Pieter de Vries)的邮箱里收到一封不寻常的邮件。发件人自称娜塔莉亚,来自一家名为“2077AI”的公司,想要采购一批“相当大数量”的书籍,附带的表格里列着3000多个国际标准书号(ISBN),要求匹配书名、报价并估算运往中国的运费。德·弗里斯扫了几行就把它丢进了垃圾箱,认定这是垃圾邮件或钓鱼诈骗。直到几周后,一位荷兰记者因调查这起采购请求而联系他,他才得知此事与人工智能有关。“我震惊了!”德·弗里斯对《财富》杂志说。他提供的邮件和表格显示,这3001本书大多是2020年至2021年间由爱墨瑞得出版集团(Emerald Publishing)、爱思唯尔(Elsevier)、威立(Wiley)、劳特利奇(Routledge)和牛津大学出版社(Oxford University Press)等学术出版社出版的,内容涵盖商业、教育、工程、公共政策和医学。德·弗里斯说,其他几家荷兰古籍书商也收到了同样的请求,同样没当回事,“认为是骗局”。虽然这封邮件对他的生意没什么影响,但他指出,对那些专门做二手书批量生意的书商来说,情况可能完全不同。“我做的是珍本和古籍生意,”德·弗里斯说,“这些书昂贵且稀有,我从不做批量交易。” 这封邮件从未提及人工智能,也未说明书籍用途,但它浮出水面之际,正值AI公司越来越不满足于开放互联网上的公开数据,转而寻求高质量书面材料来训练大语言模型。去年夏天,AI公司使用书籍的行为引发公众关注,当时法庭记录披露,Anthropic购买了数百万本实体书,拆掉装订、扫描内容后丢弃原书,以建立可搜索的数字图书馆用于训练AI模型,内部文件称之为“巴拿马计划”。这一过程被称为“破坏性扫描”:先切断书脊,让书页能高速通过扫描仪,之后剩余实体书被丢弃。该案后来达成和解,联邦法官裁定,使用合法购买的书籍训练AI模型属于版权法下的合理使用。Anthropic发言人表示,Claude模型训练数据包括公开网络数据、商业采购数据集和内部生成数据,公司通过常规商业市场购买书籍,其数据采集项目不会获取或销毁珍本或古籍。 法庭记录揭示了书籍到手后的处理方式,却没说明这些公司最初如何采购数百万册实体书。今年早些时候,科技媒体404 Media报道称,ISBNdb——一家以维护国际标准书号元数据而闻名的公司——开始宣传其服务,帮助AI实验室批量采购印刷书籍,数量从1000本到100万本不等。报道称,该公司网站曾写明该服务专为“大语言模型训练需求”定制,“以AI要求的规模交付”。这些网页后来被删除。ISBNdb后来对《财富》表示,该服务从未实际推出。但这一事件揭示了一条隐秘的供应链:AI公司对书籍的渴求,正催生一个专门为它们搜罗实体书的灰色市场。对于像德·弗里斯这样的古籍书商,这封邮件只是数字时代又一个可疑的陌生请求;但对于整个出版行业,AI公司大规模扫描书籍的行为,正在重新定义“合理使用”的边界,也让“书”这一古老媒介在AI时代有了新的命运——被拆解、扫描、数字化,然后被丢弃,成为大模型训练数据中无声的一部分。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · fortune.com

内容版权归原作者及 fortune.com 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容