AI公司销毁书籍的真相 | CBC
3 天前 1 阅读来源:cbc.ca
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
人工智能公司Anthropic为了训练其聊天机器人Claude,购买了数百万本实体书,并对这些书进行了“破坏性扫描”——即拆解书本逐页扫描后不再保留原书。这一做法在出版界和作者群体中引发了广泛争议,也让外界重新审视AI公司获取训练数据的灰色地带。
所谓“破坏性扫描”,是指将实体书拆开、裁切,用高速扫描仪逐页数字化,完成后这些书通常无法再复原或使用。Anthropic此举并非孤例,多家AI公司都在通过购买实体书来规避版权争议,因为公开网络上的文本质量参差不齐,而书籍内容结构严谨、信息密度高,是训练大语言模型的理想素材。但问题在于,这些书籍大多仍受版权保护,AI公司并未获得作者或出版社的明确授权,只是利用“购买实体书”这一物理行为绕开了数字版权限制。
对中国跨境电商卖家和AI从业者而言,这一事件释放出几个信号:其一,AI训练数据的版权问题正在成为全球性监管焦点,未来数据获取成本和法律风险只会更高;其二,依赖高质量文本训练的AI模型,其“知识来源”并非免费午餐,企业若自建垂直模型,需提前规划合规的数据获取路径;其三,出版行业与AI公司的博弈可能催生新的授权模式,比如按次付费或订阅制数据许可,这或将改变内容产业的商业逻辑。目前,Anthropic尚未就书籍来源和授权情况做出详细说明,但业内普遍预期,类似争议将推动更透明的数据披露规则出台。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
