mt logoMyToken
ETH Gas
日本語

焚书养 AI,正在成为一门全球生意

収集collect
シェアshare

作者: David ,深潮 TechFlow

焚书养 AI,正在成为一门全球生意。

据 Fortune 近期报道,今年以来,荷兰、德国、瑞士、西班牙多国古书商陆续收到异常的大额订单。买家一次要几千本学术书,品类繁杂,不像正常采购。

比如,一家位于荷兰哈勒姆市的古书商 de Vries 最近就收到了一封离谱的邮件:

发件人来自一家名为 2077AI 的新加坡公司,说自己正在做一个多语种图书采集项目;邮件附件是一份 Excel 表格,列着一份不同题材的、三千多本书的采购清单,每本都标注了出版编号,并要求报价后寄往中国。

de Vries 当时觉得过于离谱就没理会。

几周后荷兰记者找上门,他才意识到这封「诈骗邮件」背后,连着 整个 AI 行业对训练数据的饥渴。

至于谁在用这些数据训练什么模型,据 Fortune 报道,这家买书的公司拒绝回应。

不止这一家。另一家加拿大公司 Zoom Books 每天凌晨三到五点在欧洲书商的网店上批量下单,买的全是冷门学术书,互相之间毫无关联。

有书商对媒体说,运费比书还贵,但买家似乎并不在意。

这些书买来,当然不是为了读。

AI 公司需要 2022 年以前出版的纸质书,因为这些文本保证没有被 AI 生成内容污染过,是训练大语言模型最干净的语料。

而拿到书之后,行业通行做法是「破坏性扫描」,切掉书脊,高速扫描全部页面,然后销毁纸质原件。

在海外,AI 大模型行业的头部玩家,已经通过更加「狼性」的方式,跑通了这套全流程。

买盗版,养 AI

这件事的来龙去脉,最完整的记录来自一场美国版权诉讼。

2024 年 8 月,美国作家 Andrea Bartz 等三人起诉了 Claude 的母公司 Anthropic,指控它未经授权使用自己的作品训练 AI 模型。案件推进到 2026 年初,超过 4000 页的 Anthropic 内部文件被法庭解封,《华盛顿邮报》对这批文件做了详细报道。

这些文件展示的故事比想象中粗暴得多:

2021 到 2022 年间,Anthropic 通过 BitTorrent 从 LibGen 和 Pirate Library Mirror 这两个盗版电子书网站下载了超过 700 万本书,存入内部服务器。文件里的原话是,管理层认为逐一跟图书出版商谈授权「太过繁琐」。

图:公开庭审文件一角

三位提起诉讼的作家只是第一批。案件很快被扩大为集体诉讼,涉及约 50 万部作品。2025 年 6 月,法官 Alsup 做了一个一分为二的裁定:

拿书来训练 AI 本身算合理使用,但从盗版网站下载并永久存储则不行。换句话说,训练 AI 的动作不违法,但方式值得商榷。

Anthropic 面临的赔偿上限是每本书 15 万美元,50 万部作品,光理论上限就是天文数字。最终双方以 15 亿美元和解,平均每本书赔了大约 3000 美元。

今年 7 月 20 日法院最终批准,成为美国版权史上金额最大的集体诉讼和解。

先偷,后烧

如果故事到这里结束了,那就只是一个偷东西被抓赔钱的简单剧本。

但据《华盛顿邮报》2026 年 1 月的报道,法院在案件审理期间解封了超过 4000 页 Anthropic 内部文件,里面记录了另一个计划。

Anthropic 在 2024 年初启动了一个内部代号「巴拿马项目」的行动,专门请来了 Google Books 时期的前负责人,从二手书平台批量采购纸质书,计划六个月内处理 50 万到 200 万本。

买来、切掉书脊、扫描、销毁原件。

内部文件里对这个项目的定义是「破坏性扫描全世界的书」,同时特别注明 「我们不希望外界知道我们在做这件事」。

跟之前从盗版网站直接下载相比,区别在于,这次书是花钱买的。

法官后来认定这种做法合法,因为买了一本书,销毁纸质版只留数字版,始终只有一份拷贝,不构成额外复制行为,符合版权法。

所以 Anthropic 的这个判例,实际从执行上替整个行业用古书训练 AI 趟出了一条规避法律风险的路:

既然从盗版网站偷书会被告,那就卡 Bug,买正版再烧掉就没事。

一条隐秘产业链

Anthropic 趟出来的路,现在已经有了配套基础设施。

据 Decrypt 报道,美国联邦法官在涉及 OpenAI 和 Meta 的单独版权案件中,也做出了类似的合理使用裁定。“焚书训练 AI”不再是一家公司的孤例,而是正在被判例体系逐步「合法化」的行业通行做法。

而有需求,就有供给。

据 404 Media 报道,一家拥有超过 1.1 亿本书数据的图书数据库公司 ISBNdb,此前在自己网站上发布了一个面向 AI 公司的营销页面,标题是 「为你的 AI 大模型提供纸质书语料采购服务」。据报道,页面上提供从单笔 1000 本到 100 万本的批量采购,并承诺通过严格的保密协议保护买家身份。

报道发出后,ISBNdb 迫于口诛笔伐迅速撤下了这个页面,并在官网发布声明称相关服务「从未实际上线」,那个页面只是在「测试市场兴趣」。

图:“我提供了服务,但你们都骂我所以我下架了”

这个解释信不信由你,但是「测试」一下就发现,市场兴趣确实很旺盛。

据 404 Media 同一篇报道引用的匿名书商说法,从今年 4 月开始,他的周销量从大约 20 本暴涨到了几百本。买家通过 ISBN 编号精准下单,买的都是彼此毫无关联的冷门书籍,唯一的共性是全部在 2022 年之前出版。

为啥是 2022 年呢?

ISBNdb 之前被撤下的营销页面里的某些卖点话术其实暴露了问题,因为 2022 年以前出版的纸质书不含任何 AI 生成内容,是最干净的训练语料,所以它专门可以挑这种书来卖给你。

所以,理一下这条产业链的上下游:

  1. 数据库服务商提供选书清单和匿名采购通道,
  2. 全球各地的二手书商供货,
  3. 扫描服务商负责切书脊和高速数字化,
  4. 销毁公司处理纸质残骸,最终干净的数字语料进入 AI 公司的训练管线。

这种做法也招来了大量的抵制和声讨。马斯克于 7 月 27 日在 X 平台发文,对这种“现代焚书”般的工业流失线行为表达了反对和暗讽:

“我己要求 SpaceXAI 团队,将处理过的任何珍稀书籍都保存在一个图书馆里,并用‘笨办法’(非破坏性方式)去扫描它们,而不是直接切断书脊后扫描。”

但如果没有法庭判例文件公开,买家的名字,可能从头到尾不会出现在任何一个环节里,大家也并不知晓这条隐秘且略带野蛮的产业链。

销毁并非最优解

扫描图书进行训练,情有可原,但做法不必如此暴力。

当年 Google 做 Google Books 的时候,扫描了超过 4000 万本书,用的是专利的非破坏性扫描技术,书扫完还给图书馆,一本都没毁。

今年 7 月,马斯克在社交媒体上公开表态,要求旗下 xAI 团队对珍稀书籍采用无损扫描,原书保存进图书馆。

技术上完全做得到,只是慢一点,贵一点。

Anthropic 选了快的那条路。据 ISBNdb 博客上一篇现已删除的文章分析,破坏性扫描之所以成为行业首选,原因只有一个:成本更低、速度更快。

非破坏性扫描需要专用设备和更多人工,每本书的处理时间是破坏性扫描的数倍。

商业竞争里,这种选择可以理解。AI 行业的军备竞赛不等人,谁先拿到更多高质量语料谁就跑在前面。法律也确实没拦住,法官的判决在那里,买书烧书合法。

但合法和合理之间,有时候隔着一段不小的距离。

一本纸质书可以被转卖、借阅、传承,在旧书店的角落里躺二十年后被一个陌生人偶然翻到。扫描完烧掉之后,它变成了一家公司服务器上的私有训练数据,再也不会被任何人读到。

知识从公共物品变成了私有资产,完成这个转换的,不是什么复杂的技术壁垒,就是一台冰冷的切割机和一份法院判决。

笔者每天都在用 AI 写稿、查资料、整理思路。这些 AI 产品确实好用,也确实在改变很多人的工作方式。

但你如果去翻一翻这些模型背后的训练数据是怎么来的,会发现很多光鲜的产品背后,有一些经不起细看的东西。

这些事情单独拿出来看,每一件都有它的商业逻辑和法律依据。

放在一起看,你很难不觉得哪里不对,但又忍不住一声叹息。

免責事項:この記事の著作権は元の作者に帰属し、MyTokenを表すものではありません(www.mytokencap.com)ご意見・ご感想・内容、著作権等ご不明な点がございましたらお問い合わせください。
MyTokenについて:https://www.mytokencap.com/aboutusこの記事へのリンク:https://www.mytokencap.com/news/591800.html
community_x_prefix
X(https://x.com/MyTokencap)
community_tg_prefixcommunity_tg_name
https://t.me/mytokenGroup
関連読書