大模型终于露出了最原始的獠牙:它们开始吃纸了!
东京神田神保町,这条街摆了上百年的旧书摊。店主们近来发现一件怪事:进店的人不挑作者,不看品相,封面磨破、书脊泛黄、扉页有涂鸦,统统照单全收。
一天扫走上百本,结账时不问版本,只问还能再凑多少箱。包裹汇向同一个跨境物流集散点,再装柜发往太平洋对岸。
据日媒调查,去年以来已有超过50吨日本二手书籍被批量出口到美国。外媒更早一步曝出,Anthropic启动过一个代号“巴拿马计划”的项目,成批购入数百万册旧书,在工厂里工业切脊、高速扫描、OCR提取文字,然后把原书送进销毁线。
曾经以为扫成PDF,智慧就能在云端永生。结果当互联网被AI生成的垃圾灌满,最干净的语料反而成了落灰的旧纸——数字越繁荣,纸竟成了最后一块净土。

一、不挑品相的大客户
大模型圈有个早已公开的秘密:互联网上能公开抓到的高质量文本,被这几轮大模型吃得七七八八了。
训练下一代模型,胃口是万亿级token起步。维基百科、新闻站点、博客、论坛、公开图书数据库,凡是能爬的干净文本,过去几年被几大实验室反复刮过。剩下那点,要么是重复的,要么是AI自己生成又回灌回去的,要么是锁在付费墙和数据库后面的。
公开互联网这口锅,已经见底。
于是买家把目光从屏幕挪到了纸面上。据网易、钛媒体跟进报道,这批日本二手书成批运往北美,在跨境物流集散换柜之后,被送进专门的处理流水线:切脊、高速扫描、OCR识别成可编辑文本,原书物理销毁。按每本500克粗算,这批书的体量大约在10万册上下。
行业里管这种操作叫“数据清扫”。逻辑并不复杂:网上那点文本已经被嚼过太多遍,再拿来喂模型,喂进去的是“二手货”;而印在纸上、从未上过网的旧书,是干净的、未经互联网污染的“原浆”。

为什么是日本?这里头有一层现实的算计。日本出版业的排版规范、印刷质量、字体统一度,在全球范围内都数得上。一本印于上世纪七八十年代的地方志、判例集、学术专著,纸面清晰、栏距整齐,对OCR来说识别率极高。更关键的是,这类小众资料当年根本没有数字化的商业价值,从来没人把它们扫成电子版,也就从来没进过任何训练语料库。
对模型而言,这就是一座从未被开采过的高纯度逻辑矿。
打个比方,互联网文本像一条被几万人反复淘过的河,河沙里的金子早被筛干净,剩下的多是碎渣和淤泥;而旧书仓库像封存在地下室里、从未开封的原矿,每一册都自带完整的论证结构、术语体系和上下文。OCR把纸变成可计算的token,工业切脊把整本变成可批量处理的散页,两道工序合在一起,等于把物理世界的库存一键搬进了训练集。
从神保町的旧书摊到北美的扫描工厂,这条链一旦被媒体摆上台面,被压了很久的版权问题再次浮出水面。
二、互联网蹭秃之后回头切书脊
AI公司宁可漂洋过海去买旧书、切书脊,是因为它面前横着一堵墙。
这堵墙叫“数据墙”。简单说,能用来训练大模型的人类高质量书面文本,是有限的。Epoch AI做过测算,这类高纯度文本大概会在2026年前后被消耗殆尽。这不是预言某一天突然断粮,而是说越往后,找到没被用过的干净文本越难、越贵。
更麻烦的是第二层,业内叫“模型塌陷”。模型生成的内容被发到网上,下一批模型再从网上抓回来训练,等于拿自己的生成物喂自己。几代下来,文本多样性会越来越窄、噪声越来越大,模型像是在反复咀嚼同一团唾沫,越学越僵。
这就是为什么旧书突然香了。它同时解决两个问题:一是总量足够大,全球印刷品的存量以百亿册计;二是干净,这些文字由人在几十年前写下、排版、印刷,没有经过AI回灌,逻辑链条完整。日本旧书里那些地方志、判例集、学术论丛,恰好是从未上网的长尾——写作者当年认认真真论证,印刷厂认认真真排字,OCR现在认认真真识别,出来的就是一段段结构严密、术语准确的高纯度语料。
但切书脊这件事,从曝光第一天起就裂成了对立的两派。
一派认为这根本不构成问题。据中国经济网报道,已有美联邦法官在类似案件中认定,扫描合法购入的纸质书用于文本挖掘,属于“合理使用”。何况纸质书本来就该被数字化保存,否则虫蛀、水浸、散佚,几百年后什么都留不下。旧书在店主手里多半也是积灰,被扫成电子版反而是延长寿命。
另一派的立场针锋相对。孤本被切脊、被送进销毁线,物理意义上就永久消失了;出版社和作者既没有授权,也没有拿到任何补偿。这不是保存,是把文化样本当工业原料吃掉。书页被送进销毁线的那一刻,这本书作为一个物理存在的唯一性,就从世界上被抹掉了。
两派都没有说错。合理使用的边界在哪里,孤本与绝版书是否该被区别对待,目前的法律和伦理都还没给出清晰答案。可以确认的只有一件事:数字世界曾经许诺“一切皆可永存”,到头来却转头朝物理世界伸手夺粮。扫成PDF的智慧,最终成了模型盘子里的口粮——这本身就是对“数字化即终极保存”那句口号最辛辣的反讽。
三、切纸机铡刀落下之后
把镜头拉远一点,画面会显得格外荒诞。
一家估值逼近万亿美元的科技公司,它下一代模型的竞争力,核心壁垒之一,竟然是能不能从地球另一端的旧书摊,按吨收走那些论斤卖的废纸。算力可以买,芯片可以抢,人才可以挖,但没被污染过的人类书面语料,是有数的。
这是一场发生在21世纪的微妙轮回。过去三十年,人类拼命把纸面上的东西搬进屏幕,以为搬完就万事大吉。结果屏幕那一头被AI自己造出来的内容迅速塞满、迅速贬值,最干净的语言反倒留在了纸面上。
这个逻辑并不会只停留在日本。中文世界同样有海量从未数字化的印刷品:近代以来的地方志、老教材、民国期刊、地方出版社的学术专著,其中大量既没有电子版,也没有被任何合法语料库收录。国内的旧书市场、孔网库房、按吨论斤的纸品集散点,是否也在经历一场神保町式的静默扫货,目前公开报道还很少,但这条产业链一旦跑通,中文语料上的复制几乎是必然的。灰色的版权链、未被授权的作者、被切脊的孤本,这些问题不会因为换了一种语言就自动消失。
真正值得记下的,不是某一家公司买了多少吨书,而是这件事背后那个安静的转向:人类花了半个世纪,试图把文明从纸面搬进硅片;当硅片那一头终于被自己的产物填满,它又回过头来,把纸面当作最后一座矿。
切纸机的铡刀落下,一本昭和年间的地方志书脊断裂,散页被送进每分钟吞吐数百页的高速扫描仪。从这一刻起,这本书不再存在于东京某个旧书店的书架上,不再存在于某间大学图书馆的特藏库里,它只以参数的形式,栖居在某个大模型的权重矩阵里。
发布于:天津
相关推荐
大模型终于露出了最原始的獠牙:它们开始吃纸了!
头部厂商露“獠牙”,机海战术“分食”Others
刺杀那条露脊鲸
为什么NASA要发射一个名叫“露西”的探测器
当开源大模型开始谈分成
汉王科技手写电纸本连发三款:全线加持天地大模型
清越科技取得基于PCB基板的电子纸显示装置专利,降低电子纸显示装置的制作成本
微信宣布上线搜索结果广告,越来越有百度那味了
首批大模型通过备案,更激进的投入开始了
一场新的“革命”已经开始,揭秘OpenAI文生视频模型Sora技术报告
网址: 大模型终于露出了最原始的獠牙:它们开始吃纸了! https://www.xishuta.cn/newsview153849.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
