近期,日本古书市场掀起了一场颇具戏剧性的抢购风潮。身份不明的买家如潮水般涌入日本各地的二手书店和旧书集市,展开了一场几乎无差别的全面收购。从历史文献到哲学经典,从医学和法律专著,到地方志和数十年前的政治小册子,所有带有铅字的实体书籍都纷纷被纳入购物清单。这些古旧书店的库存在短时间内被一扫而空,虽然下单的账号各不相同,最终却都悉数汇聚到同一个国际转运站。
海关信息揭示了这一现象的部分真相:累计已有超过50吨的日本旧书被整箱包装运往美国。根据书籍的正常重量计算,这相当于10万册纸质书籍被一次性搬走。这些覆盖着灰尘的古籍,其真正的去处并非图书馆或私人收藏,而是直接被送入硅谷那些顶尖人工智能大模型的数据仓库。
如今,互联网内容已被大量消耗殆尽,全球市值以万亿美元计的高科技公司不得不在遥远的海岸寻找被遗忘的旧货,其原因在于大模型技术发展的瓶颈——所谓的“数据墙”。社交媒体上的争辩、论坛中的段子,以及垃圾信息,已然经历了一轮又一轮的筛选与消耗。而更令人不安的是,网络环境的“毒化”趋势加重了这一窘境:如果继续依赖这些二手数据,大模型将可能面临严重的“模型崩溃”和“智力近亲繁殖”,算法逻辑不断倒退,生成的结果愈加同质化、甚至荒谬,造成一代不如一代的恶性循环。 LEWIN乐玩
在此背景下,那些深藏于旧书店的几十年乃至上百年未被数字化的纸质书籍,显得格外珍贵,成为科技巨头眼中未被现代算法污染的高质量语料。这场针对纸质书籍的跨国收割,其过程既冷酷又高效。海外科技公司在获取这些书籍后,通常实施工业化的处理流程:重型切纸机精准切去书脊,将整本书分解为单独的页码,然后塞入工业级高速扫描仪进行转化。
这一简单而粗暴的“拆书炼丹”模式成为解决数据不足的终极手段。这一批旧书之所以被锁定,逻辑非常实际:其纸张保存良好、排版规范,OCR识别的准确率极高,更为关键的是,这些书籍中蕴含了大量未被现代网络篡改的严密逻辑思考、复杂词汇和细腻的历史事实。在这个万物互联的数字时代,最安全的知识避难所不再是云服务器或加密芯片,而是那些经久不衰、未曾接入网络的泛黄纸质书籍。