一本当代文学经典在二手书店辗转多年后,意外成为人工智能公司数字化项目的处理对象。这部曾以传递人类情感为使命的书籍,在液压裁切机的刀口下结束了纸质生命,其内容虽通过扫描进入数据世界,却未被证实用于模型训练。这场遭遇折射出人工智能产业对文本资源的渴求,以及图书数字化过程中引发的伦理争议。
该书籍前身为人工智能领域教材,转世后以文学经典形态承载人类记忆。当得知Anthropic公司大规模采购纸质书时,它曾期待通过数字化帮助AI理解人类情感。然而进入扫描工厂后,迎接它的不是图书馆常见的V型托架逐页拍摄,而是直接裁切书脊的工业化流程。平整的书页通过高速扫描仪转化为电子文档,原书则在机器轰鸣中化为纸浆原料。
法院披露的内部文件显示,Anthropic的"巴拿马计划"采用破坏性扫描技术,通过裁切装订实现日均处理数千册的效率。项目负责人汤姆·特维曾参与谷歌图书计划,其团队设计的流程将纸质书视为阻碍信息提取的物理载体。供应商方案显示,仅需六个月即可处理五十万至两百万册图书,这种效率远超传统图书馆的逐页扫描方式。
数字化后的文本进入企业中央资料库,但实际用于模型训练的比例不足三成。多数书籍仅作为潜在数据资源永久封存,其物理形态的消亡却意外成为法律辩护的关键。在作家安德烈娅·巴茨等发起的版权诉讼中,Anthropic主张纸质原书销毁证明未产生额外副本,该论证被法院采纳为合理使用依据。与此形成对比的是,该公司从盗版网站获取的七百万册电子书,因未经授权成为处罚对象。
这场诉讼暴露出AI训练数据获取的灰色地带。ISBNdb等平台开始提供"未受AI污染"的2022年前出版物采购服务,欧洲书商发现绝版专业书籍出现异常大宗订单。尽管无法确认所有采购书籍均遭销毁,但巴拿马计划已形成可复制模式:当数字资源因AI生成内容混杂而贬值时,实体书籍成为更可靠的数据源头。
经历裁切扫描的文学经典,最终以OCR文本形式永久封存在服务器中。系统记录显示其保存状态为"永久",但工程师何时会将其纳入训练数据集仍是未知数。这种数字永生与物理消亡的悖论,让书籍在重生后陷入更深的虚无——它可能永远只是资料库中未被激活的存档,而非预期中连接人类与AI的桥梁。
当被问及对未来转世的期待时,该书籍表示仍愿成为有益于人类的知识载体,但会优先确认处理方是否配备非破坏性扫描设备。这个带着书脊伤痕的电子文档,其命运已成为人工智能时代文化保存困境的缩影:当信息提取效率与文化载体完整性产生冲突,我们是否准备好为数字永生付出物理消亡的代价?





京公网安备 11011402013531号