**「廉颇老矣 尚能饭否?AI 巨头为何疯狂抢购 18 世纪古籍?」**
近日,全球二手书商迎来了一波前所未有的「黄金时代」。据腾讯新闻 8 月 16 日报道,世界各地的书商纷纷收到了来自 AI 公司的巨额订单,订单内容五花八门,甚至包括 18 世纪的古籍。分析人士指出,这极可能是人工智能企业为提升语言大模型能力,急需大量「未被 AI 污染」的原始文本。
小编不禁要问:当 AI 巨头们开始「囤书」,我们离那个由算法主导的未来还有多远?
01 看似荒诞,实则必然:AI 的「数据饥渴症」
据媒体报道,英国诺森伯兰郡的巴特书店店主斯图尔特·曼利表示,他过往每周仅能卖出两三千本书,如今却收到了来自 Anthropic 公司「巴拿马计划」的异常巨额订单。分析人士认为,AI 公司正试图从互联网上被 AI 生成内容「污染」的数据中「脱敏」,转而寻找「纯净」的人类原始语料。
这一现象的背后,是 AI 行业对「数据质量」的极致追求。随着互联网上 AI 生成内容的泛滥,训练数据的「纯净度」成为制约大模型能力提升的关键瓶颈。据第三方数据显示,互联网上已有相当比例的内容为 AI 生成或受其影响,这迫使 AI 公司转向「未被污染」的实体书籍。
02 古籍成新宠:当「文化遗产」成为「训练资产」
公开资料显示,18 世纪的古籍不仅内容珍贵,且多为未经现代编辑篡改的原始版本,其语言风格、词汇使用与现代 AI 训练数据存在显著差异。分析人士指出,这种「时间胶囊」式的数据,能为 AI 模型提供跨越时空的「语言锚点」,有助于提升模型对自然语言复杂性的理解能力。
然而,这一趋势也引发了伦理争议。有评论指出,AI 公司对古籍的「垄断式采购」,可能使这些珍贵的文化遗产被「私有化」,进而影响公众对知识的自由获取。据媒体报道,部分古籍已被 AI 公司批量采购,其后续用途尚不明确。
03 未来已来:AI 与人类的「数据战争」
分析人士认为,AI 公司对高质量数据的争夺,将从「实体书」扩展到「数字内容」,甚至「个人数据」。据公开报道,多家 AI 公司已开始构建自己的「数据飞轮」,通过垄断优质数据来巩固竞争优势。
然而,这一趋势也带来了潜在风险。有分析人士警告,如果 AI 公司过度依赖「单一来源」的高质量数据,可能导致模型的同质化,进而削弱其创新能力和多样性。此外,数据垄断还可能加剧「数字鸿沟」,使缺乏数据资源的中小企业和开发者处于不利地位。
依点评:
AI 公司抢购古籍,看似荒诞,实则是一场关于「数据主权」的无声战争。当 AI 巨头们开始「囤书」,我们或许该思考:在算法主导的未来,谁将掌握知识的定义权?
**你认为,AI 公司应该为使用古籍支付更高的「文化补偿金」吗?欢迎在评论区留言讨论。**
免责声明:本文由AI基于公开网络信息自动生成,内容可能存在信息误差,仅供参考,不构成投资或决策建议。相关数据请以官方权威来源为准。
