Claude当真是焚书坑儒吗?

0 评论 124 浏览 0 收藏 13 分钟

Anthropic 因拆解纸质书训练 AI 引发热议,背后却揭示了一个关键趋势:AI 竞争正从模型能力转向高质量数据。本文深入解析 AI 训练的数据加工链,并探讨独家数据如何成为 AI 壁垒,以及普通人如何通过整理个人知识,让 AI 真正理解自己。

最近,Claude 背后的 AI 公司 Anthropic 因一项内部项目引发争议。

据公开披露的信息显示,Anthropic 曾大量购买纸质书籍,通过拆解书本、扫描内容的方式,将这些资料用于 AI 模型训练。这种做法被称为“破坏式扫描”,也让不少人第一时间联想到秦始皇的“焚书坑儒”。

但如果把目光从争议本身移开,会发现这件事背后隐藏着一个更值得关注的问题;

为什么今天最先进的 AI,不直接学习互联网上已有的信息,反而要花费巨大成本重新处理一本本纸质书?

答案可能藏在人类知识本身的价值里。

当 AI 开始重新读书的时候,人类也该重新认识知识的价值了。

01 AI需要高质量数据

过去几年,很多人认为,训练 AI 最重要的条件就是拥有足够多的数据。

毕竟互联网已经积累了几十年的信息,从新闻、论文,到论坛、博客和各种公开资料,人类创造的大量内容都已经被数字化。

如果 AI 需要学习知识,为什么还要花费巨大成本购买纸质书籍?

答案在于:AI需要高质量的信息,而不是互联网中唾手可得的海量信息。

互联网最大的优势是开放,它让人类第一次拥有了近乎无限的信息来源。

但开放也意味着信息质量参差不齐。

网络中既有经过长期研究、验证的专业知识,也存在大量重复内容、错误信息、碎片化观点,甚至为了流量而制造的低价值内容。

对于人类来说,我们可以依靠经验、专业能力和判断力,筛选哪些信息值得相信。

但对于 AI 而言,训练阶段接触的数据,会直接影响它最终形成的能力。

如果模型学习的是大量低质量内容,它得到的并不一定是更强的理解能力,而可能只是对混乱信息的重新组合。

这也是为什么,AI 公司开始重新重视书籍、论文、专业数据库等内容。

一本经过作者长期研究、出版社审核、市场检验的书籍,背后凝聚的是人类多年积累的知识结构。

它的价值并不在于文字本身,而在于其中包含的逻辑、经验和经过筛选后的认知体系。

所以,Claude 拆书事件真正值得关注的地方,并不是 AI 为什么选择处理纸质书,而是:在信息越来越丰富的时代,真正稀缺的资源正在从“数据数量”转向“数据质量”。

AI不缺信息,缺的是值得学习的信息。

02 AI训练分为五步

既然AI需要的是高质量信息,那么下一步的问题就是:一本纸质书,究竟要经过怎样的处理,才能成为AI能力的一部分?

从一本摆在书架上的实体书,到我们最后从Claude口中得到一个答案,中间还隔着一条完整的数据加工链。

第一步,是数据收集

AI公司会系统性收集书籍、论文、专业文档等资料。模型最初接触什么,决定了它之后能够理解什么。

第二步,是数据数字化

纸质书无法直接用于训练,需要先被拆解、扫描,再通过文字识别,将纸张上的内容转化成可以处理的文本。

Anthropic采用破坏式扫描,目的就在于提高大批量扫描的效率。切掉书脊后,书页可以被快速分离并送入扫描设备。只是完成这一步后,原来的实体书也失去了继续保存的可能。

第三步,是数据清洗

扫描出来的内容并不能马上使用,其中可能存在乱码、重复段落、识别错误和无效信息。只有经过筛选、去重和校正,高质量内容才会被保留下来。

第四步,是模型训练

整理后的数据会被输入模型。模型不会像人一样逐页阅读,也不会把整本书原封不动地存进去,而是从大量文本中学习词语、概念以及不同知识之间的关系。

第五步,是能力形成

当模型接触了足够多经过筛选的信息,它才逐渐具备理解问题、组织语言和生成答案的能力。

所以,AI真正学习的是文字背后的知识结构而非具体的文字。

图源:LIYIHE

03 数据将成为AI壁垒

当书籍、论文和专业资料经过处理进入模型之后,竞争的重心就开始从“模型能力”转向“数据来源”。过去AI公司的优势主要来自模型规模、参数和算力,但这些差距正在被快速拉平:架构可以复现,算力可以购买,公开数据也会被反复使用。真正拉开差距的,是那些无法公开获取的独家数据。

一家医院积累多年的病例,比如某些罕见病的长期治疗记录,一所大学保存的研究资料,一家企业沉淀的业务记录,以及专业人士长期形成的经验,都很难通过互联网直接获得。

这些内容的价值,在于它们具备三个特点:

第一,别人无法轻易获取。

第二,它们来自真实场景。

第三,它们包含公开资料中没有的经验和判断。

这意味着,未来AI公司的核心竞争力,可能不再只是拥有多强的模型,还包括它能接触到哪些独家知识。

公开数据决定一个AI能不能达到行业平均水平,独家数据决定它能不能继续向上突破。

而Claude拆书事件,本质上就是Anthropic在提前争夺这种“独家数据入口”

未来,出版社、科研机构、医院、学校和专业企业,都可能从内容提供者,变成AI时代的数据资产拥有者。

模型决定AI能走多快,数据决定AI能走多远。

而当公开信息被所有AI反复学习后,真正有价值的,将是那些尚未公开、无法复制、长期积累的知识。未来AI的战争,是高质量数据的竞争。

04 人人都能训练AI

未来AI之间的差距来自独家数据,普通人与AI之间的差距,同样来自个人数据。

这里的个人数据,既包括你积累的专业知识,也包括你的信息输入维度、判断倾向、工作习惯和表达方式。

这些内容共同决定了AI对你的理解程度。

我之前有两个Claude账号被封,现在只剩下一个备用账号。经历过账号失效后,我开始意识到,把记忆和工作习惯全部留在某一个AI里,风险其实很高。

账号一旦出现问题,过去积累的对话、偏好和协作方式,也可能跟着消失。

后来,我把自己的记忆和Skills全部整理成Markdown文档,单独存放在电脑文件夹里。

现在无论使用ChatGPT、Claude,还是其他AI办公工具,只要把这套资料交给它们,使用体验对我来说已经没有太大区别。

这套资料可以分成三个部分。

第一部分是个人记忆,包括你的职业背景、长期目标、内容定位、目标读者和稳定偏好。

以我为例,我会告诉ChatGPT,我的公众号叫《识岛》,内容分为四个栏目:社交观察(击破信息茧房,塑造三观)、心智成长(自我觉醒,打开心智)、创业思考(交换价值,获取社会地位)、知识付费(提升认知与技能并转化为财富);文章需要先交代热点,再提供信息增量、认知增量和行动方法;章节标题控制在十个字以内,还要是一句意思明确的结论。

第二部分是专业知识,包括你过去写过的文章、行业资料、项目复盘、案例和方法论。

这些资料决定了AI回答问题时能够调用什么。如果只告诉ChatGPT“帮我写一篇知识付费文章”,它给出的往往是公开信息的重新整理。把真实业务经验、平台规则和历史文章一起交给它,输出才会逐渐接近一个长期从业者的判断。

第三部分是Skills,也就是你做一件具体任务时的“操作方法”。

比如我会单独整理一份《识岛公众号写作Skill》,里面直接写清楚怎么写一篇文章:开头怎么切入热点,第一部分怎么补充信息,后面怎么推进逻辑,哪些句子不能用,金句要长什么样。

记忆告诉AI“你是谁”,专业知识告诉AI“你知道什么”,Skills告诉AI“你怎么做事”。

在ChatGPT里建“识岛内容创作”项目,放入记忆、Skills和代表文章。

写作时先读取个人信息,再调用写作规则和历史风格。初稿不合适就持续修改,把有效反馈沉淀进Skill。

长期下来,AI会形成稳定方法论。文风也可用同样方式拆解训练。核心就是把你脑子里的经验整理出来,变成可以保存、可以随时调用的资料。

当这些资料始终掌握在自己手中,模型可以更换,账号也可以更换,你长期积累的能力不会跟着消失。

05 结语

Claude拆书看似是一场争议,背后反映的却是AI正在重新寻找高质量知识。

当公开信息越来越多,真正稀缺的反而是那些经过长期积累、验证和沉淀的数据。对AI公司来说,它们会成为新的竞争壁垒;

对普通人来说,经验、判断和方法,同样会成为个人资产。

所以,与其只向AI索取答案,不如开始整理自己的记忆、知识和Skills,让AI真正理解你、协助你。

但无论AI掌握多少资料,它学习的依然是已经发生的内容。新的问题、新的假设和新的认知,仍然需要人去提出和验证。

AI学习的是过去,人类创造的是未来。

本文由@李逸和 原创发布于人人都是产品经理,未经作者许可,禁止转载。

题图来自Unsplash,基于CC0协议。

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!