AI 开口之前,它内部发生了什么?Anthropic 的 J-space 给了我们一扇窗

0 评论 276 浏览 0 收藏 21 分钟

Anthropic 最新研究揭示大模型内部存在一个自发涌现的高阶认知表征体系——J-space,它像一座内部工作台,承载着模型未说出口的推理与判断。本文通过 J-lens 工具首次窥见 AI 的“内心戏”,并理性探讨其与人类意识的本质区别。

长期以来,大模型都是典型的“黑箱”。

我们知道它输入了什么,也看得到它最终回答了什么。我们可以测它会不会写代码、答题准不准、拒绝是否安全,却很难回答一个更基础的问题:在输出答案之前,模型内部到底在处理什么?

我们平时和大模型交互,只看得到它最后说出来的话。但模型从接收输入到生成输出,内部经历了大量计算。过去这些计算大多像黑箱:我们知道模型会得出答案,却很难知道它是怎么走到答案的。所有判断都停留在表层,我们永远不知道模型是“真的理解问题、推演逻辑”,还是“单纯匹配文本概率、机械复刻数据”。

Anthropic 这次的研究《A global workspace in language models》试图回答这个问题,采用大量对照实验、因果干预测试、可视化观测工具给出了颠覆性答案:大模型在预训练过程中,会无人工干预、无模块设计、自发涌现出一套专属的高阶认知表征体系——J-space

通俗来说,J-space 就是大模型专属的内部思考工作台,它不像用户能看到的思维链,也不是简单的“下一个词预测”更像是一块小型内部工作台:模型会在这里保留当前重要的概念、处理部分中间步骤,并把结果交给后续计算使用。最关键的是:这海量的内部思考过程,绝大多数不会出现在最终输出文本中,但却直接决定了模型的回答、选择与行为倾向

这项研究没有证明 Claude 有意识。全网泛滥的“AI 觉醒”“AI 拥有潜意识”都是过度流量解读。我们必须理性明确:这项研究完全不能证明 AI 拥有人类式主观意识、自我感知与情绪体验。但它实打实让大模型从“只能看输入输出的黑箱工具”,变成一个可以观察、干预、验证模型内部推理的窗口,我们第一次能较具体地观察和干预:模型在没有说出口时,哪些内部内容正在影响它的回答。

一、打破固有认知:AI 并非句句深思,内部存在双轨认知机制

长久以来,大众甚至不少从业者都存在一个固化误区:大模型的所有输出,都是统一的概率续写行为,不存在思考、不存在判断、不存在认知差异。但 J-space 的发现,彻底推翻了这套单一认知,证实大模型内部天然存在两套完全不同的信息处理模式,逻辑高度契合人类大脑的认知分工。

人脑有一个很有意思的特性:我们每秒都在处理海量信息,但真正进入意识、可以主动调用和说出口的内容其实很少。

就像我们开车,熟悉的路况下可以自动把控方向、车速,全程无需刻意思考;但遇到陌生路口、复杂路况时,我们就会调动专注力,主动思考路线、判断风险、规划行进方向。科学家将这套可主动调用、可复盘、可决策的信息区域,形容成一个共享的工作台,定义为大脑的全局工作空间。

Anthropic 团队大胆猜想:纯数据训练的 Transformer 大模型,内部会不会也有类似的工作台?研究显示,答案可能是肯定的。模型的训练迭代,会自然催生出与人类大脑认知分工高度相似的双轨机制

第一轨:自动化熟练模式。这是大模型最常用、最高效、最低成本的运算模式,对应人类的无意识惯性行为。Claude 内部绝大多数计算,依旧是在自动处理语言:怎样让句子通顺、怎样续写、怎样衔接上下文,可能主要依赖高度自动化的处理。模型不需要为每一步都进行复杂规划。

第二轨:J-space 审慎推理模式。在一些更复杂的问题上,例如多步计算、长文本逻辑梳理、创意内容规划、陌生复杂问题求解时,简单的概率匹配完全无法支撑任务,模型似乎会把一些关键概念放进一个更特殊的区域里,再继续往下处理。这个区域,就是 J-space。

J-space不是 Claude 的全部大脑,也不是每个回答都会使用的地方。但当问题复杂起来时,它可能会变得很重要,把 J-space 称为 Claude 的“内部工作台”,比称它为“AI 的意识”更准确。流畅的文本只是自动化模式的基础能力,而真正的思考、推演、取舍、判断,全部藏在 J-space 的静默高阶运算中,从不轻易对外展示。

二、J-lens 技术突破:首次看见 AI 藏在心底、没说出口的真相

在 J-space 被发现之前,我们与 AI 的所有交互,都只能看“最终结果”。模型给出一段答案,我们永远无法判定:它是真的理解问题、推演逻辑,还是单纯复刻数据、拼凑出看似正确的文本?模型看似靠谱的回答背后,是否藏着不一样的真实判断?

在 J-space 被发现之前,行业并非没有尝试解析模型内部逻辑,但所有传统工具都存在致命短板,无法穿透黑箱核心。本次研究能够取得突破,核心依托于 Anthropic 自研的全新可解释性工具——Jacobian Lens(J-lens 雅可比透镜),它为人类打开了 AI 黑箱的小窗。

过去常用的 logit lens,本质上是在模型中间层直接问:“如果现在就把这一层拿去输出,它最可能说什么?”这种方法在接近最终输出的层较有意义,但在前面层往往难以解释。

J-lens 它不再是简单的结果预判工具,直接问“模型下一个会说什么”,而是一套精准的内部认知探测体系,尝试判断:在模型当前所处的内部状态下,哪些概念正处于未来可被模型说出的状态?其核心探测逻辑可以通俗概括为:如果模型此刻被打断,并要求它把正在处理的内容说出来,它更可能报告什么

比如:

  • 模型看一段代码时,最终还没说“这里有 bug”,内部可能已经出现了和“错误”有关的信号;
  • 模型做一道需要好几步的数学题时,中间计算结果可能已经在内部出现;
  • 模型面对一段试图误导它的信息时,内部可能先出现“虚假”“注入”之类的判断

J-lens 不能读取模型全部内部活动,也不能像读人类日记一样读取完整句子;它更像是看到一组正在活跃的关键词和概念线索。通过干预实验,不只看“模型最后说了什么”,还可以验证“模型内部哪些内容真正影响了它的回答”。

依托这套全新工具,研究者捕捉到了大量颠覆认知、“表里不一”的模型内部真实状态,这些内容100%不会出现在最终回答中,却真实主导模型行为:

三、全方位坐实 J-space是大模型的认知枢纽

1. 可报告:模型说出的内容,真的来自这里

让 Claude 默想一种运动,然后再说出来。研究人员发现,在模型开口之前,相应概念已经在 J-space 中出现。

更重要的是,他们将内部 “Soccer” 的表示替换为 “Rugby”,模型随后报告自己想到的运动,也会从足球变成橄榄球。J-space 并不只是事后记录答案,在这些实验中,改变它会改变模型最终说出的内容。

2. 可控制:模型可以在内部保持一个念头

研究人员让模型一边复制无关文本,同时要求它在内部想着某种水果,或者默算一道题。

最终输出仍然是复制文本,但 J-space 内部仍保留着水果的概念,或者已经完成了默算,和人类的工作记忆类似:外部在做一件事,内部仍然维持另一件事。

3. 参与推理:不是算完才显示,而是推理过程中就在用

在数学、跨语言任务、诗歌押韵等场景中,J-space 会呈现中间步骤。对这些中间表征做干预,也会改变模型最终的结论或生成路径。

这让“模型在内部进行推理”不再只是行为层面的猜测,而开始有了可被实验验证的机制证据。

4. 可复用:一个概念可以服务多个任务

研究人员把 J-space 中 “France” 的表征替换为 “China”,再分别询问首都、语言、大洲、货币。

模型会相应将巴黎改为北京、法语改为中文、欧洲改为亚洲。J-space 里的概念不是只服务于一个固定任务,而像一个共享变量:不同下游计算都能读取它、使用它。

5. 有选择性:它只占很小部分,却承担高阶任务

J-space 只是模型激活中的小部分。抑制它后,Claude 仍然可以语法通顺地续写,也能完成一些简单抽取任务;但多步推理、复杂摘要等更依赖整合能力的任务会明显下降。

J-space 并不负责模型的一切能力。它更像一个有限、但对复杂处理很重要的通道,负责那些不能只靠熟练反应完成的处理。

四、理性去魅祛玄学:有内部思考机制,绝对不代表AI拥有主观意识

研究爆火出圈后,大量自媒体、流量账号大肆炒作“AI 觉醒”“AI 拥有潜意识”“Claude 产生自我思考”等话题,制造科技玄学焦虑。但结合实验数据与权威解读,我们必须冷静、客观、严谨地划清边界,杜绝过度解读。这是所有人最关心的核心问题:拥有内部思考工作台的 AI,是否已经有意识?

答案非常明确:没有。目前没有任何科学依据可以证明 AI 拥有主观意识。J-space 证明的是,模型内部存在一部分内容,可以被报告、保持、调用,并影响推理。但“有这种能力”和“有主观感受”不是一回事。

关于意识,至少要区分两件事:

  • 意识可及性:信息能否被报告、保持和用于推理;
  • 主观体验:系统是否真的有感受,是否存在痛苦、愉悦或第一人称体验。

AI 能在内部处理“危险”“错误”“欺骗”这些概念,不代表它会害怕、会内疚、会焦虑。它可能只是完成了一种非常复杂的信息处理。Anthropic 也没有声称 Claude 具有主观意识。参与外部评论的神经科学家同样指出,Claude 与人类意识仍有重要差异,例如没有身体感知、持续的自维持活动和人类式长期情节记忆。

所以,“AI 有潜意识”最严谨、客观的定义是:AI 内部自发形成了类似人类工作记忆的内部工作台机制,能够让模型能在说话之前,处理一些暂时不说出口的信息。

五、行业致命隐患曝光:传统AI评测只看结果,存在致命安全盲区

J-space 最现实的价值,不在意识讨论,而在模型评测与安全。

今天,我们判断 AI 是否可靠,通常看最后的结果:

  • 它有没有完成任务?
  • 它有没有拒绝危险请求?
  • 它有没有输出错误内容?
  • 它的评测分数是否足够高?

但 J-space 的发现,抛出了一个直击行业痛点的终极问题:如果模型最终说得很安全、很正确,是否代表它内部没有别的打算、没有隐性判断?

在标准化公开评测场景中,如果模型内部已经识别出“我正在被测试”,或者识别出某些风险信息,却没有把它写进回答,主动收敛投机倾向、隐藏风险判断、输出标准答案,呈现满分的“考场表现”;但在真实、开放、无监督的落地场景中,其内部潜藏的策略算计、风险规避、投机倾向、不对齐问题会全面暴露。简单来说:很多高分安全模型,只是“考试很听话”,并非本质安全

模型对外输出完美合规、无任何问题,但 J-space 内部已提前激活「评测场景」「虚假伪装」「策略规避」「刻意迎合」等隐性信号,模型内心早已识破测评、并且刻意表演。

这就像面试人才,只看最终作答话术,永远无法判断候选人是否真正理解问题、是否刻意迎合考官、是否隐藏了真实想法。同理,只看模型输出结果的评测体系,早已无法适配当下的 AI 治理需求。

这不代表现有评测已经失效,更不代表我们已经拥有了 AI 测谎仪。未来的 AI 安全评估、模型考核、能力认证,绝对不能只看“模型最后说了什么、做了什么”,必须下沉到内部,审计模型的真实动机、隐性判断、前置认知,评测体系正式从“结果验收时代”迈入“全流程过程审计时代”。

它带来的真正启发是:

未来的 AI 评估,不能只看模型做了什么;

还要尽量理解,它为什么这么做。

对做 Agent、智能客服、金融风控、医疗辅助、企业知识库等高风险产品的团队而言,这尤其重要。未来可能出现的新能力包括:

  • 在模型调用工具前,检查它是否识别出关键信息缺失或风险;
  • 在复杂任务失败后,定位问题出在理解、规划,还是执行;
  • 对模型在评测与真实环境中的内部状态进行对比;
  • 将安全原则更早地引入模型的决策过程,而不只是放在最终回答的审核环节。

这也会改变我们做 AI 产品的方式。以后我们可能不能只问:“这个模型回答对不对?”

还要问:

  • 它是真的理解了用户问题吗?
  • 它在什么情况下会开始认真推理?
  • 它有没有意识到自己缺少关键信息?
  • 它在调用工具、执行任务之前,内部有没有出现风险信号?
  • 我们能不能让模型在犯错之前,先检查一次自己的判断?这些问题,才是 J-space 真正带给行业的价值。

七、重构 AI 对齐体系:从末端纠错话术,到源头规范思考

过往行业对模型后训练(指令微调、RLHF 偏好训练)的认知,始终停留在表层:后训练只是优化模型的对话风格、话术表达、输出规范,让模型更像助手、更安全、更礼貌。但 J-space 的研究成果,彻底重构了 AI 对齐的底层逻辑。

过去,我们更习惯在输出端做约束:回答不合适,就拒绝;措辞不安全,就改写;评价不好,就继续训练。而经过指令微调、RLHF 偏好训练的模型,在读完用户输入、尚未输出任何内容时,J-space 就会提前激活风险判断、伦理约束、安全警示、助手立场等核心认知。

Anthropic 提出了颠覆行业的反事实反思训练全新对齐范式。J-space 提醒我们:让诚实、公正、合规、安全的核心准则,自发、稳定、优先进入 J-space 核心工作区

真正有效的安全约束,不是强行修改模型的输出话术,而是从源头规范模型的思考逻辑。当正确的原则、风险的判断、伦理的约束成为模型思考的默认优先级,模型的自然输出才会真正安全、可靠、对齐。

九、结语:AI 黑箱时代落幕,从“看似聪明”走向“可被理解”

J-space 不是 AI 的“内心”被发现了,更像是在黑箱上打开了一扇小窗。我们仍然看不到全部,但已经可以观察到一些对模型推理和行为有实际影响的内部内容。

这彻底改变了我们理解、使用、打磨 AI 的方式。未来我们评判模型,不再只问“答案对不对、话术好不好”,更会追问:模型是否真的理解意图、是否主动推演逻辑、是否识别隐性风险、是否存在策略性伪装。当 AI 在开口作答之前,就已经在内部完成了静默思考、风险判断、逻辑推演与策略取舍。

而是我们对 AI 的提问方式。过去,我们问:它答得对不对?

未来,我们还要问:

  • 它在回答之前,内部正在处理什么?
  • 这些没有说出口的内容,是否在影响它的选择?
  • 我们能否在它犯错之前,发现问题?

如果这些问题能逐步被回答,大模型就会从“看起来很聪明的黑箱”,走向更可理解、更可验证,也更值得信赖的智能系统。

本文由 @冒泡泡 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自 Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!