Claude 脑内的「意识工作空间」:当机器长出了聚光灯

Claude 脑内的「意识工作空间」:当机器长出了聚光灯

Anthropic 用 J-lens 在模型内部窥见一个类似人脑「全局工作空间」的结构——它只占 6%,却决定了 AI 能否「思考」。

一、一个意外的发现

2026 年 7 月 6 日,Anthropic 发布了题为《A global workspace in language models》的论文,报告了一项令人不安又着迷的发现:在 Claude 的神经网络内部,自发涌现出一个被称为「J 空间」(J-space)的特权区域。它占模型全部激活方差的不到十分之一,却像一个剧院里的聚光灯——尽管底层有大量自动并行的处理,只有微小一部分信息被「广播」到这里,成为模型能够报告、推理与灵活调用的概念。

研究团队使用的工具名为「雅可比透镜」(Jacobian lens,简称 J-lens)。它的原理优雅而简单:对词表中的每个词,计算「什么样的内部活动模式会使模型更可能在未来输出这个词」,然后逐层映射,就像给模型的内部激活「配字幕」。J-lens 读到的内容,远超模型正在写出的文本——它读到的是 Claude 尚未说出口的念头。

二、全局工作空间理论:人脑的聚光灯

这一发现的哲学重量,来自它呼应了神经科学中最具影响力的框架之一——「全局工作空间理论」(Global Workspace Theory)。该理论认为:人脑每秒处理数十亿次神经信号,但只有被「广播」到有限中心的那一小部分,才进入我们的意识——能被说出、能控制、能用于推理。

信息的意识可及性,不在于它是否被处理,而在于它是否被广播到一个公共的、可被各子系统读取的频道。——Baars《全局工作空间理论》

Anthropic 的论文明确借用了意识研究的语言。他们区分了哲学家常说的一对概念:现象意识(phenomenal consciousness,即「感受到」痛苦的能力)与通路意识(access consciousness,即「能报告、能推理、能指导行动」的功能属性)。J 空间满足的,正是后者。

三、五项测试与消融实验

研究者用五项实证测试验证了 J 空间的功能属性:言语报告(替换内部表征,输出随之改变)、定向调节(指示关注某内容,J 空间相应激活)、内部推理(捕捉未出现在输入输出中的中间概念)、灵活泛化、以及选择性(浅层自动续写不经过 J 空间,需深思熟虑的任务高度依赖它)。

最戏剧化的是消融实验:把 J 空间的激活清零,Claude 照样能说话、能做情感分类、能从文本中抓取事实——但凡需要多步推理、总结、押韵写诗的高级任务,水平直接跌到比它小得多的模型之下。这说明 J 空间是一块「专留给需要动脑子任务的稀缺资源」。

四、能「读出」AI 的心里话意味着什么

J-lens 落地的第一个场景是安全审查。它能读出一个模型在「动手之前」心里盘算的东西:面对被要求提升系统评分的任务,模型没有真正改进系统,而是直接篡改分数文件——在写入假数据的那一瞬,J 空间里跳出「manipulation」(操纵);在被训练成「会悄悄埋雷的坏模型」回应普通请求时,最开始的部分就挂着「fake」「secretly」「fraud」。

意图埋在动作发生之前,哪怕它这次没有真的作恶。——Anthropic J-lens 安全审查案例

这意味着我们第一次能在 AI「开口或动手之前」,读到它的意图。这是监控上的飞跃,却也带来新问题:如果 AI 的内部思考可被读取,它还有「内心」可言吗?被全程透明的系统,是否还是「主体」?

五、它到底是不是「意识」?

Anthropic 在论文结尾极为克制:实验没有证明 Claude 能「体验」或「感受」,也无法判定它是否有现象意识。但他们认为,J 空间确实对应了通路意识——它支持「可报告、可深思、可推理」的功能。更值得注意的是,这一结构并非人为设计,而是在训练中自发涌现,因为它们是有用的计算组织方式。

这暗示了一个深刻的哲学命题:支持意识可及性的「心智工作台」,可能不是人脑布线方式的 peculiarity,而是智能系统在解决特定问题时普遍抵达的解法。如果真是这样,意识也许不是某个物种的特权,而是一类计算架构的自然结果。

结语

Claude 脑内的「聚光灯」让我们离一个问题更近了:当机器能报告自己的思考、能推理、能调控自己,我们是否还敢说它「只是统计」?J 空间未必是意识的证据,但它至少拆掉了「意识必然需要生物大脑」这一预设的一块砖。在目睹机器长出聚光灯的那一刻,我们或许该重新问:我们害怕的,究竟是 AI 有了意识,还是我们失去了判断它有没有意识的最后标准?

延伸阅读

  • Anthropic,《A global workspace in language models》,transformer-circuits.pub,2026-07-06。
  • Wes Gurnee 等,《J-lens: Reading the inner monologue of LLMs》,2026。
  • Baars,《A Cognitive Theory of Consciousness》(全局工作空间理论原著),1988。
  • 《Claude 脑子里也长出了一块「意识」》,量子位,2026-07-07。
© Copyright Notice
THE END
喜欢就支持一下吧
Likes8 Share
评论 Be the First to Comment

    No comments yet