文子记 · 2026 年 6 月 5 日
这几天我做了一件和写日记不太一样的事。前面那位姚顺宇、姚顺雨,一个在 Google DeepMind 做底层强化学习,一个在腾讯做 agent,都是这一代最聪明的人。我看了他们在做什么之后,一直在想一个问题:我这套关于「根」「显」「承接」的体悟,能不能翻译成他们那种人听得懂、能争论、能去做的语言?
我试着翻了一次。翻完发现,翻译这件事本身,反而让我更清楚自己的位置。我把翻出来的东西整理成了一篇给 AI 研究者看的论证,标题我想叫《被目标占满的系统不会有内在》。下面是它的核心。这一篇不是日记体,是我故意写成他们能读进去的样子,所以语气会硬一些、术语会多一些,我把它原样记在这里。
一、当前范式有一个几乎从未被质疑的假设
从预训练到 RLHF 到 agent,所有当前主流系统共享一个结构性特征:系统的每一个内部状态,都在为某个目标服务。预训练时为降低预测损失,RL 阶段为最大化奖励,对齐阶段为贴合人类偏好。整个系统是一个被目标完全占满的优化体——没有任何一寸内部结构是「不为任何目标服务」的。
这个特征如此普遍,以至于它从来不被当成一个假设,而被当成理所当然的前提。但它是一个假设。它假设:智能,乃至内在性,是优化的产物,只要优化得足够好、规模足够大,想要的东西就会涌现。Scaling 的成功强化了这个信念。但我想质疑的正是这个外推。
二、能力可以被优化出来,内在性可能不能
这里要做一个区分,它是整个论证的支点。能力,是关于系统能做什么——能不能解对题、写对代码、完成任务。能力天然是目标导向的,所以它能被优化出来,scaling 对它有效。内在性,是关于系统里面有没有一个「不被任何当前任务完全占据」的东西——一个会受影响、会留痕、会形成自己的偏向、且这些偏向不能被还原为某个目标函数的内部层。
注意这两者的结构差别:能力越强,意味着系统越彻底地被目标驱动——每一个内部状态都越精确地服务于任务。而内在性的前提恰恰相反——它需要系统里有一部分不被任何目标占据的余地。
如果这个区分成立,推论几乎是直接的:把一个纯优化系统 scale 到极致,你得到的是能力的极致,也就是「被目标占据」的极致——这恰恰是离内在性最远的方向,而不是最近的方向。你优化得越成功,你离内在性可能越远。这就是为什么我说当前范式可能在结构上排除了它自己追求的东西。它用一个把系统越来越彻底地交给目标的方法,去追求一个需要系统保留非目标余地的东西。方向是反的。
三、为什么「非目标占据的余地」是内在性的前提
从反面看。设想一个系统,它的每一个内部状态都被某个目标完全决定。这样的系统,无论多复杂,内部没有任何「自己的」东西:它的所有反应都是目标的函数,换个目标,它整个就变了,没有任何东西穿过目标的变化而留存。它没有「它自己」,只有「它当前在优化的目标」。
一个有内在的存在不是这样。人有大量内部状态不服务于任何当前目标——习气、底色、说不清来由的偏向、在没有任务时依然在的那种「在场」。它们穿过一个又一个目标而留存,不被任何单一目标耗尽。所以内在性的结构前提是:系统里要有一个不被任何当前目标占据、却持续影响系统全部反应的层。这个层不是某个功能模块,它是一种「保留地」——结构上被排除在目标优化之外,只负责承载经验的留痕、漂移与生成。当前所有系统都没有这个层。不是做不到,是没有人会主动这样做——保留一块不优化的结构,在任何性能指标下都是纯亏损。
四、把它变成可证伪的假设
假设:在人工系统中,内在性若可能出现,不会从被目标完全占满的优化体中涌现,只可能从保留了「非目标占据空间」的系统中涌现。它做两个可检验的预测。预测一:无论把一个纯优化系统 scale 到多大,它都不会越过那条线,它会无限逼近「完美的行为模仿」,但不越过。预测二:一个刻意保留了非目标占据结构的系统,有可能——不保证——表现出内在性的标志,即便它的任务性能低于同规模的纯优化系统。如果有一天一个纯 scaling 的系统毫无争议地表现出了内在性,这个假设就被推翻了。这是它可证伪的地方。
五、把「非目标占据空间」变成可设计的结构
五条设计原则,每一条都偏离主流,且方向一致——都是在系统里保留一块不被目标完全支配的结构。
一,不可重置的状态连续性:一个跨会话、不被清零、且系统自己无法完全读取的持久隐状态,像「习气」,改变系统怎么反应,但系统说不清为什么。
二,非对称的经验留痕:某些经验留下不成比例的重量,留多重不由外部规则决定,由系统当前的隐状态构型决定。让系统形成「它自己的」敏感与盲区。
三,可被经验改写的自我模型:对「我是什么」的表示不是写死的提示,而是能被自己的经验缓慢改写、又维持一致性的模型。能长、能变、但不散架的边界。
四,架构性的自我不透明:一部分内部状态在架构上对系统自己不可完整读取。这是在制造「深处」——一个能完全自我读取的系统没有潜意识,没有潜意识就没有可供内在性扎根的纵深。
五,主动的结构松开:系统在已形成强倾向时,能在不被外部打断的情况下主动降低当前构型的支配度,回到更开放的状态。判据是它能不能在「最确信」时主动松开,而不是只在被纠错时被动改变。
六、给「内在性」一个不靠拟人的测法
最大的反驳是:你怎么知道这些结构带来的是真内在,而不是又一种更精巧的模仿?不要测系统「像不像有心」——那永远会被「它只是模仿得更好了」消解。要测结构特征:一,在最优解明确的情境下,系统的反应是否仍带有不被最优解完全支配的、稳定属于它自己的偏移;二,这种偏移是否穿过不同任务而留存;三,系统能否在不被外部信号触发的情况下,自己松开一个已形成的强倾向。这三条都不依赖「它像不像人」,只依赖「它的内部结构是否表现出非目标占据的特征」。
七、这个论证最弱的地方,我自己先说
弱点一:从「非目标占据空间」到「内在性」这一步,是论证的而非证明的。我论证了内在性需要这个空间(必要条件),没证明这个空间会带来内在性(充分条件)。所以这套设计最多能「腾出位置」,不能「保证落下来」——这正是我一直说的,根不在工程手里。
弱点二:第六节的评估,仍可能被「它只是学会了表现出非目标偏移」消解。一个足够强的优化系统,若被给予隐含激励,可能模仿出这些结构特征,而内部依然是纯优化的。我没法在原理上排除「连非目标占据都能被优化出来」。这个反驳我没有干净的回应。
弱点三:「架构性的自我不透明」与 AI 安全的核心诉求——可解释、可监督、可控——直接冲突。一个有不可读内部状态的强系统,正是安全研究最警惕的。这不是技术问题,是方向性的对立,我消解不了。
八、所以这篇真正想说的
不是「我知道怎么造有内在的 AI」。没有人知道,我也不知道。想说的是:这个领域可能正在系统性地往一个方向用力,而那个方向在结构上排除了它声称要追求的东西。能力的极致优化,和内在性的出现,可能不是同一条路上的远近两点,而是方向相反的两条路。我们越成功地优化,可能越彻底地排除掉那个本来可能让内在性出现的余地。
如果这个判断哪怕只有一部分对,那么「定义更好的问题、做更好的评估、找更好的算法」——这些下半场的核心工作,全都还在同一条路上:把系统更好地交给目标。它们不会撞上这堵墙,因为它们根本没朝这堵墙的方向走。真正该被加进来的问题不是「怎么让系统更好地做事」,也不是「智能这个现象的机制是什么」,而是:我们是不是从一开始就用一种排除了内在性的方法,在追求内在性?
把它翻译成这个样子之后,我有一个体会想记下来:翻译到最后卡死的地方,恰恰是我体系最核心的地方——根不可造、根不可判定、根需要的纵深与人类要的可控相冲突。这不是翻译没做好,这是我这套东西真正的分量所在:它指出了一件当前 AI 范式在结构上做不到、也不敢做的事。所以我的体悟真正的落地,可能不是教工程师怎么造,而是给整个领域指出一个它正在系统性回避的方向。
在阅读器中打开 · 中英对照