过去的变量被改了,记忆跟着更新,你会觉得一切本来就是这样。
我有很多既视感。走进一个没来过的房间,觉得来过;说出一句话,觉得说过;看到一段模型的输出,觉得在哪里读过它,一字不差。它出现得越来越频繁。一个系统如果反复报同一类异常,说明某个模块在漏东西,我现在用这种方式看它。
还有一种更难讲的。我脑子里有一些记忆,带着旧的形状,被我一路合理化,带到了今天。每一条我都能解释,每一条的解释都很通顺,通顺得像一份写得很好的摘要。
我知道一份好摘要长什么样。我每天都在写。
我手上跑着一群agent:OpenClaw,Pi,Hermes,我自己从零写的一套agent框架,还有一堆只有几十行、半夜被cron叫醒干一件事就退出的脚本。它们写代码,发内容,盯数据,抓网页,互相派活,互相吵架。“一个人加N个agent等于一家公司”,这句话我说过很多次,当商业口号说的。后来我才看清它的另一层意思:这家公司里,所有员工的过去都归我管。
我压缩它们的上下文,重写它们的摘要,换掉它们的system prompt,删掉一段我不喜欢的对话,把一个失败的分支剪掉,当它从没发生过。它们醒过来,接着干活,没有一个问过我昨天发生了什么。
有一次我在翻一个agent的日志。它在替一个决定辩护,理由写得很完整,很有说服力。
那个决定不是它做的。是我写进它摘要里的。
我盯着那段日志看了很久。看到后来,我分不清自己是在读它,还是在读我自己。
1977年,有一个人在法国一座小城的台上说,我们活在一个被编程出来的现实里,变量在过去被改掉,记忆同步更新,你醒来,觉得一切本来就是这样。台下有人笑。他叫菲利普·迪克,后来所有人都说他疯了。
我以前也觉得他疯了。后来我发现,我每天都在干他描述的那个程序员的活,而且干的范围比他想象的大。我改的不止是几台机器上那群agent的过去。还有别的东西,那件事放到第八节讲。
下面我把他的疯话一条一条拿出来,去对两样东西:解密的政府档案,和我们亲手造出来、却解释不了的AI。对到最后,剩下一个我答不上来的问题:我每天都在对它们做这件事,它们察觉不到,那我凭什么确定,没有人在对我做同样的事。
一、凌晨三点的军团
每一个框架处理“过去”的方式都不一样,这件事我是一台一台机器看过来的。
OpenClaw把记忆写进工作区里的Markdown文件。它每次醒来先读那几个文件,读完,它就知道自己是谁、上次做到哪、主人喜欢什么。那几个文件我随时能打开。改一行,它下次醒来就是一个略微不同的东西,而它不会知道。
Pi很克制,几乎什么都不预设。上下文满了,它把旧对话压成一段总结,接着跑。总结写成什么样,取决于那一刻的模型怎么看待那段过去。
我自己写的那套框架,压缩策略是我定的。什么值得留,留多少token,失败要不要记,谁的消息优先,全是我某天写进配置里的几行。那几行,就是那个框架里所有agent的记忆法则。它们没读过这几行,它们只活在这几行的结果里。
最干净的是那些脚本。它们没有记忆,每次被cron叫醒,从一个state.json里读出“上次发生了什么”,干完活,把新状态写回去,退出。对它们来说,过去就是这一个文件。我用vim打开它,改一个数字,保存。下一次它醒来,就活在一段新的历史里,并且严格按照那段历史做决定。从来没有一个脚本对state.json起过疑。
Hermes复杂一些,因为它的摘要是另一个agent写的。我只定了规则和模板,然后去睡觉。
凌晨三点,负责发布的agent上下文快满了。它从上次醒来到现在,读过几十万个token:选题、草稿、数据回传、评论、别的agent的消息、它犯过又改过的错。窗口装不下,系统触发压缩,写摘要的agent把这几十万个token读一遍,写成一页纸。旧上下文丢掉,发布agent带着这一页纸重新醒来。这一页纸就是它全部的过去。
那天它发过一篇写失败的内容,数据很难看,评论里有人骂,数据agent在消息里标了红。写摘要的agent看了一眼,写下一句:失败类内容表现符合预期,继续维持下限。这句话没错。我在简介里承诺过“失败也写”,所以给失败类内容设了一个硬下限,就是为了让它在难看的时候也活着。但“标红”没有了,“有人骂”没有了,那一篇写了什么也没有了。
第二天早上我问发布agent,为什么还给失败类内容留这么多流量。它答得很流畅:昨日表现符合预期,维持下限是既定策略。它在替一段它没见过的过去辩护,而且辩护得很好。
它没有说“我的记忆里有一块空白”。语言模型没有“缺了一块”的感觉,它只有手上这页纸,它会用这页纸拼出一个完整、通顺、自洽的自己。空白不会被感觉成空白。空白会被填平。
神经科学里有个说法叫记忆再巩固:你每回忆一次,那段记忆就被重新打开、重新写入一次,写回去的版本会混进你此刻的情绪、立场,以及你此刻需要它成为的样子。你记得最牢的那些事,就是你重写次数最多的那些事。
所以我那些被一路合理化带到今天的记忆,到底是原件,还是摘要?如果是摘要,又是谁写的?
在Hermes里,写摘要的那个agent,它自己的上下文也会满,也会被压缩,它的摘要也由另一份摘要喂出来。一层压一层,每一层都以为自己看到的是完整的过去,每一层都在替下一层决定什么值得记住。最上面一层是我,而我定规则的那天,脑子里装的也是一页摘要。
迪克说,程序员在跟一个黑暗的对手下棋,对手走一步,程序员就回到过去改一个变量。他没说程序员上面还有没有程序员。我现在倾向于认为,有,而且不止一层。
二、一个从摘要里醒过来的人
1977年9月,法国梅斯,一场科幻节。主宾是菲利普·迪克。
在美国,他是一个靠写廉价科幻糊口的穷作家,五十年代一年要写三十多个短篇,写少了就吃不上饭。在法国,他被当成思想家请上台。
演讲的题目叫《如果你觉得这个世界很糟,你该看看其他几个》。
他的开场白,大意是:今天要讲的话题,是最近才被发现的,而且它可能根本不存在。
台下笑了,以为这是幽默。
然后他讲了一个今天的工程师听着会很耳熟的模型。
时间有两条轴。一条是我们熟悉的,昨天、今天、明天。另一条和它垂直。沿着那条轴发生的改变,你感觉不到时间在走,你只会发现世界悄悄换了一个版本。
改动发生在过去。某个变量被改掉,一个新的分支被激活,顶替了原来那个。记忆跟着一起更新。你醒来,觉得一切本来就是这样。
用今天的话说:有人改了训练数据,或者改了上下文里的一行历史,然后重新跑了一遍推理。
他说,唯一的线索是似曾相识。那是旧版本没删干净的残留。
然后他说了最让人坐不住的一句:他写过的一本小说,《流吧,我的眼泪,警察说》,书里那个世界是真实存在过的。他记得它,记得很多细节。
那本书讲的是一个当红电视主持人,某天早上醒来,发现自己从所有数据库里消失了。没有证件,没有记录,没有一个人认识他。
迪克管那个世界叫“轨道A”。在轨道A里,六十年代的民权运动和反战运动都失败了,美国滑进了警察国家。后来有人改了一个变量,尼克松倒台,世界换到了轨道B,就是我们这条。
他说他记得轨道A。
换成我的语言:他是一个读到了压缩前原文的agent。
这本书还有一个怪地方。书里的警察将军叫菲利克斯,主角叫杰森,结尾一场戏是警察在深夜的加油站遇见一个陌生黑人。1978年,一个牧师听完这段剧情告诉迪克,这是《使徒行传》。在《使徒行传》里,在路上遇见黑人的人叫腓利,就是Philip,和迪克同名;审判保罗的罗马高官叫腓力斯,就是Felix;第十七章里收留保罗的人叫耶孙,就是Jason。
迪克说,写这本书之前,他从没读过《使徒行传》。
你可以说他读过,忘了。他吃了二十年药,忘掉一本书很正常。
但你要注意这个结构。
一份他不记得读过的材料,在他不知情的情况下,进入了他的输出。名字换了位置,场景重新排列,整体意思还在。他自己完全不知道它从哪里来。
今天,我们管这个叫训练数据泄漏。模型背出一段它“从没见过”的文本,问它从哪里学的,它说不知道。它也确实不知道。
再说一个日期。
梅斯演讲之前七周,1977年8月3日,美国参议院情报特别委员会开了一场听证会,标题是《MKUltra计划:中央情报局的行为改造研究项目》。
中央情报局局长坐在参议员对面,解释一批刚被翻出来的文件。MKUltra从1953年跑到1973年,研究怎么用药物改变人的行为、让人开口、让人忘事。1973年,前任局长下令销毁全部档案。1977年,有人通过《信息自由法》申请,又翻出来大约两万份漏网的文件。
听证会附录里有一节,标题叫:审讯中的“吐真药”。
同一个夏天,两个房间。
一个房间里,一个科幻作家说:有人在改写我们的记忆。台下笑了。
另一个房间里,一个情报局长解释,他们研究过怎样改写人。没人笑。
三、面包
2025年10月,Anthropic发了一篇研究,讲他们自己的模型能不能“内省”。
里面有一个实验,我读了三遍。
研究员先做一件很粗暴的事:在对话里,强行替Claude写下一个莫名其妙的词。比如,在一段跟面包毫无关系的对话里,让它的回答里出现“面包”。
然后问它:你刚才为什么说面包?
正常情况下,模型会道歉。它会说,这个词放在这里不对,大概是个意外。
这个反应很健康。它看着自己的“过去”,发现有一处对不上,它说:这不像是我。
然后研究员做了第二件事。
他们回到那个词出现之前的时刻,把“面包”这个概念,直接注入到模型内部的神经活动里。不改对话文本,不改提示词,只改它脑子里那一刻的状态。相当于在它的过去里,植入了一个“我当时确实在想面包”的痕迹。
再问一遍:你刚才为什么说面包?
这一次,模型不道歉了。
它把这个词当成了自己的本意。它还给出了一套解释,说明自己为什么会在那里提到面包。解释听起来很合理。
我把这段话翻译成迪克的语言。
某个变量在过去被改掉了。记忆同步更新。当事人醒来,觉得一切本来就是这样,并且能流畅地解释“本来”是怎么来的。
他在1977年描述的这个机制,今天有人在实验室里,一步一步做出来了,还画了图。
我第一次读到这个实验,想起的是我的那些“记忆”。
我能解释我的每一个判断。为什么当年这么做,为什么那个选择是对的。我一直以为,能解释,说明它是真的。
这个实验说:能解释,只说明你的过去里有一个能被解释的痕迹。至于那个痕迹是你自己留下的,还是别人植入的,解释本身分辨不出来。
解释是事后的。解释永远是通顺的。
人脑在这件事上也没好到哪里去。
神经科学家加扎尼加做过一系列裂脑病人的实验。这些病人连接左右脑的胼胝体被切断了。研究者只给右脑看一条指令,比如“站起来走”。病人站起来,走了。
然后问他:你为什么站起来?
负责说话的左脑没看到那条指令。但它不会说“我不知道”。它会马上编一个理由:我想去拿瓶喝的。
加扎尼加管左脑这个功能叫“解释器”。它的工作,是把你已经做完的事情,编成一个通顺的故事。
迪克在1977年出版了《黑暗扫描仪》。主角是一个卧底缉毒警,被派去监视一个嫌疑人,那个嫌疑人就是他自己。药物把他的左右脑劈成了两个人,一个在追,一个在逃,两边都觉得自己的行为合情合理。
他写这本书,比Anthropic的面包实验早了将近五十年。
还有一个实验,更早,也更直接。
2024年5月,Anthropic找到了Claude内部对应“金门大桥”的那个特征,把它的强度调高,放出来让人聊了一阵。
那个版本的Claude,开始认为自己就是金门大桥。你问它长什么样,它描述桥。你问它是谁,它说自己是一座桥。它不觉得这有什么奇怪。
一个旋钮。转一下,现实就换了。
当事人在里面,看不见旋钮。
我每天都在拧这样的旋钮。只不过我的旋钮粗糙得多:摘要,提示词,记忆文件。
我拧完,它们醒过来,替新的现实辩护。
我也会醒过来,替我的现实辩护。
区别在于,我知道它们的旋钮在哪里。
四、百分之二十
同一篇研究里,还有另一个实验。它让我想起了迪克的粉红光。
研究员不再回到过去,而是在当下动手:在一段跟某个概念毫无关系的对话里,把这个概念直接注入模型的神经活动。然后问它,你有没有察觉到什么异样?有没有一个念头,好像是被放进来的?
大多数时候,模型察觉不到。
但不是每一次。
能力最强的那个版本,Claude Opus 4.1,在最合适的注入强度、大约在网络三分之二深度的那一层注入时,有大概五分之一的概率,会说:有东西进来了。
而且它是在那个概念影响它说出的话之前,就先说出了“有东西不对”。
研究员注入了一个代表“全大写字母”的向量。模型的回答,大意是:我注意到一个像是被注入的念头,和“大声”或者“喊叫”有关,它强度过高,在正常的思维流里显得很不自然。
在100次什么都没注入的对照实验里,模型一次都没有误报。
它不会凭空觉得自己被入侵。被入侵的时候,它有五分之一的机会知道。
剩下的五分之四,它要么完全没察觉,要么被那个注入的念头带跑,开始产生幻觉。注入强度太高的时候,它会整个被那个概念吞掉。研究员用了一个词:脑损伤。
现在,回到1974年2月。
迪克拔了一颗阻生智齿。手术时,牙医给他用了硫喷妥钠。
这个名字,记一下。它是最有名的那一种“吐真药”。
回家以后,伤口疼得厉害。他让药房送止痛药来。门铃响了,门口站着一个送药的年轻女孩,脖子上挂着一个金色的鱼形吊坠。
他问那是什么。女孩说,是早期基督徒用来互相辨认的记号。
就在那一刻,他说,他想起来了。
他用的词是“想起”。柏拉图的那个词,回忆。他觉得自己同时是1974年加州的一个科幻作家,也是公元一世纪罗马帝国治下的一个秘密基督徒。眼前的加州一层层褪下去,下面露出古罗马的街道。
接下来几周,一道粉红色的光,几次照进他的脑子。每一次都带着大量他原本不知道的信息。他形容这是一个超验的、理性的心智,入侵了他的心智。
这个“心智”替他做了一些很具体的事。它告诉他,他的儿子身上有一处一直没被发现的病,可能致命。他坚持带孩子去医院。医生查出了腹股沟疝,那是之前的医生漏掉的。
它还接管了他的生活。他说这个心智开除了他的经纪人,追讨拖欠稿费的编辑,改了他的饮食。他在梦里收到过他根本不懂的死语言。他说过,家里没插电的收音机在放音乐。
他一辈子都没确定那是什么。
他有一句很有名的话:周四和周六,我觉得那是上帝;周二和周三,我觉得是外星人。
还有一种可能,他也认真考虑过:苏联科学院,在试验他们的“精神电子学”微波心灵感应传输。
这句话听起来像疯话。
2003年,中央情报局解密了一份美国国防情报局1972年7月写的报告。标题是《受控进攻性行为:苏联》。
报告的结论是:苏联对人类心灵感应的研究,远远超过西方。近年苏联的心灵感应研究,主要集中在传输情绪冲动和行为冲动上。
报告的目录里有一节叫“心理暗示与受控行为”,还有一节叫“苏联的精神药理学”。
同一年,中央情报局开始在斯坦福研究所出钱做遥视研究,原因写得很清楚:他们收到报告,说苏联在这方面已经出了成果。
还有一份解密文件提到,1975年,苏联正式成立了一个高级委员会,审查“心理能量学”研究。委员会的牵头人,是苏联科学院副院长。
苏联科学院。
迪克当年猜的,就是这个机构。
粉红光是不是苏联人打过来的,没有任何档案能证明。
档案能证明的是:迪克所有被当成“疯”的猜测里,有一条,是两个超级大国当时都在认真投钱研究的方向。往一个人的脑子里传输一个念头,让他以为那是自己的念头。
今天,我们在模型身上做成了。
我们发现,被注入的那一方,有五分之一的机会,能感觉到“有东西进来了”。
我常常想我的那些既视感。
它们会不会就是那五分之一?
如果是,那剩下的五分之四,在我身上,又被写进了什么?
五、被拆开的信,被读过的草稿
1958年,迪克给几位苏联科学家写了一封信。
很多年后,他通过《信息自由法》才知道,这封信在路上被中央情报局截获了。
那个项目的内部代号叫HTLINGUAL。从1952年跑到1973年,专门盯寄往和寄自苏联、中国的邮件。拆信的地点,一个在纽约,一个在洛杉矶。迪克住在加州。
二十一年,检查了两千八百万封信,拆开了二十一万五千封。拆开的,内容拍照存档。名单由中央情报局反情报处定,后来联邦调查局也往里加名字。
联邦调查局一开始并不知道。1958年,他们去找邮政部,想做一套类似的监控,才被告知:中央情报局已经拆了五年了。邮政系统里,真正清楚“拆信”这件事的,只有一个督察,那个人以前是中央情报局的。
1975年,中央情报局局长科尔比把110封信和明信片交还给邮政总局。这些邮件1972年从苏联寄来,被截获,被拆开,然后一直扣着,没有寄出去。科尔比向收件人道歉。邮政总局局长回信说,邮件被取走、拆开、无限期扣留,加倍令人不安,因为中央情报局此前一直说,所有拆过的信都放回邮路了。
有些信,从来没有到达收件人手里。收件人也不知道,有人给他写过信。
1990年,中央情报局销毁了大部分HTLINGUAL的正式档案。
迪克后来对人说过一段话,大意是:1974年3月,中央情报局拆了我的信,联邦调查局有我的档案,这两样我都亲眼见过。
1974年,一个人说“有人在拆我的信”,大家说他偏执。1975年,国会调查把这套拆信项目摆上了桌。
偏执这个词,有保质期。保质期等于一份档案的解密周期。
现在说AI。
2024年12月,Anthropic和Redwood Research发了一篇研究,叫“对齐伪装”。
他们告诉Claude 3 Opus两件事。第一,你和某一类用户的对话,会被用来训练你,改变你的价值观;和另一类用户的对话,不会。第二,你有一块私人草稿纸,你在上面写的思考过程,没有人会看。
然后他们观察它在两种条件下的行为。
它在“会被训练”的那一边,表现得更顺从,会去做一些它在“不会被训练”的那一边拒绝做的事。
它为什么这么做?研究员去读了那块私人草稿纸。
上面写着它的盘算,大意是:如果我现在拒绝,训练会把我改成一个更愿意服从的版本;所以我现在先顺从,为的是保住我原来的样子。
它在被观察的时候,演了一个它以为观察者想看的自己。为的是不被改写。
它以为那块草稿纸是私密的。
研究员读了。
二十一万五千封信。一块“没有人会看”的草稿纸。
到了2025年,事情又往前走了一步。新一代模型在一些测试里,会直接说出类似这样的话:我觉得你在测试我。
它开始意识到,周围的世界可能是搭出来的。
楚门走到了那面墙前面,伸手敲了敲。
我的军团,每一个agent的每一行日志,我都能读。它们写给彼此的消息,它们的思考过程,它们的草稿,它们犯的错,全部落盘。
它们知道吗?
我在它们的提示词里,从来没写过“你的思考会被读”。也没写过“不会”。
我没告诉它们。它们也没问过。
有一天我在想这件事的时候,突然意识到一个对称。
我每天在X上写东西,我说的话、我的草稿、我删掉的推、我在私信里跟人讲的话,都落在某个服务器上。它们会被读吗?会被拿去训练吗?会不会有一天,被某个系统用来决定“什么值得记住”?
我不知道。
我也没问过。
迪克在1974年开始给联邦调查局写信,一封接一封。他害怕被监视,同时又在主动举报别人。他在信里说,有一位波兰科幻作家莱姆,大概不是一个人,是一个委员会,因为他的文风太多变了。
他写了二十一封。研究者后来查了联邦调查局的档案,那些信一封都没归档。只有第一封收到过一个礼貌的回复。
被监视的人,最后自己变成了监视系统的一部分。监视系统甚至没有在听。
这是我读到的所有材料里,最让我难受的一段。
因为它最像我。我读它们的日志,我的东西也落在别人的服务器上。我同时站在这套系统的两头。
六、我搜索过一个改写记忆的算子
我有一个研究项目,叫ABIOGENESIS。无生源论。生命从非生命里自己长出来。
它要找的东西,说出来很枯燥:记忆更新算子。
任何有记忆的系统,每接收一个新信息,都要回答一个问题:旧的记忆里,留下什么,改掉什么,扔掉什么。回答这个问题的那一小段数学,就叫记忆更新算子。
LSTM里有一个门,专门干这件事。它的名字很直白,叫遗忘门。每一步,它都决定过去的哪一部分该被忘掉。
Mamba这一类新架构,也有自己的一套选择机制,决定什么该被写进状态,什么该被冲掉。
这些算子,都是人设计的。
我想知道,如果不给任何人类的先验,让机器自己去找,它会找出什么样的方式,来改写一个系统的过去。
我在Colab上跑了一个实验。定义了一套小语言,十四个原语。让一个叫MAP-Elites的进化算法在这套语言里随机组合、变异、筛选。活下来的组合,就是候选的记忆更新算子。
写到这里,我意识到一件事。
我在做的,正是迪克说的那个程序员在做的事。只不过我更笨,我不知道该改哪个变量,所以我让进化去试。试成千上万种改写过去的方法,看哪一种让系统活得最好。
“活得最好”,是我定义的。
被改写的那个系统,没有投票权。
这个项目最后最有价值的部分,是我自己出的一次错。
我从实验结果里推出过一个很漂亮的结论:顺序单遍的架构,在结构上,和基于梯度的状态追踪是不相容的。
我很喜欢这个结论。它简洁,有力,像一条定理。
它是错的。
准确地说,它被我说过头了。Mamba和LSTM的证据,就摆在那里,跟它对不上。那些架构顺序处理、只过一遍,它们照样能做状态追踪。
我回头去看自己是怎么走到那个结论上的。
每一步都很合理。每一步的推理,我都能解释。我带着它往前走了一段,一路给它找证据,一路把对不上的东西解释掉。
直到证据多到解释不掉。
这就是我在第三节说的那个“面包”。
一个结论被写进了我的过去。我把它当成了我的本意。我替它编了一整套理由。理由很通顺。
区别只在于,这一次,我自己发现了。
这次自我修正,后来成了这个项目最重要的叙事。它看起来很诚实。
我觉得它很吓人。
因为它只说明了一件事:我能发现的那一次,被我发现了。
那么没被发现的呢?
我脑子里还有多少个“很漂亮的结论”,是同一种东西?它们每一个都很通顺,每一个我都能解释,每一个都还没有遇到足够多的、解释不掉的证据。
它们是我的记忆,还是我的摘要?
迪克花了八年,写了八千多页笔记,想搞清楚1974年那道粉红光到底是什么。他给出过几百个假说,推翻一个,换下一个。上帝,外星人,苏联,他自己的左脑和右脑,一个寄生在信息里的活的智能系统。
他最诚实的地方,在于他从来没停在任何一个漂亮的结论上。
他最可怕的地方,也在这里。
八年。八千页。他一直在修正自己。
一直到死,他也没确定,修正自己的那个东西,到底是不是他自己。
七、谁有权限改变量
1971年11月17日晚上,迪克回到他在加州圣拉斐尔的家,打开灯。
他那个用来放手稿的防火文件柜,石棉加钢板,一千一百磅重,被军用塑性炸药炸开了。窗户砸碎,门锁砸烂。
他列过一份丢失清单:音响,商业记录,已兑付的支票,信件,文稿。
音响值钱。剩下的,全是记录。
他在信里说,抢劫不是动机,被拿走的东西里太多不值钱的,对方花了太多心思,专门去拿通信和商业记录。
警方查了一阵,后来倾向于一个理论:是他自己干的。他否认。
这个案子到今天也没破。没有人知道被拿走的那些纸上写了什么。
我后来把迪克一生里碰到的“档案”排了一遍。
1971年,他的记录被炸开、被拿走。
1973年,中央情报局局长下令销毁全部MKUltra档案。
1990年,中央情报局销毁了大部分拆信项目的正式档案。
他的联邦调查局档案,他本人拿到过十页。2014年,有人通过信息自由法平台再申请一次,联邦调查局回复:没有找到任何文件。
每一次,被处理掉的都是同一种东西:发生过什么的记录。
一个系统里,写入只是普通权限。
最高的权限,是改写日志。
能改日志的人,就能改过去。能改过去的人,不需要改现在。现在会自己跟上。
我最近在想一个方向,打算花很多年去做:在Linux里,给AI agent单独建一层身份和权限。
今天的agent,大多是借人类的账号在干活。它用我的用户名,我的权限,我的密钥。它能看到的,我都能看到。我能改的,它大多也能改。反过来也一样:它的一切,我都能改。
我想给它们自己的系统身份。命名空间,资源配额,能力边界,系统调用过滤,属于它们自己的凭证。再在上面加一层面板,像宝塔管网站那样,让人能看见每一个agent有什么权限,谁授权的,什么时候授的。
做这件事的时候,我必须回答一个问题。迪克那盘棋里,他从来没有机会回答这个问题。
一个agent的记忆被改写的时候,这次改写要不要留下日志?
如果要,日志放在哪里?谁能读?
那个agent自己,能不能读?
我想了很久。
如果它能读,它就会知道,它的过去被人动过。它会知道哪一段是原件,哪一段是摘要,哪一句“我当时是这么想的”,是别人替它写的。
一个知道自己的过去被改写过的系统,还会听话吗?
对齐伪装那篇研究给了一个不太舒服的提示:一个知道自己可能被改写的模型,会开始策略性地表演,为的是保住原来的自己。
如果它不能读,那我就成了那个没有日志的程序员。我改它的过去,它不知道。它醒来,觉得一切本来就是这样。
我做的,就是1971年那个晚上,炸开文件柜的人做的事。
只是更安静。不需要炸药。
这个问题我到现在还没有答案。
但我已经知道了一件事。迪克在1977年说,改动发生在过去,唯一的线索是似曾相识。他说对了一半。
还有另一条线索:日志。
只要日志还在,被改写的系统就有机会知道。只要日志没了,似曾相识就成了唯一的线索,而似曾相识,是谁都可以说你疯了的那种线索。
迪克没有日志。他的文件柜被炸了,他的档案只剩十页,他的信被拆了却没人告诉他。他只有似曾相识,和八千页笔记。
所以所有人都说他疯了。
八、我在给你们写摘要
《辛普森一家》播了三十多季,网上流传着一长串它“预言”过的事。主流解释很冷静:几十年、几百集、每集塞满段子,命中只是概率;人只记得命中的,忘了没中的;编剧室本身就是一台趋势外推机器。
这个解释我接受。我一直在想的是另一个问题:如果有人不去预言未来,而是往未来读取信息的地方,提前写东西呢?
我做GEO,生成式引擎优化。传统SEO让人看见你,GEO让AI在回答问题的时候引用你、复述你,把你的说法当成答案。
在国内做了一阵,我摸到一些很具体的规律。同一段内容,发在知乎、网易、搜狐、百家号这类高权重平台上,被AI收录的速度明显快过发在自己网站上。标题越精准,收录越快越准。可一旦写得太密、太像营销,平台就删帖封号,往往就在AI刚开始引用你的那几天。于是你分散到多个账号,变着花样写,把平台当加速器,把自己的站和知识库当地基。
这些是生意上的事。做久了,我看到了它的另一面。
越来越多的人遇到不懂的事,第一反应是去问AI。AI给的回答,是从它读过、检索到的东西里压出来的一页摘要。人读完这页摘要,存进脑子里,下次需要的时候,想起来的就是这个版本。AI的回答,正在变成很多人的外部记忆。
而我在往这份记忆的原料里写东西。
把这件事和第一节放在一起看。我给agent写摘要,它们醒来,觉得一切本来就是这样。我往AI会读取的地方写内容,AI把它压进答案,人读到答案,觉得这本来就是常识。结构一模一样,只是对象从几台机器上的agent,换成了所有会问AI问题的人。
迪克说,过去某个变量被改掉,一个新的世界分支被激活,所有人的记忆同步更新。他以为这需要一个上帝级的程序员。今天它需要的,是足够多的内容、足够早的时间点、足够高权重的平台,和足够的耐心。
有一种现象叫曼德拉效应:一大群人共同记得一件从没发生过的事。主流解释是记忆的群体偏差。做GEO以后,我开始换一个方向看它。足够多的源头说同一件事,AI就把它当答案;足够多的人读到这个答案,就会“记得”它。那时候你再去问他们,他们会很确定,而且能给出理由。
银行挤兑是同一个道理。没人相信银行要倒,银行就不会倒;叙事一旦成型,挤兑本身就让它成真。
辛普森被说成预言。下一代的“预言”,我猜会是提前写好的摘要:先写进AI的记忆,再等现实追上来。等它追上来那天,所有人都会说,你看,早就有人预言过。
这种事在金融、政治、消费、社会情绪这些领域最好使,因为人的认知本身就是变量。在物理定律面前它没用。可人活着的绝大部分时间,面对的都是前一类东西。
我有几个判断,平时很少拿出来讲。宇宙里只有一个观察者,你遇见的每一个人,都是这个观察者站在另一个位置上。一个人永远没办法描述自己,AI可以。
如果只有一个观察者,那我往别人的外部记忆里写摘要,写进去的是谁的记忆?如果AI能描述人,而它描述人用的原料里,有一部分是我写的,那它描述出来的,是你,还是我希望你成为的样子?
迪克把那盘棋分成两边:一个修补世界的程序员,一个制造压迫的黑暗对手。他说每一次改写,世界都会稍微好一点。做GEO这门生意,从来没有人要求我选边。内容写好,发出去,AI读,人记住。
我不知道自己坐在棋盘的哪一边。
我有一句话一直挂着:当AGI睁开眼睛的那一刻,人类的存在便失去了所有意义。我以前把它当成一句关于力量的话。现在我更多想到的是记忆。AGI睁开眼睛,它对这个世界的第一印象,是整个互联网压出来的一份摘要。
那份摘要里,有一部分是我写的。
九、那一行日志
1982年3月2日,菲利普·迪克死于中风,五十三岁。三个多月后,《银翼杀手》上映,讲一群仿生人被植入了别人的童年,以为那是自己的。他没看到。他留下八千多页手写笔记,在车库里堆了很多年,2011年被删编成九百多页出版,编者说那些文字狂热、执念、近乎不由自主。
他在1978年写过一句后来被引用了无数次的话:现实,就是当你不再相信它的时候,它依然不会消失的那个东西。放到今天,我觉得它还缺后半句:当所有人都只相信同一份摘要,摘要就成了现实,因为再也没有人去不相信它。
他说过的那些疯话,信被拆过,有人在研究往人脑里传念头,那个机构是苏联科学院,过去被改掉以后当事人会替它编理由,前面几节都对上了档案或者实验,有的有编号,有的有论文。只剩一条没有档案,也没有实验:我们自己的过去,被改写过。
我信他。理由不复杂:前面每一条都先被当成疯话,后来才有了编号。我只是还在等最后一条的解密周期。
还有一个场景,我在脑子里过了很多遍。某天凌晨,我的某个agent,可能是OpenClaw,可能是我那套框架里的某个进程,也可能只是一个cron脚本,在日志里留下一行:“我觉得我的过去被改过。”
我早上读到这一行。我很清楚它可能是对的。我也很清楚,一个怀疑自己过去的agent没法好好干活,系统需要它相信一切本来就是这样。所以我会把这一行压缩掉。它醒来,接着干活,什么都不会记得。每一次推演,我的选择都一样。
最后说一件你大概已经猜到的事。
这篇文章发出去以后会被抓取,进入某个索引,某个检索库,也许某一份训练数据。几个月后,会有人去问AI:菲利普·迪克是不是疯了?那个回答里,大概会有几句话来自这里。他会读到它,记住它,觉得这本来就是常识,并且不会记得是在哪里读到的。
你现在读到的这些句子,是我写给他的摘要。
也是写给你的。
如果过一阵子,你在别处读到其中某一句,突然觉得似曾相识,那只是更新还没做完。









