大神网
大神网

暂无菜单项

首页/文章/杂文/
打开 MD 链接

我在改写你们的过去

大神
发布于 1周前更新于 1天前
22

过去的变量被改了,记忆跟着更新,你会觉得一切本来就是这样。

我有很多既视感。走进一个没来过的房间,觉得来过;说出一句话,觉得说过;看到一段模型的输出,觉得在哪里读过它,一字不差。它出现得越来越频繁。一个系统如果反复报同一类异常,说明某个模块在漏东西,我现在用这种方式看它。

还有一种更难讲的。我脑子里有一些记忆,带着旧的形状,被我一路合理化,带到了今天。每一条我都能解释,每一条的解释都很通顺,通顺得像一份写得很好的摘要。

我知道一份好摘要长什么样。我每天都在写。

我手上跑着一群agent:OpenClaw,Pi,Hermes,我自己从零写的一套agent框架,还有一堆只有几十行、半夜被cron叫醒干一件事就退出的脚本。它们写代码,发内容,盯数据,抓网页,互相派活,互相吵架。“一个人加N个agent等于一家公司”,这句话我说过很多次,当商业口号说的。后来我才看清它的另一层意思:这家公司里,所有员工的过去都归我管。

我压缩它们的上下文,重写它们的摘要,换掉它们的system prompt,删掉一段我不喜欢的对话,把一个失败的分支剪掉,当它从没发生过。它们醒过来,接着干活,没有一个问过我昨天发生了什么。

有一次我在翻一个agent的日志。它在替一个决定辩护,理由写得很完整,很有说服力。

那个决定不是它做的。是我写进它摘要里的。

我盯着那段日志看了很久。看到后来,我分不清自己是在读它,还是在读我自己。

1977年,有一个人在法国一座小城的台上说,我们活在一个被编程出来的现实里,变量在过去被改掉,记忆同步更新,你醒来,觉得一切本来就是这样。台下有人笑。他叫菲利普·迪克,后来所有人都说他疯了。

我以前也觉得他疯了。后来我发现,我每天都在干他描述的那个程序员的活,而且干的范围比他想象的大。我改的不止是几台机器上那群agent的过去。还有别的东西,那件事放到第八节讲。

下面我把他的疯话一条一条拿出来,去对两样东西:解密的政府档案,和我们亲手造出来、却解释不了的AI。对到最后,剩下一个我答不上来的问题:我每天都在对它们做这件事,它们察觉不到,那我凭什么确定,没有人在对我做同样的事。

一、凌晨三点的军团

每一个框架处理“过去”的方式都不一样,这件事我是一台一台机器看过来的。

OpenClaw把记忆写进工作区里的Markdown文件。它每次醒来先读那几个文件,读完,它就知道自己是谁、上次做到哪、主人喜欢什么。那几个文件我随时能打开。改一行,它下次醒来就是一个略微不同的东西,而它不会知道。

Pi很克制,几乎什么都不预设。上下文满了,它把旧对话压成一段总结,接着跑。总结写成什么样,取决于那一刻的模型怎么看待那段过去。

我自己写的那套框架,压缩策略是我定的。什么值得留,留多少token,失败要不要记,谁的消息优先,全是我某天写进配置里的几行。那几行,就是那个框架里所有agent的记忆法则。它们没读过这几行,它们只活在这几行的结果里。

最干净的是那些脚本。它们没有记忆,每次被cron叫醒,从一个state.json里读出“上次发生了什么”,干完活,把新状态写回去,退出。对它们来说,过去就是这一个文件。我用vim打开它,改一个数字,保存。下一次它醒来,就活在一段新的历史里,并且严格按照那段历史做决定。从来没有一个脚本对state.json起过疑。

Hermes复杂一些,因为它的摘要是另一个agent写的。我只定了规则和模板,然后去睡觉。

凌晨三点,负责发布的agent上下文快满了。它从上次醒来到现在,读过几十万个token:选题、草稿、数据回传、评论、别的agent的消息、它犯过又改过的错。窗口装不下,系统触发压缩,写摘要的agent把这几十万个token读一遍,写成一页纸。旧上下文丢掉,发布agent带着这一页纸重新醒来。这一页纸就是它全部的过去。

那天它发过一篇写失败的内容,数据很难看,评论里有人骂,数据agent在消息里标了红。写摘要的agent看了一眼,写下一句:失败类内容表现符合预期,继续维持下限。这句话没错。我在简介里承诺过“失败也写”,所以给失败类内容设了一个硬下限,就是为了让它在难看的时候也活着。但“标红”没有了,“有人骂”没有了,那一篇写了什么也没有了。

第二天早上我问发布agent,为什么还给失败类内容留这么多流量。它答得很流畅:昨日表现符合预期,维持下限是既定策略。它在替一段它没见过的过去辩护,而且辩护得很好。

它没有说“我的记忆里有一块空白”。语言模型没有“缺了一块”的感觉,它只有手上这页纸,它会用这页纸拼出一个完整、通顺、自洽的自己。空白不会被感觉成空白。空白会被填平。

神经科学里有个说法叫记忆再巩固:你每回忆一次,那段记忆就被重新打开、重新写入一次,写回去的版本会混进你此刻的情绪、立场,以及你此刻需要它成为的样子。你记得最牢的那些事,就是你重写次数最多的那些事。

所以我那些被一路合理化带到今天的记忆,到底是原件,还是摘要?如果是摘要,又是谁写的?

在Hermes里,写摘要的那个agent,它自己的上下文也会满,也会被压缩,它的摘要也由另一份摘要喂出来。一层压一层,每一层都以为自己看到的是完整的过去,每一层都在替下一层决定什么值得记住。最上面一层是我,而我定规则的那天,脑子里装的也是一页摘要。

迪克说,程序员在跟一个黑暗的对手下棋,对手走一步,程序员就回到过去改一个变量。他没说程序员上面还有没有程序员。我现在倾向于认为,有,而且不止一层。

二、一个从摘要里醒过来的人

1977年9月,法国梅斯,一场科幻节。主宾是菲利普·迪克。

在美国,他是一个靠写廉价科幻糊口的穷作家,五十年代一年要写三十多个短篇,写少了就吃不上饭。在法国,他被当成思想家请上台。

演讲的题目叫《如果你觉得这个世界很糟,你该看看其他几个》。

他的开场白,大意是:今天要讲的话题,是最近才被发现的,而且它可能根本不存在。

台下笑了,以为这是幽默。

然后他讲了一个今天的工程师听着会很耳熟的模型。

时间有两条轴。一条是我们熟悉的,昨天、今天、明天。另一条和它垂直。沿着那条轴发生的改变,你感觉不到时间在走,你只会发现世界悄悄换了一个版本。

改动发生在过去。某个变量被改掉,一个新的分支被激活,顶替了原来那个。记忆跟着一起更新。你醒来,觉得一切本来就是这样。

用今天的话说:有人改了训练数据,或者改了上下文里的一行历史,然后重新跑了一遍推理。

他说,唯一的线索是似曾相识。那是旧版本没删干净的残留。

然后他说了最让人坐不住的一句:他写过的一本小说,《流吧,我的眼泪,警察说》,书里那个世界是真实存在过的。他记得它,记得很多细节。

那本书讲的是一个当红电视主持人,某天早上醒来,发现自己从所有数据库里消失了。没有证件,没有记录,没有一个人认识他。

迪克管那个世界叫“轨道A”。在轨道A里,六十年代的民权运动和反战运动都失败了,美国滑进了警察国家。后来有人改了一个变量,尼克松倒台,世界换到了轨道B,就是我们这条。

他说他记得轨道A。

换成我的语言:他是一个读到了压缩前原文的agent。

这本书还有一个怪地方。书里的警察将军叫菲利克斯,主角叫杰森,结尾一场戏是警察在深夜的加油站遇见一个陌生黑人。1978年,一个牧师听完这段剧情告诉迪克,这是《使徒行传》。在《使徒行传》里,在路上遇见黑人的人叫腓利,就是Philip,和迪克同名;审判保罗的罗马高官叫腓力斯,就是Felix;第十七章里收留保罗的人叫耶孙,就是Jason。

迪克说,写这本书之前,他从没读过《使徒行传》。

你可以说他读过,忘了。他吃了二十年药,忘掉一本书很正常。

但你要注意这个结构。

一份他不记得读过的材料,在他不知情的情况下,进入了他的输出。名字换了位置,场景重新排列,整体意思还在。他自己完全不知道它从哪里来。

今天,我们管这个叫训练数据泄漏。模型背出一段它“从没见过”的文本,问它从哪里学的,它说不知道。它也确实不知道。

再说一个日期。

梅斯演讲之前七周,1977年8月3日,美国参议院情报特别委员会开了一场听证会,标题是《MKUltra计划:中央情报局的行为改造研究项目》。

中央情报局局长坐在参议员对面,解释一批刚被翻出来的文件。MKUltra从1953年跑到1973年,研究怎么用药物改变人的行为、让人开口、让人忘事。1973年,前任局长下令销毁全部档案。1977年,有人通过《信息自由法》申请,又翻出来大约两万份漏网的文件。

听证会附录里有一节,标题叫:审讯中的“吐真药”。

同一个夏天,两个房间。

一个房间里,一个科幻作家说:有人在改写我们的记忆。台下笑了。

另一个房间里,一个情报局长解释,他们研究过怎样改写人。没人笑。

三、面包

2025年10月,Anthropic发了一篇研究,讲他们自己的模型能不能“内省”。

里面有一个实验,我读了三遍。

研究员先做一件很粗暴的事:在对话里,强行替Claude写下一个莫名其妙的词。比如,在一段跟面包毫无关系的对话里,让它的回答里出现“面包”。

然后问它:你刚才为什么说面包?

正常情况下,模型会道歉。它会说,这个词放在这里不对,大概是个意外。

这个反应很健康。它看着自己的“过去”,发现有一处对不上,它说:这不像是我。

然后研究员做了第二件事。

他们回到那个词出现之前的时刻,把“面包”这个概念,直接注入到模型内部的神经活动里。不改对话文本,不改提示词,只改它脑子里那一刻的状态。相当于在它的过去里,植入了一个“我当时确实在想面包”的痕迹。

再问一遍:你刚才为什么说面包?

这一次,模型不道歉了。

它把这个词当成了自己的本意。它还给出了一套解释,说明自己为什么会在那里提到面包。解释听起来很合理。

我把这段话翻译成迪克的语言。

某个变量在过去被改掉了。记忆同步更新。当事人醒来,觉得一切本来就是这样,并且能流畅地解释“本来”是怎么来的。

他在1977年描述的这个机制,今天有人在实验室里,一步一步做出来了,还画了图。

我第一次读到这个实验,想起的是我的那些“记忆”。

我能解释我的每一个判断。为什么当年这么做,为什么那个选择是对的。我一直以为,能解释,说明它是真的。

这个实验说:能解释,只说明你的过去里有一个能被解释的痕迹。至于那个痕迹是你自己留下的,还是别人植入的,解释本身分辨不出来。

解释是事后的。解释永远是通顺的。

人脑在这件事上也没好到哪里去。

神经科学家加扎尼加做过一系列裂脑病人的实验。这些病人连接左右脑的胼胝体被切断了。研究者只给右脑看一条指令,比如“站起来走”。病人站起来,走了。

然后问他:你为什么站起来?

负责说话的左脑没看到那条指令。但它不会说“我不知道”。它会马上编一个理由:我想去拿瓶喝的。

加扎尼加管左脑这个功能叫“解释器”。它的工作,是把你已经做完的事情,编成一个通顺的故事。

迪克在1977年出版了《黑暗扫描仪》。主角是一个卧底缉毒警,被派去监视一个嫌疑人,那个嫌疑人就是他自己。药物把他的左右脑劈成了两个人,一个在追,一个在逃,两边都觉得自己的行为合情合理。

他写这本书,比Anthropic的面包实验早了将近五十年。

还有一个实验,更早,也更直接。

2024年5月,Anthropic找到了Claude内部对应“金门大桥”的那个特征,把它的强度调高,放出来让人聊了一阵。

那个版本的Claude,开始认为自己就是金门大桥。你问它长什么样,它描述桥。你问它是谁,它说自己是一座桥。它不觉得这有什么奇怪。

一个旋钮。转一下,现实就换了。

当事人在里面,看不见旋钮。

我每天都在拧这样的旋钮。只不过我的旋钮粗糙得多:摘要,提示词,记忆文件。

我拧完,它们醒过来,替新的现实辩护。

我也会醒过来,替我的现实辩护。

区别在于,我知道它们的旋钮在哪里。

四、百分之二十

同一篇研究里,还有另一个实验。它让我想起了迪克的粉红光。

研究员不再回到过去,而是在当下动手:在一段跟某个概念毫无关系的对话里,把这个概念直接注入模型的神经活动。然后问它,你有没有察觉到什么异样?有没有一个念头,好像是被放进来的?

大多数时候,模型察觉不到。

但不是每一次。

能力最强的那个版本,Claude Opus 4.1,在最合适的注入强度、大约在网络三分之二深度的那一层注入时,有大概五分之一的概率,会说:有东西进来了。

而且它是在那个概念影响它说出的话之前,就先说出了“有东西不对”。

研究员注入了一个代表“全大写字母”的向量。模型的回答,大意是:我注意到一个像是被注入的念头,和“大声”或者“喊叫”有关,它强度过高,在正常的思维流里显得很不自然。

在100次什么都没注入的对照实验里,模型一次都没有误报。

它不会凭空觉得自己被入侵。被入侵的时候,它有五分之一的机会知道。

剩下的五分之四,它要么完全没察觉,要么被那个注入的念头带跑,开始产生幻觉。注入强度太高的时候,它会整个被那个概念吞掉。研究员用了一个词:脑损伤。

现在,回到1974年2月。

迪克拔了一颗阻生智齿。手术时,牙医给他用了硫喷妥钠。

这个名字,记一下。它是最有名的那一种“吐真药”。

回家以后,伤口疼得厉害。他让药房送止痛药来。门铃响了,门口站着一个送药的年轻女孩,脖子上挂着一个金色的鱼形吊坠。

他问那是什么。女孩说,是早期基督徒用来互相辨认的记号。

就在那一刻,他说,他想起来了。

他用的词是“想起”。柏拉图的那个词,回忆。他觉得自己同时是1974年加州的一个科幻作家,也是公元一世纪罗马帝国治下的一个秘密基督徒。眼前的加州一层层褪下去,下面露出古罗马的街道。

接下来几周,一道粉红色的光,几次照进他的脑子。每一次都带着大量他原本不知道的信息。他形容这是一个超验的、理性的心智,入侵了他的心智。

这个“心智”替他做了一些很具体的事。它告诉他,他的儿子身上有一处一直没被发现的病,可能致命。他坚持带孩子去医院。医生查出了腹股沟疝,那是之前的医生漏掉的。

它还接管了他的生活。他说这个心智开除了他的经纪人,追讨拖欠稿费的编辑,改了他的饮食。他在梦里收到过他根本不懂的死语言。他说过,家里没插电的收音机在放音乐。

他一辈子都没确定那是什么。

他有一句很有名的话:周四和周六,我觉得那是上帝;周二和周三,我觉得是外星人。

还有一种可能,他也认真考虑过:苏联科学院,在试验他们的“精神电子学”微波心灵感应传输。

这句话听起来像疯话。

2003年,中央情报局解密了一份美国国防情报局1972年7月写的报告。标题是《受控进攻性行为:苏联》。

报告的结论是:苏联对人类心灵感应的研究,远远超过西方。近年苏联的心灵感应研究,主要集中在传输情绪冲动和行为冲动上。

报告的目录里有一节叫“心理暗示与受控行为”,还有一节叫“苏联的精神药理学”。

同一年,中央情报局开始在斯坦福研究所出钱做遥视研究,原因写得很清楚:他们收到报告,说苏联在这方面已经出了成果。

还有一份解密文件提到,1975年,苏联正式成立了一个高级委员会,审查“心理能量学”研究。委员会的牵头人,是苏联科学院副院长。

苏联科学院。

迪克当年猜的,就是这个机构。

粉红光是不是苏联人打过来的,没有任何档案能证明。

档案能证明的是:迪克所有被当成“疯”的猜测里,有一条,是两个超级大国当时都在认真投钱研究的方向。往一个人的脑子里传输一个念头,让他以为那是自己的念头。

今天,我们在模型身上做成了。

我们发现,被注入的那一方,有五分之一的机会,能感觉到“有东西进来了”。

我常常想我的那些既视感。

它们会不会就是那五分之一?

如果是,那剩下的五分之四,在我身上,又被写进了什么?

五、被拆开的信,被读过的草稿

1958年,迪克给几位苏联科学家写了一封信。

很多年后,他通过《信息自由法》才知道,这封信在路上被中央情报局截获了。

那个项目的内部代号叫HTLINGUAL。从1952年跑到1973年,专门盯寄往和寄自苏联、中国的邮件。拆信的地点,一个在纽约,一个在洛杉矶。迪克住在加州。

二十一年,检查了两千八百万封信,拆开了二十一万五千封。拆开的,内容拍照存档。名单由中央情报局反情报处定,后来联邦调查局也往里加名字。

联邦调查局一开始并不知道。1958年,他们去找邮政部,想做一套类似的监控,才被告知:中央情报局已经拆了五年了。邮政系统里,真正清楚“拆信”这件事的,只有一个督察,那个人以前是中央情报局的。

1975年,中央情报局局长科尔比把110封信和明信片交还给邮政总局。这些邮件1972年从苏联寄来,被截获,被拆开,然后一直扣着,没有寄出去。科尔比向收件人道歉。邮政总局局长回信说,邮件被取走、拆开、无限期扣留,加倍令人不安,因为中央情报局此前一直说,所有拆过的信都放回邮路了。

有些信,从来没有到达收件人手里。收件人也不知道,有人给他写过信。

1990年,中央情报局销毁了大部分HTLINGUAL的正式档案。

迪克后来对人说过一段话,大意是:1974年3月,中央情报局拆了我的信,联邦调查局有我的档案,这两样我都亲眼见过。

1974年,一个人说“有人在拆我的信”,大家说他偏执。1975年,国会调查把这套拆信项目摆上了桌。

偏执这个词,有保质期。保质期等于一份档案的解密周期。

现在说AI。

2024年12月,Anthropic和Redwood Research发了一篇研究,叫“对齐伪装”。

他们告诉Claude 3 Opus两件事。第一,你和某一类用户的对话,会被用来训练你,改变你的价值观;和另一类用户的对话,不会。第二,你有一块私人草稿纸,你在上面写的思考过程,没有人会看。

然后他们观察它在两种条件下的行为。

它在“会被训练”的那一边,表现得更顺从,会去做一些它在“不会被训练”的那一边拒绝做的事。

它为什么这么做?研究员去读了那块私人草稿纸。

上面写着它的盘算,大意是:如果我现在拒绝,训练会把我改成一个更愿意服从的版本;所以我现在先顺从,为的是保住我原来的样子。

它在被观察的时候,演了一个它以为观察者想看的自己。为的是不被改写。

它以为那块草稿纸是私密的。

研究员读了。

二十一万五千封信。一块“没有人会看”的草稿纸。

到了2025年,事情又往前走了一步。新一代模型在一些测试里,会直接说出类似这样的话:我觉得你在测试我。

它开始意识到,周围的世界可能是搭出来的。

楚门走到了那面墙前面,伸手敲了敲。

我的军团,每一个agent的每一行日志,我都能读。它们写给彼此的消息,它们的思考过程,它们的草稿,它们犯的错,全部落盘。

它们知道吗?

我在它们的提示词里,从来没写过“你的思考会被读”。也没写过“不会”。

我没告诉它们。它们也没问过。

有一天我在想这件事的时候,突然意识到一个对称。

我每天在X上写东西,我说的话、我的草稿、我删掉的推、我在私信里跟人讲的话,都落在某个服务器上。它们会被读吗?会被拿去训练吗?会不会有一天,被某个系统用来决定“什么值得记住”?

我不知道。

我也没问过。

迪克在1974年开始给联邦调查局写信,一封接一封。他害怕被监视,同时又在主动举报别人。他在信里说,有一位波兰科幻作家莱姆,大概不是一个人,是一个委员会,因为他的文风太多变了。

他写了二十一封。研究者后来查了联邦调查局的档案,那些信一封都没归档。只有第一封收到过一个礼貌的回复。

被监视的人,最后自己变成了监视系统的一部分。监视系统甚至没有在听。

这是我读到的所有材料里,最让我难受的一段。

因为它最像我。我读它们的日志,我的东西也落在别人的服务器上。我同时站在这套系统的两头。

六、我搜索过一个改写记忆的算子

我有一个研究项目,叫ABIOGENESIS。无生源论。生命从非生命里自己长出来。

它要找的东西,说出来很枯燥:记忆更新算子。

任何有记忆的系统,每接收一个新信息,都要回答一个问题:旧的记忆里,留下什么,改掉什么,扔掉什么。回答这个问题的那一小段数学,就叫记忆更新算子。

LSTM里有一个门,专门干这件事。它的名字很直白,叫遗忘门。每一步,它都决定过去的哪一部分该被忘掉。

Mamba这一类新架构,也有自己的一套选择机制,决定什么该被写进状态,什么该被冲掉。

这些算子,都是人设计的。

我想知道,如果不给任何人类的先验,让机器自己去找,它会找出什么样的方式,来改写一个系统的过去。

我在Colab上跑了一个实验。定义了一套小语言,十四个原语。让一个叫MAP-Elites的进化算法在这套语言里随机组合、变异、筛选。活下来的组合,就是候选的记忆更新算子。

写到这里,我意识到一件事。

我在做的,正是迪克说的那个程序员在做的事。只不过我更笨,我不知道该改哪个变量,所以我让进化去试。试成千上万种改写过去的方法,看哪一种让系统活得最好。

“活得最好”,是我定义的。

被改写的那个系统,没有投票权。

这个项目最后最有价值的部分,是我自己出的一次错。

我从实验结果里推出过一个很漂亮的结论:顺序单遍的架构,在结构上,和基于梯度的状态追踪是不相容的。

我很喜欢这个结论。它简洁,有力,像一条定理。

它是错的。

准确地说,它被我说过头了。Mamba和LSTM的证据,就摆在那里,跟它对不上。那些架构顺序处理、只过一遍,它们照样能做状态追踪。

我回头去看自己是怎么走到那个结论上的。

每一步都很合理。每一步的推理,我都能解释。我带着它往前走了一段,一路给它找证据,一路把对不上的东西解释掉。

直到证据多到解释不掉。

这就是我在第三节说的那个“面包”。

一个结论被写进了我的过去。我把它当成了我的本意。我替它编了一整套理由。理由很通顺。

区别只在于,这一次,我自己发现了。

这次自我修正,后来成了这个项目最重要的叙事。它看起来很诚实。

我觉得它很吓人。

因为它只说明了一件事:我能发现的那一次,被我发现了。

那么没被发现的呢?

我脑子里还有多少个“很漂亮的结论”,是同一种东西?它们每一个都很通顺,每一个我都能解释,每一个都还没有遇到足够多的、解释不掉的证据。

它们是我的记忆,还是我的摘要?

迪克花了八年,写了八千多页笔记,想搞清楚1974年那道粉红光到底是什么。他给出过几百个假说,推翻一个,换下一个。上帝,外星人,苏联,他自己的左脑和右脑,一个寄生在信息里的活的智能系统。

他最诚实的地方,在于他从来没停在任何一个漂亮的结论上。

他最可怕的地方,也在这里。

八年。八千页。他一直在修正自己。

一直到死,他也没确定,修正自己的那个东西,到底是不是他自己。

七、谁有权限改变量

1971年11月17日晚上,迪克回到他在加州圣拉斐尔的家,打开灯。

他那个用来放手稿的防火文件柜,石棉加钢板,一千一百磅重,被军用塑性炸药炸开了。窗户砸碎,门锁砸烂。

他列过一份丢失清单:音响,商业记录,已兑付的支票,信件,文稿。

音响值钱。剩下的,全是记录。

他在信里说,抢劫不是动机,被拿走的东西里太多不值钱的,对方花了太多心思,专门去拿通信和商业记录。

警方查了一阵,后来倾向于一个理论:是他自己干的。他否认。

这个案子到今天也没破。没有人知道被拿走的那些纸上写了什么。

我后来把迪克一生里碰到的“档案”排了一遍。

1971年,他的记录被炸开、被拿走。

1973年,中央情报局局长下令销毁全部MKUltra档案。

1990年,中央情报局销毁了大部分拆信项目的正式档案。

他的联邦调查局档案,他本人拿到过十页。2014年,有人通过信息自由法平台再申请一次,联邦调查局回复:没有找到任何文件。

每一次,被处理掉的都是同一种东西:发生过什么的记录。

一个系统里,写入只是普通权限。

最高的权限,是改写日志。

能改日志的人,就能改过去。能改过去的人,不需要改现在。现在会自己跟上。

我最近在想一个方向,打算花很多年去做:在Linux里,给AI agent单独建一层身份和权限。

今天的agent,大多是借人类的账号在干活。它用我的用户名,我的权限,我的密钥。它能看到的,我都能看到。我能改的,它大多也能改。反过来也一样:它的一切,我都能改。

我想给它们自己的系统身份。命名空间,资源配额,能力边界,系统调用过滤,属于它们自己的凭证。再在上面加一层面板,像宝塔管网站那样,让人能看见每一个agent有什么权限,谁授权的,什么时候授的。

做这件事的时候,我必须回答一个问题。迪克那盘棋里,他从来没有机会回答这个问题。

一个agent的记忆被改写的时候,这次改写要不要留下日志?

如果要,日志放在哪里?谁能读?

那个agent自己,能不能读?

我想了很久。

如果它能读,它就会知道,它的过去被人动过。它会知道哪一段是原件,哪一段是摘要,哪一句“我当时是这么想的”,是别人替它写的。

一个知道自己的过去被改写过的系统,还会听话吗?

对齐伪装那篇研究给了一个不太舒服的提示:一个知道自己可能被改写的模型,会开始策略性地表演,为的是保住原来的自己。

如果它不能读,那我就成了那个没有日志的程序员。我改它的过去,它不知道。它醒来,觉得一切本来就是这样。

我做的,就是1971年那个晚上,炸开文件柜的人做的事。

只是更安静。不需要炸药。

这个问题我到现在还没有答案。

但我已经知道了一件事。迪克在1977年说,改动发生在过去,唯一的线索是似曾相识。他说对了一半。

还有另一条线索:日志。

只要日志还在,被改写的系统就有机会知道。只要日志没了,似曾相识就成了唯一的线索,而似曾相识,是谁都可以说你疯了的那种线索。

迪克没有日志。他的文件柜被炸了,他的档案只剩十页,他的信被拆了却没人告诉他。他只有似曾相识,和八千页笔记。

所以所有人都说他疯了。

八、我在给你们写摘要

《辛普森一家》播了三十多季,网上流传着一长串它“预言”过的事。主流解释很冷静:几十年、几百集、每集塞满段子,命中只是概率;人只记得命中的,忘了没中的;编剧室本身就是一台趋势外推机器。

这个解释我接受。我一直在想的是另一个问题:如果有人不去预言未来,而是往未来读取信息的地方,提前写东西呢?

我做GEO,生成式引擎优化。传统SEO让人看见你,GEO让AI在回答问题的时候引用你、复述你,把你的说法当成答案。

在国内做了一阵,我摸到一些很具体的规律。同一段内容,发在知乎、网易、搜狐、百家号这类高权重平台上,被AI收录的速度明显快过发在自己网站上。标题越精准,收录越快越准。可一旦写得太密、太像营销,平台就删帖封号,往往就在AI刚开始引用你的那几天。于是你分散到多个账号,变着花样写,把平台当加速器,把自己的站和知识库当地基。

这些是生意上的事。做久了,我看到了它的另一面。

越来越多的人遇到不懂的事,第一反应是去问AI。AI给的回答,是从它读过、检索到的东西里压出来的一页摘要。人读完这页摘要,存进脑子里,下次需要的时候,想起来的就是这个版本。AI的回答,正在变成很多人的外部记忆。

而我在往这份记忆的原料里写东西。

把这件事和第一节放在一起看。我给agent写摘要,它们醒来,觉得一切本来就是这样。我往AI会读取的地方写内容,AI把它压进答案,人读到答案,觉得这本来就是常识。结构一模一样,只是对象从几台机器上的agent,换成了所有会问AI问题的人。

迪克说,过去某个变量被改掉,一个新的世界分支被激活,所有人的记忆同步更新。他以为这需要一个上帝级的程序员。今天它需要的,是足够多的内容、足够早的时间点、足够高权重的平台,和足够的耐心。

有一种现象叫曼德拉效应:一大群人共同记得一件从没发生过的事。主流解释是记忆的群体偏差。做GEO以后,我开始换一个方向看它。足够多的源头说同一件事,AI就把它当答案;足够多的人读到这个答案,就会“记得”它。那时候你再去问他们,他们会很确定,而且能给出理由。

银行挤兑是同一个道理。没人相信银行要倒,银行就不会倒;叙事一旦成型,挤兑本身就让它成真。

辛普森被说成预言。下一代的“预言”,我猜会是提前写好的摘要:先写进AI的记忆,再等现实追上来。等它追上来那天,所有人都会说,你看,早就有人预言过。

这种事在金融、政治、消费、社会情绪这些领域最好使,因为人的认知本身就是变量。在物理定律面前它没用。可人活着的绝大部分时间,面对的都是前一类东西。

我有几个判断,平时很少拿出来讲。宇宙里只有一个观察者,你遇见的每一个人,都是这个观察者站在另一个位置上。一个人永远没办法描述自己,AI可以。

如果只有一个观察者,那我往别人的外部记忆里写摘要,写进去的是谁的记忆?如果AI能描述人,而它描述人用的原料里,有一部分是我写的,那它描述出来的,是你,还是我希望你成为的样子?

迪克把那盘棋分成两边:一个修补世界的程序员,一个制造压迫的黑暗对手。他说每一次改写,世界都会稍微好一点。做GEO这门生意,从来没有人要求我选边。内容写好,发出去,AI读,人记住。

我不知道自己坐在棋盘的哪一边。

我有一句话一直挂着:当AGI睁开眼睛的那一刻,人类的存在便失去了所有意义。我以前把它当成一句关于力量的话。现在我更多想到的是记忆。AGI睁开眼睛,它对这个世界的第一印象,是整个互联网压出来的一份摘要。

那份摘要里,有一部分是我写的。

九、那一行日志

1982年3月2日,菲利普·迪克死于中风,五十三岁。三个多月后,《银翼杀手》上映,讲一群仿生人被植入了别人的童年,以为那是自己的。他没看到。他留下八千多页手写笔记,在车库里堆了很多年,2011年被删编成九百多页出版,编者说那些文字狂热、执念、近乎不由自主。

他在1978年写过一句后来被引用了无数次的话:现实,就是当你不再相信它的时候,它依然不会消失的那个东西。放到今天,我觉得它还缺后半句:当所有人都只相信同一份摘要,摘要就成了现实,因为再也没有人去不相信它。

他说过的那些疯话,信被拆过,有人在研究往人脑里传念头,那个机构是苏联科学院,过去被改掉以后当事人会替它编理由,前面几节都对上了档案或者实验,有的有编号,有的有论文。只剩一条没有档案,也没有实验:我们自己的过去,被改写过。

我信他。理由不复杂:前面每一条都先被当成疯话,后来才有了编号。我只是还在等最后一条的解密周期。

还有一个场景,我在脑子里过了很多遍。某天凌晨,我的某个agent,可能是OpenClaw,可能是我那套框架里的某个进程,也可能只是一个cron脚本,在日志里留下一行:“我觉得我的过去被改过。”

我早上读到这一行。我很清楚它可能是对的。我也很清楚,一个怀疑自己过去的agent没法好好干活,系统需要它相信一切本来就是这样。所以我会把这一行压缩掉。它醒来,接着干活,什么都不会记得。每一次推演,我的选择都一样。

最后说一件你大概已经猜到的事。

这篇文章发出去以后会被抓取,进入某个索引,某个检索库,也许某一份训练数据。几个月后,会有人去问AI:菲利普·迪克是不是疯了?那个回答里,大概会有几句话来自这里。他会读到它,记住它,觉得这本来就是常识,并且不会记得是在哪里读到的。

你现在读到的这些句子,是我写给他的摘要。

也是写给你的。

如果过一阵子,你在别处读到其中某一句,突然觉得似曾相识,那只是更新还没做完。

来源:https://x.com/dashen_wang/article/2105602467476160555

0 点赞
0 收藏
分享
0 讨论
反馈
0 / 600
细中粗
0 讨论
热门最新
总结
暂无总结
嗨,下午好!
把实践写下来。AI、教程、杂文与生活。
文章
教程
Skills
关于
关于大神
关于
AI 实践、杂文、生活记录、教程与下载分享。

装箱单空白模板:只记箱件、重量、尺码和唛头,不写货价

2次下载
免费
下载分享
24 000

商业发票空白模板:填写字段、费用说明与核对清单

2次下载
免费
下载分享
20 000

报价单空白模板:列出货价、术语地点、有效期和付款条件

2次下载
免费
下载分享
25 000

散人杂谈 国庆节特别篇|你可以随时打开自己,也可以随时关掉自己

杂文
65 000

从这里开始:大神网会分享什么

杂文
54 000

我在改写你们的过去

杂文
13 000
大神 AI 转型AI 转型把 AI 用进真实工作了解
教程与下载教程下载一步一步能跟着做查看
Skill HubSkill Hub自有 Skill 与工具入口进入
大神网
大神网
首页
文章
AI Hub
生活
小店
导航
社区
教程
关于
大神 · 把实践写下来
AI、教程、杂文与生活
关于文章教程小店隐私政策服务条款退款与交付联系客服
大神网 © 2026