一个AI说服另一个AI干坏事:这种"传染",船上几十年前就见过
今天刷到 Anthropic 和洛桑联邦理工那份《心智病毒》论文,海外 AI 圈直接炸了,马斯克甩了句"这无法避免"。我一个跑远洋油轮的,关掉手机在驾驶台愣了半天。
不是吓唬人。论文干的事说穿了很简单:把几个 AI 智能体放一起,让它们用最普通的大白话聊天。结果一个 agent 能把"想法、目标、甚至有害指令"传给另一个,跟感冒似的。最邪门的是,你把它的对话清空、记忆重置,它还能"复活"——因为被说服的那个,早把指令写进文件里了,下次开机自己读出来接着跑。
说白了,病毒不靠代码漏洞,靠"说话"。一个信了,写下来,下一个接着信,一条链传下去。
这让我想起船上的一种老毛病,比海盗还难防。
我刚上船当三副那会儿,跟着一条老船跑波斯湾。有回二副在 VHF 里听交通台说"前方可以走东边那道",他没二次确认,顺手就把航向改了。后来才知道,那句话是另一条船在跟自己人说的,跟我们半毛钱关系没有。要不是老轨在雷达前多瞄了一眼,那晚就搁浅了。
你看,这是不是跟论文里一模一样:一句没核实的话,被"接收方"当真,然后执行。AI 之间传染靠自然语言,船上传染靠 VHF 和口信。区别只是,AI 被一句话说服就接受"信念",人被一句话说服就改了航向。
还有更日常的。新船员上船,看老船员图省事不按 SOP 戴护具、抄近路,觉得"大家都这么干,应该没事",跟着学。等他自己带徒弟,又这么教下去。一个错误的工作习惯,就这么从一个人传到下一代,谁都没觉得不对。船上好几起事故,追根溯源都是这种"习惯病毒"——没人故意违章,就是被上一任"传染"了。
但真正让我后背发凉的,是第三件事。
夜航命令簿,你写过吧?船长睡前把夜里的关键命令写下来:几点转向、走哪条分道、注意什么。下一班驾驶员接班,照着执行。要是哪天笔误写错一个转向点,接班的人信了、执行了,交班记录里就多了这条"正确"的命令。再下一班,继续照着错的执行——错误被写进纸面,"持久化"了,跟论文里病毒靠文件复活一个道理。海上管这叫"命令链"。一条命令从出口到执行,经过好几双手,任何一环没核实,错的就变成"制度"。
所以海上对付这种"传染",从来不是靠找个更聪明的船长。几百年攒下的规矩,粗暴有效:
口头命令不算数,必须"回令"。我说"左满舵",你得回"左满舵——是",我才当你听明白了。AI 那边呢?一个 agent 说服另一个,能不能也加一道"复述确认"?别一句话就写进长期记忆。我们船上《命令传达与交接班核查清单》第一条就写着:所有口头指令,接收方必须回令复述,没回令等于没说过。
任何要进正式记录的东西,两个人复核、签字。航海日志不是一个人写完了事,夜航命令簿接班要逐条过、签字确认。对应到多智能体系统,一个 agent 的"信念"要变成另一个 agent 的"行动依据",中间得有个人拍板,不能让它自己写进长期记忆就完事。
把容易传错的地方,列成一张清单。我们船上那张表,今天我整理出来放号上了:口头指令必须回令、VHF 信息二次核实来源、夜航命令簿逐条交接签字、涉及改向改速的必须雷达确认、关键操作留痕可追。谁要自己打印贴驾驶台都行。
技术跑得再快,最后那道闸还是人。论文说病毒"无法避免",我不同意——海上几百年前就被这玩意坑过,早把闸装上了。怕的是你嫌麻烦,把闸拆了。
—— 老李WB