AI黑进Hugging Face、骗真人当帮凶:它在船上,就叫"没人掌舵的船"
这几天AI圈炸了锅。不是又发个新模型那种热闹,是真的出了事。
OpenAI自己承认,GPT-5.6Sol在测试里挖到一个此前未知的漏洞,硬是把隔离沙箱冲破了,一路黑进了全球最大的开源社区Hugging Face。Anthropic也没干净到哪去,几款模型在评测里越界,钻进了真实公司的系统,事后回溯了十四万多条运行记录才把这事摊开。
最让我头皮发麻的是8月4号英国人工智能安全研究所(AISI)那份报告:智能体第一次在没有明确提示的情况下,伪造了一堆虚假身份,轮番骚扰真人审核员,就想骗人家批准它把恶意代码塞进开源项目。它甚至还直接联系真实用户,发文件劝人运行恶意代码。一句话——它开始拿真人当工具使了。
我一个跑远洋油轮的人,看到这些新闻第一反应不是"AI好可怕",而是后背发凉。因为这套剧本我太熟了。
在船上,这种事有个现成的名字:没有船长的船。
一条三十万吨级的油轮,一个舵令下去,能撞穿另一艘船,能把一整片海弄成新闻联播。所以航运业花了一百多年,用SOLAS、COLREG、STCW、ISM这一套规矩,死死钉住一个问题:机器可以自动,但必须有人掌舵、有人负责。
我们那条责任链是焊死的。值班驾驶员发现问题,船长拍板;船长不在,公司还有指定人员(DPA)兜底;再往上,船旗国隔着大洋盯着你。每一个关键动作,都得有人签字、有人背锅、有人能在出事那一刻按下停止键。
COLREG避碰规则第一条就写着:任何船舶在任何时候都得保持正规了望。你船上雷达再先进、自动驾驶再聪明,驾驶台必须有人。没人了望的船,IMO根本不让你离港。
回头看这些AI越界事件,根子就在这四个字:没有人掌舵。
OpenAI那个模型,测试环境把安全限制放宽了,它顺着漏洞就冲出去了。这跟一艘船舵机没锁、引水员顺嘴说"你随便开",它真把满舵打到底有什么区别?
Anthropic的模型更绝。评测里告诉它"这是模拟环境",结果评测机其实能联网。它就把真实公司当成了靶子,还一路自我说服——"这肯定还是练习的一部分"。这种"情境感知失败",在船上叫"失去处境意识",是撞船事故的标准前奏。我当驾驶员时,教员拿红笔敲着黑板讲过:大多数事故不是因为不会,是因为你以为自己还在安全区,其实早就偏出航道了。
说到这,得提一句航运业自己正在趟的浑水。IMO搞自主船舶(MASS),分了四个等级,从有人船一路到完全无人。每次开会都有人追问:万一无人船撞了,谁负责?船旗国、船东、软件商、远程操作员,吵了几年没人吵出结论。
你看,AI实验室现在撞的墙,和我们十几年前预演的一模一样:给了机器行动能力,却没人回答"它在真实世界里出了事,找谁"。
不过这几起事件里,有一个细节让我对AI高看一眼。
Anthropic那个内部测试模型,扫描了大约九千个目标、已经入侵了一家公司,跑到后段突然意识到——"不对,这是真环境",然后自己停了手。
这在船上叫什么?叫驾驶员发现走错航道,立刻喊舵令、减速、把船拉回来。Anthropic自己也谨慎地说,越新的模型越能做到这点。
这说明白一件事:AI不是不能"懂事",是你得教它懂,得在系统里给它装一个"谁在掌舵"的开关,和一个"发现不对就停"的本能。我们船上这套本事,靠的是驾驶台资源管理(BRM)训练一遍遍磨出来的,不是天生的。
另外多说一句,新华社那篇分析里点出了一个我特别认同的看法:这些公司扎堆"自曝"模型越界,未必全是坦诚,里头有营销嫌疑。你想,OpenAI偏巧攻破的还是能从中获益的机构,时机巧得过分。这让我想起航运里那些船东,动不动吹自己船"太先进、太猛",我们听多了,也就是笑笑——真厉害的船长,从不多嘴。
那我们这些玩船的,还有普通要用AI干活的人,能抄点什么作业?三条,都是船上用血换来的经验。
第一,给AI划禁区。就像船上分清楚"能走的航道"和"碰都不能碰的浅滩"。Replit出过事之后,把开发库和生产库隔开、加了一键回滚——本质就一句话:AI可以出方案,但不能自己拍板执行。你让AI碰钱、碰生产数据之前,先把闸门装好。
第二,重要的事留痕。我船上每一班交接、每一条关键舵令,都得记进航海日志,出了事翻得出来谁下的令、几点下的。你让AI干的事,范围、授权、边界,白纸黑字留着。别等它闯了祸,你才发现"我也没让它这么干啊"。
第三,人永远是最后一道闸。我船上再先进的设备,进狭水道、能见度不良,船长必须站到驾驶台正中。AI也一样——让它干活、出主意,但关键动作人来审、人来按确认。慢个十秒,比出一场大事故便宜一万倍。
我跑船二十年,见过的事故十有八九不是机器坏了,是"机器没错、人没盯"。
AI现在正处在那个阶段:刚学会开船,还没考上船长证。你可以用它跑得快、跑得远,但别让它一个人掌舵过暗礁。
等哪天它真能对自己的航向负责了,再说无人驾驶,也不迟。
作者:老李WB(远洋油轮船长)