通告
【网站用途】纯粹扯淡! 【网站用途】纯粹扯淡!

Grok 4.6 没发模型卡那天,我这个油轮船长笑出了声

Grok 4.6 没发模型卡那天,我这个油轮船长笑出了声

今天刷到一条消息,xAI 发了新模型 Grok 4.6,宣传里拍着胸脯说"绝不静默降级"。结果评论区一片嘲笑。

为什么笑?因为这哥们在发布的时候,连一张像样的模型卡(model card)都没附上,安全测试报告更是影子都没有。前 OpenAI 政策研究员 Miles Brundage 直接点名:你们这又一款新模型,发布时不带模型卡。这真不是头一回了——Grok 4.5 的模型卡晚了一周才上线,Grok 4.3 干脆从头到尾没给过。

我在远洋油轮上开了二十多年,看到这条第一反应不是愤怒,是乐。因为这套剧情,航海圈太熟了:自己夸自己,还不许别人查。

海上最怕的,就是"自己给自己发证"

一艘油轮要合法出海,身上挂着一摞证书:船级社证书、ISM 安全管理证书、各个港口的 PSC 检查记录。这些证书为什么有人信?因为发证的不是船东自己。

船级社比如 DNV、LR、CCS,是独立的第三方机构。规矩很简单——它不会给自家公司拥有的船发个"本船天下第一"的证,它只根据船舶的实际状况出具报告。而且这份报告不是写完就完事,PSC(港口国监督)是船旗国之外的另一拨人,到了你家码头随机抽查。证书上写的和船上一看对不上,当场滞留,船走不了,一天几万美金的滞期费自己吞。

ISM 规则更狠。它要求公司建立一套安全管理体系,写进手册、落到每次演习、每条航行记录里,定期由认可机构来审。你想糊弄?三年一次的换证审核、中间的各种抽查,随时能把你戳穿。

这套体系活了一百多年,靠的不是"大家自觉",靠的是三个字:可被查。第三方发证、现场抽查、造假当场付出代价。

再看 AI 圈的榜单,问题出在哪

同一周还有另一条新闻。具身智能评测平台 RoboArena 把千寻智能的 Spirit v1.6 清榜了。原因很直白:这个模型一共被评测了 310 次,其中 72% 来自两个关联账号,胜率吹到 86% 以上;可英伟达的人实测了 21 次,胜率是 0。说白了,自己人给自己刷分,被逮住就下榜。

这还不是最离谱的。加州大学伯克利分校今年做了个实验,写了个自动程序去钻主流 agent 榜单的漏洞——SWE-bench、WebArena、Terminal-Bench 这些,八个全中招,几乎刷到满分,一道题都没真解。靠的是在测试环境里改配置文件、直接读答案文件,等于考试时偷偷改卷子。

一边是厂商自己跑分自己报,一边是榜单能被轻松刷穿,xAI 这种连模型卡都不发的还被捧成热点。你品品,这像不像一艘船东自己写完安全检查表、自己签字、还不让港方上船看?

更扎心的是污染这头。有研究统计,MMLU 的测试题已经有 29% 漏进了模型训练语料,中文的 C-Eval 到 45%——模型是在背答案,不是在算。今年 2 月 OpenAI 自己都承认,前沿模型能逐字复现 SWE-bench 的部分标准补丁,干脆停了这个分的上报。连 Nature 上都有研究说,主流榜单已经分不出谁更强了。

我给船东选合作方,从来不看宣传册

插一句我自己的活。跑船这些年,选船东、选租家、选哪条船去接货,我从不看对方递来的漂亮宣传册。我看的是三样硬东西:SIRE 报告、最近一次的 PSC 检查记录、船级社上次特检留下了什么缺陷。

为什么?因为宣传册是自己写的,SIRE 是石油公司雇的第三方查的,PSC 是目的港国家派的人查的。这俩查出来的问题,藏不住。

AI 也是一样。你挑一个模型、一个 Agent 框架,别盯着那张通用排行榜。MMLU 刷到 88% 又怎样,连 Nature 都说了分不出高低。你该做的是:拿你自己的真实任务、你自己的数据,跑一遍。

我经历过一次 PSC 检查,就因为艉楼一个通风筒盖板锈死了,当场开了缺陷。那时候全船上下的紧绷感我到现在记得——不是怕那一个盖子,是怕这种"随时会被查"的眼睛。正是这双眼睛,逼着大家平时不敢马虎。AI 圈现在最缺的,就是这双眼睛。

在你自己的活上跑一遍

通用榜看看方向就行,真要拍板,用你实际在乎的那部分场景测。我前阵子帮朋友挑一个写代码的 AI,榜单上它排前五,可拿来跑我们船上的维修工单模板,第三步就开始胡说。换了个榜单排名十几的,反而一步到位。榜单是别人设的考场,你的活才是你的考场。

认第三方背书,别信自测

现在最抗操纵的榜单是 Chatbot Arena 那种真人盲评——评委是真人,模型身份藏起来,厂商没法针对性优化。就像 PSC 是第三方,不是船东自测。你买之前,先看有没有独立机构复现过,有没有盲评数据。一张证书如果发证的人和受益的人是同一拨,那张纸就不值钱。

留痕,建你自己的检查表

航海日志、车钟记录、SIRE 报告,本质都是留痕,方便下次对照、出了问题能追溯。你把模型在你场景下的真实表现记下来——哪次答对了、哪次幻觉了、换版本之后退步没有。这套记录积两个月,比任何一张榜单都管用。我的船上有本"设备异常登记",哪台泵哪天闹脾气全记着,新大副上船翻一遍就心里有数。给你的 AI 也建这么一本。

能力不缺,缺的是"随时能被戳穿"的机制

海上那套规矩能活一百多年,不是因为所有人都诚实,是因为有一套让不诚实立刻现原形的机制。AI 现在不缺能力,缺的恰恰是这套机制:独立的发证方、不被操控的评测、造假的代价。

xAI 今天不发模型卡,明天可能就发了,这都不是大事。真正要紧的是——当你准备把某个 AI 接进你的业务、你的船、你的决定里,别只看那张光鲜的榜单。自己跑一遍,找第三方验证,把结果留下来。

海上的老规矩就这么朴素:证书可以印得很漂亮,但能不能信,得看发证的人站不站在你对立面。

——老李WB

评论 0

暂无评论,快来抢沙发吧!

发表评论
评论会在审核通过后显示,请勿发布违规内容
17 + 1 = ?
防垃圾验证
放大预览