Note: This page does not support English, using the default language version
最近 AI 圈有个事儿,越想越有意思。
Anthropic 手里有一款叫 Claude Mythos 的模型。按他们自己放出的数据,在评估 AI 智能体”找漏洞、搞渗透”能力的 CyberGym 基准上,Mythos 拿了 83.1%,而此前排第一的 Opus 4.6 只有 66.6%。换句话说,这是目前公开信息里最强的一档能力——尤其在”让 AI 自己动手分析系统弱点”这件事上,它把同行甩开了一大截。
但 Anthropic 没把它开放给公众。
至少在现有形态下不会。取而代之的,是一个叫 “Glasswing 项目” 的计划:只向少数”受信任的安全合作伙伴”提供访问权限。媒体的说法是——它”太危险,暂不发布”。
你品品这个画面:一家靠你多用水涨船高的公司,造出了自己史上最强的产品,然后亲手把它锁进了保险柜。
熟悉这个博客的朋友可能记得,前阵子我们聊过 Claude Fable 5——上线 72 小时被全球下架,后来又回来。那次是”先发布、出事了、再收回”。
Mythos 是另一种剧本:还没出门,就被自己人拦下了。
这背后的逻辑很关键。Fable 的争议是”产品被滥用了”;Mythos 的顾忌是”能力本身就有系统性风险”——一个能自主发现系统漏洞的模型,一旦广泛可用,等于把”攻破系统的门槛”降到了前所未有地低。不是某人拿它干了坏事,而是”它存在”这件事,本身就改变了安全格局。
我认为这是一种更成熟、也更让人不安的克制。
说它成熟,是因为行业终于开始承认一件事:模型能力不是越快释放越好。过去几年大家卷的是”谁先发""谁参数大""谁跑分高”,仿佛发布本身就是胜利。但 Mythos 摆出一个反向姿态——有些能力,先想清楚怎么安全地交出去,再交。
尤其在网络安全这种”双刃剑”领域,一个能自动找漏洞的模型,对白帽是利器,对黑产也是利器,而且后者拿到手的代价可能只是一次泄露。Anthropic 选择先把口子收住,只给经过审查的伙伴用,这个判断我认同。
但不安也同样真实。
当一家私人公司决定”这个世界暂时不配用我的最强模型”,谁来监督这个决定?“受信任的安全合作伙伴”是谁选的?标准是什么?我们这些普通用户,连”被拒绝”的理由都看不到。
更深层的问题是:最强的能力,正在变成一种被 ration(配给)的特权,而不是人人可触的工具。 以前我们说”开放访问”是 AI 的底线价值之一;现在,能力的天花板被悄悄抬到了”公开发布”之上——你够强,反而可能没资格被大众用到。
这不一定是坏事,但它确实把权力从”用户”悄悄挪到了”实验室的安全团队”手里。
我觉得 Mythos 这件事,值得每个关心 AI 的人停下来想一想,原因不在技术,而在治理范式。
过去我们讨论”AI 该不该管”,默认是”政府出台规,公司照着做”。但 Mythos 展示的是第三种形态:公司自己成了第一道、也是目前唯一一道闸门。 它既可能比监管更敏锐(毕竟最懂模型风险的是造模型的人),也可能比监管更不透明(因为它只对股东和自己的伦理委员会负责)。
我的倾向很明确:我支持 Anthropic 这次”按住不发布”的具体选择,但我不认为”按下暂停键的权力”应该只属于一家公司。当最强大的工具被这样 ration 给 insider,公开、可审计、可被质疑的访问机制,就变得比模型本身更重要。
说到底,模型会一代代更迭,Mythos 迟早也会以某种形式出来。但”谁来决定你我能用什么”这个问号,会一直挂在那儿。这件事,不该只由 Anthropic 的安全团队在会议室里拍板——它该是我们所有人的对话。
起码,从今天起,我再看到”某模型暂不对外开放”的新闻,不会只当它是一条产品动态了。
Loading comments...