最近有一条新闻,夹在 GPT-5.6 发布、Claude Fable 5 下架又上架的喧嚣里,没引起太多关注。但我看了之后,觉得这事挺有意思的,想专门聊聊。
OpenAI 把 GPT-5.6 旗舰模型 Sol,部署在了 Cerebras 的专用 AI 推理芯片上。注意,不是 GPU,是 Cerebras——那家专门做”一整块晶圆做成一颗芯片”的奇葩公司。他们的芯片 WSE-3(Wafer Scale Engine),一张卡片就等于传统好几十张 H100 组成的集群。
结果是什么?推理速度 750 tokens/秒。
这是个什么概念?现在大家用 GPT-5、Claude 4 的 API,推理速度大概在 50-70 tokens/秒左右。750 是这个数字的 10 到 15 倍。
很多人可能会觉得,“推理快一点”只是技术参数,跟我有什么关系?
其实关系大了。
现在的 AI 应用,有一类场景天然受制于推理速度——多轮对话、实时语音助手、长文档解析、AI 代码补全。这些场景要求 AI 必须在秒级时间内给出反馈,一旦延迟超过几百毫秒,体验就会断崖式下降。
举个例子:你在 IDE 里写代码,AI 给你补全。如果补全 50 个词需要 3 秒钟,你会觉得”这东西有点慢,但还能忍”。但如果补全 50 个词只需要 0.07 秒呢?那就是即时的感觉,你会真的把 AI 当成”第二个我”在工作流里。
750 tokens/秒,意味着 AI 可以在 一秒钟内生成一篇短推文,或者在 两秒钟内读完并总结一篇 3000 字的文章。这不是改进,这是一个新的量级。
这件事背后还有一个更宏观的叙事:AI 推理,正在从 GPU 向专用芯片迁移。
GPU 的优势是通用性——可以用来训练,也可以用来推理。但 AI 推理的运算模式其实是固定的(矩阵乘法为主),专用芯片可以把这个模式做到极致,省掉 GPU 那些”通用但用不上的部分”。
Cerebras 的路线就是极端化的例子:一张整片晶圆做的芯片,里面有 85 万个 AI 核心,全部专门用来跑矩阵运算。没有 PCIe 总线延迟,没有多卡通信开销,核与核之间用片上网络直连。
这就像从”大货车拉快递”变成了”传送带直送”。货还是那个货,但方式完全变了。
这里有个有趣的信号:OpenAI 自己有能力买 GPU、自建集群,为什么要把旗舰模型交给 Cerebras?
原因很可能是成本和效率。
训练和推理是两件事。训练需要大量并行(几千上万张卡一起跑),而推理需要的是单次请求的低延迟高吞吐。OpenAI 的算力大头目前被 GPT-5 的训练占用着,拿出一部分旗舰模型部署到更高效的推理芯片上,可以在不新增大量 GPU 投入的情况下,提升 API 的响应质量。
换句话说:OpenAI 在做算力分配的优化。把训练和推理分开,用更合适的芯片做更合适的事。
如果 Cerebras 上的 GPT-5.6 Sol 能大规模开放 API,价格也会随之调整。目前没有确切数字,但推理芯片的成本优势通常能传导到价格端。
这对独立开发者和小型团队是好事。以前只有大公司才能用上的”极速 AI 推理”,如果 Cerebras 方案规模化,成本降到合理区间,更多实时 AI 应用会成为可能——实时翻译、语音对话 AI、代码助手、视频内容分析……
当然,OpenAI 目前只在小范围灰度测试 Cerebras 方案,大规模开放还需要时间。但这个方向已经打开了。
AI 推理芯片化这件事,其实早就开始了——Google 有 TPU,AWS 有 Inferentia,Microsoft 有自己的推理芯片。但 OpenAI 加入这个战局,把战火烧到了一个新的level。
以后我们评价 AI 模型,可能不只看”聪明程度”,还要看”响应速度”。速度和智能,在真实产品里同等重要。
750 tokens/秒这个数字,值得记住。它不是一个技术指标,它是一个时代的刻度。
正在加载评论...