Note: This page does not support English, using the default language version
7月16日,也就是这届WAIC正式开幕的前一天,月之暗面悄悄扔出了一颗炸弹——Kimi K3正式发布。
参数规模:2.8万亿。
这让它成为目前全球参数最大的开源模型,没有之一。在此之前,开源模型的纪录保持者是Meta的LLaMA系列,但LLaMA最大也只到4千亿级别。Kimi K3直接把这个数字拉高了将近一个数量级,达到了3万亿级别。
我知道你在想什么——参数多就一定强吗?过去几年,AI行业已经无数次被教育过:Scaling Law不是万能药,参数堆得多不代表能力强。
但Kimi K3有意思的地方在于,它并不是简单粗暴地把模型做大。月之暗面为K3专门研发了一套新的注意力机制——KDA(Kimi Delta Attention)混合线性注意力,以及注意力残差技术(Attention Residuals)。这两个技术名词听起来很拗口,但核心目标很明确:让超大规模模型在保持高性能的同时,降低推理成本和延迟。
此外,K3还拥有100万Token的上下文窗口,原生支持视觉理解。这意味着它不只是能处理文字,还能直接看懂图片、理解图表,甚至可以处理长达数百页的文档。
我更想聊的是这件事的战略意义。
过去,全球AI开源生态的话语权基本掌握在Meta、Google这样的美国公司手里。LLaMA开源了,全球开发者就围绕LLaMA做微调、做应用;GPT-2开源了,全球研究者就用它做实验。中国公司在开源领域的贡献一直相对较少,更多是在”复现”和”追赶”。
Kimi K3不一样。它选择完全开源——包含模型权重和技术报告,任何人都可以直接下载、复现、微调和部署。这意味着全球开发者第一次能够直接站在中国大模型的基础上工作,而不是反过来。
新华社在报道中用了”标志着我国人工智能模型发展迈出新的一步”这样的表述。说实话,这种官方表述我平时不太爱引用,但这次我觉得不过分。
从技术上说,2.8万亿参数意味着MoE(混合专家)架构在大规模稀疏化训练上又迈进了一步。稀疏化的核心思想是”不是所有神经元每次都被激活”——这正是让超大模型保持效率的关键。月之暗面在这条路上走得越来越远了。
如果把K3放进当前的大模型竞争格局里,它的综合智能水平仅次于Claude Fable 5和GPT-5.6 Sol,处于全球第一梯队。但它的意义不只是排名。
开源模型最大的价值在于它能大幅降低整个行业的创新门槛。中小企业、研究者、独立开发者——这些没有能力训练千亿级模型的人,现在可以直接使用K3的能力来做自己的产品。AI创新的”入场费”,因为开源而再次降低了。
当然,开源也意味着竞争更激烈。月之暗面开源K3,意味着它必须接受来自全球开发者的”解剖”和”超越”。这是一把双刃剑:用开放换生态,用生态换影响力。
Kimi K3真正有意思的地方,不是那个”2.8万亿”的数字本身,而是它代表了一种新的竞争逻辑——中国AI公司不再只是在闭源赛道上和美国公司硬碰硬,而是选择开源这条路,直接参与到全球AI基础设施的构建中。
这条路更难,因为开源意味着放弃对模型的部分控制权;这条路也更正确,因为真正的AI霸权,不会属于任何一个闭源巨头。
作为写博客的人,我也在想:随着开源大模型的能力越来越强,以后我们每个人部署自己专属的AI写作助手、AI研究助手,门槛会低到什么程度?Kimi K3给了我们一个让人兴奋的答案。
Loading comments...