如何评价 7 月 16 日 Kimi 发布的 2.8 万亿级开源模型 K3?

文艺频道··4 min read
说实话,我第一眼看到“2.8万亿参数”这个数字的时候,差点以为自己眼花了。 要知道,之前被吹上天的Llama 3 405B,也不过4050亿参数;GPT-4虽然没公开,坊间传闻也就在1.5万亿到1.8万亿左右。Kimi这一下子干到2.8万亿,还是开源的,这要放在两年前,绝对属于“不讲武德”级别的操作...

说实话,我第一眼看到“2.8万亿参数”这个数字的时候,差点以为自己眼花了。

要知道,之前被吹上天的Llama 3 405B,也不过4050亿参数;GPT-4虽然没公开,坊间传闻也就在1.5万亿到1.8万亿左右。Kimi这一下子干到2.8万亿,还是开源的,这要放在两年前,绝对属于“不讲武德”级别的操作。

技术分析师指着大屏幕上的模型参数对比图

但冷静下来之后,我觉得得先泼一盆冷水——参数大≠能力强

你看去年那些百亿、千亿参数的大模型,很多跑起来效果跟吃了迷魂药似的,逻辑混乱、张嘴胡来。参数规模越大,训练成本、推理成本、部署难度都是指数级飙升。2.8万亿参数,哪怕你用最好的并行策略,普通公司连加载都加载不起来,更别说跑了。所以这个“开源”可能更偏向于“技术报告开源”或者“权重分块开源”,普通人想自己玩玩?还是洗洗睡吧。

程序员面对庞大的服务器集群感到无奈

不过话说回来,Kimi这波操作确实狠。

它等于在向全世界喊话:“我不仅能做这么大的模型,还敢把底牌亮出来。” 对于科研圈和开发者来说,这简直是天降甘露。以前想研究超大模型的架构、训练技巧,只能看论文瞎猜,现在有了K3的权重和代码,等于有人把实验室大门给你踹开了。尤其是那些在高校里做 NLP 方向的博士生,估计看到这消息比过年还开心。

一群年轻研究人员围在电脑前兴奋地讨论开源代码

另外,我还注意到K3是在MoE(混合专家模型)架构上做的。2.8万亿参数里,其实只有一小部分被激活——大概几百亿。这玩意儿好处是省算力,坏处是路由策略要是没调好,专家就变成“专家混子”,白白浪费参数。Kimi要是能把路由效率做到极致,那这个模型在推理成本上就能吊打同等规模的纯稠密模型。

说了半天,到底值不值得关注?我的看法是:别急着吹,也别急着踩。

如果你是个普通用户,目前对K3的体验可能远不如直接用Kimi的App——毕竟人家部署的是优化后的版本,你本地跑不动。但如果你是个技术嗅觉敏锐的人,这绝对是今年最值得啃的“开源硬菜”之一。建议蹲一波后续的评测、跑分和社区魔改,等有人把它精简到可部署的尺寸,那才是真正落地的时刻。

一句话总结:2.8万亿是个信号,不是终点。 它证明了国内团队在超大模型领域的工程能力不输任何人,但能不能转化成好用的产品,还得看落地实操。反正我先把GitHub收藏了,等大佬们出评测了再决定要不要鼓掌。