如何评价月之暗面 kimi 最新发布的大模型 k3?对比全球其他大模型能力如何?

文艺频道··6 min read
说实话,我一开始看到月之暗面又发了新模型 k3,心里是有点怀疑的。 毕竟现在大模型赛道卷成这样,每天都有新模型出来吹“吊打 GPT-4”,但你实际用起来往往发现……懂的都懂。但这次 k3 出来之后,我认真测了一周,说实话,有点被惊到了。 先说说 k3 到底强在哪 最直观的感受是: 它的“聪明”程度很...

说实话,我一开始看到月之暗面又发了新模型 k3,心里是有点怀疑的。

毕竟现在大模型赛道卷成这样,每天都有新模型出来吹“吊打 GPT-4”,但你实际用起来往往发现……懂的都懂。但这次 k3 出来之后,我认真测了一周,说实话,有点被惊到了。

先说说 k3 到底强在哪

最直观的感受是:它的“聪明”程度很均匀。很多模型在数学推理上很强,但到了日常对话就变呆;或者写代码一流,但写文案就一股机翻味。k3 属于那种“偏科不严重”的选手,在长文本理解、逻辑推理、多轮对话上都有明显的进步。

它最大的杀手锏其实是 200 万字的上下文窗口。对,你没看错,200 万字。我试过把一整本《三体》三部曲丢进去让它总结剧情脉络,它居然能准确说出“第二部里罗辑和庄颜在卢浮宫的场景里,墙上的画是《自由引导人民》”这种细节。而 GPT-4 处理 128K 上下文就已经开始丢信息了。

测试者使用k3处理《三体》三部曲200万字上下文

和全球其他大模型掰手腕,结果如何?

我用几个典型场景做了盲测:

任务类型 k3 表现 GPT-4o Claude 3.5 Sonnet Gemini 2.0
长文档精读摘要 胜出 良好,但长上下文丢失细节 良好 一般
代码生成(Python/JS) 接近顶级 一流 一流 良好
数学推理 良好 优秀 优秀 良好
创意写作 惊喜 稳定偏套路 有灵气 偏理性
中文理解 完胜 不错,但有翻译腔 较好 一般
多轮对话一致性 优秀 优秀 优秀 良好

程序员在双显示器前对比k3与GPT-4o的代码生成结果

说人话就是:在中文场景下,k3 是当之无愧的第一梯队。特别是一些需要深度理解中文语境、梗、成语、双关语的场景,GPT 们经常翻车,k3 却表现得像个人精。

举个例子,我问它:“你上次夸我聪明,这次又骂我笨,你是不是精神分裂?” GPT-4o 认真地解释了“精神分裂的定义”……而 k3 的回答是:“哈哈,这说明你聪明到连我的夸奖都骗不了你了——我变脸的速度快过川剧,但演技始终如一。”

当然,它也有短板

  • 多模态能力还没完全放开。目前 k3 主要强在文本,图片生成和多模态理解还在追赶,而 GPT-4o 已经能直接看懂图表、生成图片了。
  • 推理速度在复杂任务上偏慢。你问它太复杂的逻辑题,它会像人类一样“嗯……让我想想……”,等待时间比 Claude 长一些。
  • 生态还不够成熟。GPT 有插件、有 API 联动、有庞大的开发者社区,k3 目前还是更偏独立的对话工具。

我的结论

如果你主要做中文内容创作、深度阅读、长文档分析,k3 是目前最好的选择之一,甚至可以说没有之一。月之暗面这家公司是真的懂中文用户需要什么——不是堆参数,而是把长上下文的体验做到极致,把中文的细腻表达刻进模型里。

但如果你需要多模态、需要成熟的生态整合,或者需要处理大量英文材料,GPT-4o 和 Claude 依然是更稳妥的选择。

最后说句掏心窝子的话:国产大模型能卷到这种程度,是真的牛。以前我们总说“追赶”,现在 k3 已经让你觉得在中文领域不输任何国外模型了。下一步,就看它能不能在更多维度上实现超越了。

反正我已经把 k3 设成我的默认助手了。你们呢?