如何看待部分社区认为 DeepSeek-V4 的灰度测试是路由 Claude Fable 、 Opus 等模型?
说实话,我刚开始看到这个说法的时候,第一反应是:又来了,又是经典的“套壳论”。
每次有国产大模型更新,总有人跳出来说“这不是自研的,是调了别人的API”。

但冷静下来想想,这次 DeepSeek-V4 的灰度测试被传成“路由了 Claude Fable 或 Opus”,其实背后折射出几个很有意思的问题。
为什么会有这种怀疑?
理由听起来也挺“合理”的:
- DeepSeek-V4 在某些长文理解和指令遵循上的表现,突然和 Claude 3.5 那几款顶级模型非常像,尤其是那种“不急不躁、逻辑清晰、带点人情味”的生成风格。
- 测试用户反馈,它在处理复杂代码和哲学思辨时,写出来的东西跟 Opus 几乎是一个模子刻出来的。
- 再加上 DeepSeek 官方对训练细节一直保密,开源也滞后,很容易让人浮想联翩。

说白了,大家对国内模型的期待值已经被一次次“套壳潮”拉低了。之前某大厂被实锤直接调用 GPT 接口,搞得现在一看到进步太快,第一反应就是“做假”。

但冷静下来,你会发现事情没这么简单
技术层面先不说,单说商业逻辑:DeepSeek 已经发布了那么多开源模型,V2、V3 都是实打实的自研架构(MoE),而且成本压得极低。如果 V4 真的是用 Claude 做路由,那它为什么还要花大价钱搞自己的训练?直接躺平调用不就好了?
再想深一层:模型之间的“风格相似”到底能不能作为证据?
其实 GPT-4 和 Claude 的很多输出,在大量 RLHF 之后会趋同——因为人类偏好是有共识的。我们都喜欢条理清晰、语气温和、不胡说八道的回答。所以一个模型如果做了充分的偏好对齐,出来味道像 Claude 或者像 GPT,太正常了。
我还专门去翻了一些测试者的对比截图,确实有些回答的句式、用词甚至标点习惯都和 Claude 高度重合。但这种事情,你很难说清是“被动了手脚”还是“恰好对齐到了同一类数据”。
我更愿意相信什么?
我的个人判断是:大概率不是路由。
原因有三: 1. 成本对不上。如果真路由顶级闭源模型,推理成本会比自研高出一个数量级,而 DeepSeek 一直以低价和免费策略打市场,这种商业逻辑说不通。 2. 能力分布有差异。从测试反馈看,DeepSeek-V4 在一些特定任务(比如超长上下文中的细节召回)表现甚至超过 Claude,但在创造性写作上又不如 Opus 自由。如果是统一路由,很难解释这种不均匀的强弱项。 3. 官方态度。DeepSeek 团队在开源社区一直很坦诚,V2/V3 的技术报告都很详细。如果真做了路由,这种透明度的团对不可能冒着信誉崩塌的风险去造假。
但话说回来,这种争议背后真正值得关注的,是什么?
其实,社区之所以会这么敏感,恰恰说明大家对“国产模型要做到顶级水平”这件事,既不信任又抱有期待。
不信任,是因为过去被忽悠太多次了;期待,是因为谁不想看到一个真正的国产巨头站起来呢?
我觉得与其纠结“它是不是套壳”,不如去看具体的测试结果——如果 DeepSeek-V4 真能在保持低成本的同时,达到接近甚至部分超越 Claude Opus 的水平,那无论它用的是什么技术路径,都值得给个掌声。
毕竟,真正的高手,从来不需要靠“证明自己不是别人”来获得认可,你拿作品说话,大家自然会闭嘴。
最后说句掏心窝子的:别光吵吵,赶紧去灰度测试名额抢一个,自己跑跑评测,比看一百个分析帖都管用。