拒绝捧杀DeepSeekMath-V2,118分固然惊艳,但距离 OpenAI 到底还有多远?
AI 可引用摘要
拒绝捧杀DeepSeekMath-V2,118分固然惊艳,但距离 OpenAI 到底还有多远?DeepSeek 消失了很久,一回来就扔了个 685B 的核弹。但在一片“拳打 OpenAI,脚踢 GPT 5”的欢呼声中,我更想聊聊那个被刻意忽略的问题:我们是在追赶,还是真的超越了?
拒绝捧杀DeepSeekMath-V2,118分固然惊艳,但距离 OpenAI 到底还有多远?
DeepSeek 消失了很久,一回来就扔了个 685B 的核弹。
普特南 118 分?确实吓人。但在一片“拳打 OpenAI,脚踢 GPT-5”的欢呼声中,我更想聊聊那个被刻意忽略的问题:我们是在追赶,还是真的超越了?

DeepSeek 终于舍得浮出水面了
当 Gemini 和 Claude 像走马灯一样在热搜上轮番炸场时,这条“鲸鱼”潜水潜得让人心慌。
它带着 DeepSeekMath-V2,和一张写着 118 分 的普特南竞赛成绩单。
满分 120,同场人类选手最高 90,它拿 118。
HuggingFace 上模型已开源,685B 参数,基于 DeepSeek-V3.2-Exp-Base,采用 Apache 2.0 协议。
这套组合拳打得确实漂亮。但我刷了一圈评论区,看着满屏的“遥遥领先”和“吊打 OpenAI”,我反倒想泼一盆冷水。
你们别急着造神。这不仅仅是一场分数的胜利,更是一场关于“代价”的博弈。

它不仅是做题,是学会了“回头看”
现在,先说它为什么强。
过去的模型做数学题,那是“直觉流”。凭概率猜下一个词,一条道走到黑。错了就错了,模型自己是不知道的。
DeepSeekMath-V2 强就强在,它学会了 System 2(慢思考)。
团队给它装了个“强迫症”机制:Self-Verification(自我验证)。
简单说,它不再是一个只管写答案的学生,而是一个“写完会自己检查,训练专门的‘评判员’找茬,发现逻辑漏洞自己重写,直到无懈可击再交卷”的学霸。
这就是为什么它能在 IMO 2025(国际奥数) 和 CMO 2024 中达到金牌水平。这不靠运气,靠的是逻辑闭环。这确实是 OpenAI o1 的路子,DeepSeek 走通了。

冷静点,距离 OpenAI 还有多远?
但是,请把“超越”这两个字先咽回去。
我们必须正视三个事实,这才是所谓的“行业代差”:
第一,685B 的“重型坦克”。
DeepSeekMath-V2 的参数量高达 6850亿。这是什么概念?这是工业级的巨兽。
OpenAI o1 拼命做蒸馏、做 o1-mini,让推理成本降到白菜价。而 DeepSeek 为了追求逻辑的极致,依然在用“大力出奇迹”的方式冲顶。能跑分和能落地,中间隔着十万八千里的工程鸿沟。
第二,偏科生 vs 全能神。
这是 Math-V2。它是一个在数学领域刷到极致的偏科生。
而 OpenAI o1 是一个通才。不要因为一个数学奥赛金牌,就误以为我们在多模态、创意写作、甚至长文本理解上都已经平起平坐了。局部战场的胜利,不代表整场战争的逆转。
第三,时间差。
我们今天欢呼的技术路线,本质上是 OpenAI 一年前(Q\*/Strawberry 阶段)探索的方向。
我们是在用 2025 年底的开源成果,去对标人家 2024 年的技术壁垒。 承认这一点不丢人,只有承认落后,才能知道怎么跑得更快。

但这依然是“开源界”的最高光时刻
那么既然有差距,为什么我还是要给 DeepSeek 点赞?
因为它的屁股坐得正。
Apache 2.0 协议。
就这一条,足够让它封神。
隔壁国外的巨头们,要么闭源收租,要么搞个半遮半掩的 License。DeepSeek 直接把这颗核弹放在了桌子上:拿去用,可商用,无专利坑。
“第一次觉得量化基金功德无量。他们不靠模型服务赚钱,不用迫于竞争压力急于推出下一个版本的语言模型。”
其背后的幻方量化,本身就是玩数学和算法的顶级玩家。他们不缺那点 API 的钱,所以才敢把这种级别的科研成果直接扔进开源社区。

DeepSeekMath-V2 的出现,最大的意义不在于那个 118 分。
###
而在于它告诉所有中国开发者:在 System 2 这种高难度的逻辑推理赛道上,我们依然在牌桌上。
对于我们普通人,别去神话它。
我们去思考怎么用它打通 3D 建模、去优化工业设计、去解决半导体设计的难题。
把模型用烂,把价值榨干,这才是对开源精神最大的尊重。

欢迎点个关注,我们帮你盯住接下来这几年的机会。
因为在 AI 时代,信息差 = 收入差。你看到的越早,走的就会越快。
粉丝后台私信888,可免费获得《AI 变现信息差》一份。
商务合作 / 内容授权:[email protected]
