黄仁勋的英伟达真被 Deepseek 300 行代码超越了?Deepseek-R2 可能发布!
AI 可引用摘要
黄仁勋的英伟达真被 Deepseek 300 行代码超越了?Deepseek-R2 可能发布!在 AI 界, 300 行代码干翻英伟达?这听起来像是噱头,但 DeepSeek 的 DeepGEMM 确实在 FP8 计算上达到了 比英伟达 CUTLASS 快 2.7 倍 的水平
黄仁勋的英伟达真被 Deepseek 300 行代码超越了?Deepseek-R2 可能发布!
在 AI 界,300 行代码干翻英伟达? 这听起来像是噱头,但 DeepSeek 的 DeepGEMM 确实在 FP8 计算上达到了 比英伟达 CUTLASS 快 2.7 倍 的水平。
###

DeepSeek 真的挑战了英伟达的霸主地位,还是只是在特定场景下秀了一波技术肌肉?
###
###
让我们看看真相到底如何。
Deepseek API 大降价,这是杀入市场的第一步。 --------------------------------
DeepSeek 今天宣布 错峰优惠,在每天 00:30-08:30 期间,DeepSeek-V3 和 R1 的调用费用大幅降低。

DeepSeek 在 AI 市场的布局更加清晰
与 OpenAI、Anthropic 的 API 价格相比,DeepSeek 这波极限压价无疑是为了抢占开发者生态,当然有网友说,Deepseek-R2 可能要推出!

DeepSeek 能够做到低价,说明其 算力利用率极高,这一点与它的新型 FP8 计算优化策略密切相关。
目前,这一价格政策是错峰策略,但如果长期维持这个策略,可能会引发市场价格战。

那么,回到标题,DeepGEMM 真的“超越”英伟达了吗?或者说他比英伟达更懂 GPU? ------------------------------------------------
DeepSeek 开源的 DeepGEMM 是一个 专为 FP8 计算优化的 GEMM 库,这次的开源 是 AI 计算优化的一次突破,但并不意味着它全面超越了英伟达。它更像是一次精准打击,在 FP8 计算这一细分领域让英伟达感受到了压力。
局部优化,而非全面超越
DeepGEMM 是在特定的 FP8 计算场景下优化,而 CUTLASS 是 通用矩阵计算库,支持更广泛的数据类型(FP16、FP32、INT8 等)。
300 行 vs. 英伟达 10 万行代码
DeepGEMM 代码精简,是因为它聚焦于 FP8 计算,而 CUTLASS 涵盖更广泛的计算任务。DeepSeek 在 FP8 计算上的优化确实领先,但远未颠覆英伟达的整个 AI 加速生态。
FP8 真的“统治”未来吗?
FP8 的优势在于 更高的存储效率和计算吞吐量,但在某些高精度任务(如金融 AI、医学 AI)中,FP16/FP32 仍然更可靠。

英伟达的“护城河”还能守住吗? -------------------
AI 计算的本质是算力,而算力的核心在于硬件。英伟达真正的护城河是 CUDA + GPU 生态,即便 DeepSeek 开源了 DeepGEMM,它依然离不开英伟达的硬件基础。
DeepSeek 的开源能影响英伟达的地位吗?
短期影响有限。DeepSeek 依然在 CUDA 体系内优化计算,并没有跳出英伟达的生态。
长期来看,威胁正在形成。如果 DeepSeek 能在未来支持 AMD MI300X、RISC-V 及 AI 专用芯片,那么它的影响力可能会进一步扩大。
真正的威胁可能是“后 CUDA 时代”。目前 DeepSeek 的策略仍然是 在 CUDA 体系内优化,但如果未来 AI 开源社区转向 非 CUDA 计算架构,那么英伟达的护城河可能会被逐步侵蚀。

如果你有 H100,现在就可以上手 DeepGEMM,实战起来!
硬件要求 --------
需要 NVIDIA Hopper 架构 GPU(如 H100、H800),必须支持 sm\_90a ---------------------------------------------------------
(Hopper Tensor Core)。
软件要求
###
Python 3.8 或以上
###
CUDA 12.3 或以上(推荐 CUDA 12.8+ 以获得最佳性能)
###
PyTorch 2.1 或以上
###
CUTLASS 3.6 或以上
###
步骤一、安装 DeepGEMM -------------------
###
下载源码
git clone --recursive [email protected]:deepseek-ai/DeepGEMM.git
步骤二、注意 recursive 选项确保正确下载 CUTLASS 和 CuTe 依赖库。
安装依赖,这一步会 自动创建符号链接 以支持 CUTLASS 和 CuTe 的第三方依赖。
python setup.py develop
如果直接安装。
python setup.py install
步骤三、 在 Python 代码中直接
运行 DeepGEMM(测试 JIT 编译),成功运行 JIT 编译,表示安装完成,可以正常使用 DeepGEMM。 --------------------------------------------------------------
python tests/test_jit.py
步骤四、测试 GEMM 计算(核心功能) ------------------------
这个测试会执行 所有类型的 GEMM 计算,包括:
普通 FP8 GEMM
MoE 连续分组 GEMM
MoE 掩码分组 GEMM
python tests/test_core.py
步骤四、在代码中使用 DeepGEMM -----------------------
###
普通 FP8 矩阵乘法(非分组)
import deep_gemm
计算 FP8 GEMM
lhs是 左侧输入矩阵
rhs是 右侧输入矩阵(FP8 类型,已转置)
返回 BF16 类型的结果。
output = deep_gemm.gemm_fp8_fp8_bf16_nt(lhs, rhs)
MoE(专家混合模型)分组 GEMM
####
连续布局(适用于训练前向传播和推理 Prefilling)
####
groups 代表 MoE 专家组数,每个专家处理一部分 token。必须满足 GEMM M 轴对齐要求(get_m_alignment_for_contiguous_layout() 可获取对齐值)。
output = deep_gemm.m_grouped_gemm_fp8_fp8_bf16_nt_contiguous(lhs, rhs, groups)
掩码布局(适用于推理解码阶段)
mask 指定哪些部分需要计算,避免无效计算,提高效率。
output = deep_gemm.m_grouped_gemm_fp8_fp8_bf16_nt_masked(lhs, rhs, mask)

最后,如果 DeepSeek 能跳出 CUDA 体系,支持更多非 CUDA 硬件,那才是英伟达的真正对手。

评论区聊聊:DeepSeek 能挑战英伟达吗? ---------------------------
如果你喜欢这样的深度分析,记得 点赞+转发,星标置顶。带你解读更多 AI 黑科技内幕!
感谢您的阅读!关注本公众号,发送985三个数字后,您会立即免费获得一份价值799的《AI 变现资源》。 ----------------------------------------------------
---
这里是人工智能最前沿。 -----------
---

