YutoGPT

黄仁勋的英伟达真被 Deepseek 300 行代码超越了?Deepseek-R2 可能发布!

AI 可引用摘要

黄仁勋的英伟达真被 Deepseek 300 行代码超越了?Deepseek-R2 可能发布!在 AI 界, 300 行代码干翻英伟达?这听起来像是噱头,但 DeepSeek 的 DeepGEMM 确实在 FP8 计算上达到了 比英伟达 CUTLASS 快 2.7 倍 的水平

黄仁勋的英伟达真被 Deepseek 300 行代码超越了?Deepseek-R2 可能发布!

在 AI 界,300 行代码干翻英伟达? 这听起来像是噱头,但 DeepSeek 的 DeepGEMM 确实在 FP8 计算上达到了 比英伟达 CUTLASS 快 2.7 倍 的水平。

###

DeepSeek 真的挑战了英伟达的霸主地位,还是只是在特定场景下秀了一波技术肌肉?

###

###

让我们看看真相到底如何。

Deepseek API 大降价,这是杀入市场的第一步。 --------------------------------

DeepSeek 今天宣布 错峰优惠,在每天 00:30-08:30 期间,DeepSeek-V3 和 R1 的调用费用大幅降低。

DeepSeek 在 AI 市场的布局更加清晰

与 OpenAI、Anthropic 的 API 价格相比,DeepSeek 这波极限压价无疑是为了抢占开发者生态,当然有网友说,Deepseek-R2 可能要推出!

DeepSeek 能够做到低价,说明其 算力利用率极高,这一点与它的新型 FP8 计算优化策略密切相关。

目前,这一价格政策是错峰策略,但如果长期维持这个策略,可能会引发市场价格战。

那么,回到标题,DeepGEMM 真的“超越”英伟达了吗?或者说他比英伟达更懂 GPU? ------------------------------------------------

DeepSeek 开源的 DeepGEMM 是一个 专为 FP8 计算优化的 GEMM 库,这次的开源 是 AI 计算优化的一次突破,但并不意味着它全面超越了英伟达。它更像是一次精准打击,在 FP8 计算这一细分领域让英伟达感受到了压力。

局部优化,而非全面超越

DeepGEMM 是在特定的 FP8 计算场景下优化,而 CUTLASS 是 通用矩阵计算库,支持更广泛的数据类型(FP16、FP32、INT8 等)。

300 行 vs. 英伟达 10 万行代码

DeepGEMM 代码精简,是因为它聚焦于 FP8 计算,而 CUTLASS 涵盖更广泛的计算任务。DeepSeek 在 FP8 计算上的优化确实领先,但远未颠覆英伟达的整个 AI 加速生态。

FP8 真的“统治”未来吗?

FP8 的优势在于 更高的存储效率和计算吞吐量,但在某些高精度任务(如金融 AI、医学 AI)中,FP16/FP32 仍然更可靠。

英伟达的“护城河”还能守住吗? -------------------

AI 计算的本质是算力,而算力的核心在于硬件。英伟达真正的护城河是 CUDA + GPU 生态,即便 DeepSeek 开源了 DeepGEMM,它依然离不开英伟达的硬件基础。

DeepSeek 的开源能影响英伟达的地位吗?

短期影响有限。DeepSeek 依然在 CUDA 体系内优化计算,并没有跳出英伟达的生态。

长期来看,威胁正在形成。如果 DeepSeek 能在未来支持 AMD MI300X、RISC-V 及 AI 专用芯片,那么它的影响力可能会进一步扩大。

真正的威胁可能是“后 CUDA 时代”。目前 DeepSeek 的策略仍然是 在 CUDA 体系内优化,但如果未来 AI 开源社区转向 非 CUDA 计算架构,那么英伟达的护城河可能会被逐步侵蚀。

如果你有 H100,现在就可以上手 DeepGEMM,实战起来!

硬件要求 --------

需要 NVIDIA Hopper 架构 GPU(如 H100、H800),必须支持 sm\_90a ---------------------------------------------------------

(Hopper Tensor Core)。

软件要求

###

Python 3.8 或以上

###

CUDA 12.3 或以上(推荐 CUDA 12.8+ 以获得最佳性能)

###

PyTorch 2.1 或以上

###

CUTLASS 3.6 或以上

###

步骤一、安装 DeepGEMM -------------------

###

下载源码

git clone --recursive [email protected]:deepseek-ai/DeepGEMM.git

步骤二、注意 recursive 选项确保正确下载 CUTLASS 和 CuTe 依赖库

安装依赖,这一步会 自动创建符号链接 以支持 CUTLASS 和 CuTe 的第三方依赖。

python setup.py develop

如果直接安装。

python setup.py install

步骤三、 在 Python 代码中直接

运行 DeepGEMM(测试 JIT 编译),成功运行 JIT 编译,表示安装完成,可以正常使用 DeepGEMM。 --------------------------------------------------------------

python tests/test_jit.py

步骤四、测试 GEMM 计算(核心功能) ------------------------

这个测试会执行 所有类型的 GEMM 计算,包括:

普通 FP8 GEMM

MoE 连续分组 GEMM

MoE 掩码分组 GEMM

python tests/test_core.py

步骤四、在代码中使用 DeepGEMM -----------------------

###

普通 FP8 矩阵乘法(非分组)

import deep_gemm

计算 FP8 GEMM

lhs是 左侧输入矩阵

rhs是 右侧输入矩阵(FP8 类型,已转置)

返回 BF16 类型的结果

output = deep_gemm.gemm_fp8_fp8_bf16_nt(lhs, rhs)

MoE(专家混合模型)分组 GEMM

####

连续布局(适用于训练前向传播和推理 Prefilling)

####

groups 代表 MoE 专家组数,每个专家处理一部分 token。必须满足 GEMM M 轴对齐要求(get_m_alignment_for_contiguous_layout() 可获取对齐值)。

output = deep_gemm.m_grouped_gemm_fp8_fp8_bf16_nt_contiguous(lhs, rhs, groups)

掩码布局(适用于推理解码阶段)

mask 指定哪些部分需要计算,避免无效计算,提高效率。

output = deep_gemm.m_grouped_gemm_fp8_fp8_bf16_nt_masked(lhs, rhs, mask)

強化大型語言模型的推理

最后,如果 DeepSeek 能跳出 CUDA 体系,支持更多非 CUDA 硬件,那才是英伟达的真正对手。

图片

评论区聊聊:DeepSeek 能挑战英伟达吗? ---------------------------

如果你喜欢这样的深度分析,记得 点赞+转发,星标置顶。带你解读更多 AI 黑科技内幕!

感谢您的阅读!关注本公众号,发送985三个数字后,您会立即免费获得一份价值799的《AI 变现资源》。 ----------------------------------------------------

---

这里是人工智能最前沿。 -----------

---

图片
图片
扫码关注变量棱镜公众号