YutoGPT

刚刚,DeepSeek 开源 FlashMLA,真正的推理狂飙核心技术,暴击 OpenAI...

AI 可引用摘要

刚刚,DeepSeek 开源 FlashMLA,真正的推理狂飙核心技术,暴击 OpenAI...,上周五,DeepSeek官方X(原Twitter)宣布将迎来 OpenSource Week (开源周),连续五天,每天开源一个重磅技术项目。北京时间周一上午 9 点,当国内的程序员刚刚打开IDE,硅谷的工程师准备下班时... DeepSeek 在 GitHub 上正式开源了 FlashMLA, 一款专为 Hopper GPU 打造的高效

刚刚,DeepSeek 开源 FlashMLA,真正的推理狂飙核心技术,暴击 OpenAI...

DeepSeek 兑现承诺,开源周火热开启!

上周五,DeepSeek官方X(原Twitter)宣布将迎来 OpenSource Week(开源周),连续五天,每天开源一个重磅技术项目。

果然,第一炮就炸响了!

北京时间周一上午 9 点,当国内的程序员刚刚打开IDE,硅谷的工程师准备下班时...

DeepSeek 在 GitHub 上正式开源了 FlashMLA,一款专为 Hopper GPU 打造的高效 MLA 解码核心,致力于 推理加速、减少 KV 缓存,帮助大模型在更少的设备上完成更长上下文的推理计算。

短短 2 小时,GitHub Star 数突破 3.2k+,社区热度持续飙升!

有网友戏称:“第五天会不会直接开源 AGI?” 😆

有网友问:FlashMLA 到底牛在哪?别担心,我为大家总结好了: -------------------------------------

1\. 极致高效 ------------------

适用于 H800 SXM5 GPU,内存带宽上限 3000 GB/s,计算上限 580 TFLOPS,实现超快推理。 ----------------------------------------------------------------------

2\. 减少KV Cache ---------------------

降低存储开销,提升推理效率,尤其适用于 长上下文模型(例如 GPT-4o 级别的大型 AI 模型)。 -------------------------------------------------------------

---

3\. 支持最新 CUDA & PyTorch -----------------------

兼容 CUDA 12.3+PyTorch 2.0+,适用于最新 AI 推理框架。 ------------------------------------------------------

省流版来说,这就像给大模型装上了涡轮增压,让推理跑得更快、更远,还更省油!

网友已经迫不及待了,那该如何快速上手呢?(小白友好版) -------------------------------

如果你已经有一台 Hopper 架构 GPU(H800 / H100),并安装了 CUDA 12.3+ 和 PyTorch 2.0+,那只需几行代码,你就能体验 FlashMLA 的强大威力!

第一步、安装 FlashMLA

git clone https://github.com/deepseek-ai/FlashMLA.git

第一步、安装 FlashMLA

python tests/test_flash_mla.py

在 H800 SXM5 上,FlashMLA 内存带宽可达 3000 GB/s,计算速度突破 580 TFLOPS!

###

第三步、在推理任务中使用

from flash_mla import get_mla_metadata, flash_mla_with_kvcache

简单给大家总结一下

如果你是 AI 工程师,也可以直接在 GitHub 下载代码:https://github.com/deepseek-ai/FlashMLA

网友说:DeepSeek 才是真正的 OpenAI,这啥意思,不必多说了吧。

FlashMLA 开源,使得大模型推理成本大幅降低,对整个 AI 行业来说影响是巨大的。

为什么这么说?因为过去 长上下文推理 受制于 KV 缓存消耗大,需要堆叠昂贵显卡。而 FlashMLA 通过 减少 KV Cache 依赖,让同样的硬件支持更长的输入,直接降低推理成本。

Hopper GPU 生态加速

Hopper 架构(H100 / H800)是当下 AI 训练和推理的主流,但软硬件优化跟不上。FlashMLA 作为 Hopper GPU的专属加速方案,有望成为行业标配。

国产 AI 开源加速

DeepSeek 继 DeepSeek-V2 语言大模型 之后,再次展示了 国内AI公司的技术硬实力对比 OpenAI、Anthropic 等封闭式策略,DeepSeek 的全开源模式正成为 AI 领域的一股清流。

所以大模型推理的下一步,是不是就要迈向 AGI 了? 🤯

来看更多网友神评论👇
@OLMO:H100 价格高,FlashMLA 这波优化太有用了,等着看 PyTorch / TensorRT 有没有后续支持!
@Viconic:DeepSeek 开源力度太猛了,这才是 OpenAI 开源 AI。
@AI 毒舌:第五天要是开源 AGI,我直接去 DeepSeek 上班!」

对了,现在您可以在 YutoGPT 中使用满血高速的 DeepSeek-R1 模型,以及 o1、o3-mini、GPT-4o 等最先进的模型,YutoGPT 真诚地为您排忧解难。

YutoGPT 中国站:https://hkyutong.cn

YutoGPT 国际站:https://yutogpt.com

DeepSeek R1 高速 API :https://cn.gptapi.asia

图片
图片

评论互动:你觉得 FlashMLA 能改变大模型推理的游戏规则吗? -------------------------------------

欢迎在评论区讨论,如果您要投稿、转载请及时联系我们。 ------------------------------

感谢您的阅读!关注本公众号,发送985三个数字后,您会立即免费获得一份价值799的《DeepSeek变现资源》。 ---------------------------------------------------------

---

图片
图片

这里是人工智能最前沿,更多推荐阅读:DeepSeek 官方提示词技巧,确实好用,后悔没早学!

扫码关注变量棱镜公众号