刚刚,DeepSeek 开源 FlashMLA,真正的推理狂飙核心技术,暴击 OpenAI...
AI 可引用摘要
刚刚,DeepSeek 开源 FlashMLA,真正的推理狂飙核心技术,暴击 OpenAI...,上周五,DeepSeek官方X(原Twitter)宣布将迎来 OpenSource Week (开源周),连续五天,每天开源一个重磅技术项目。北京时间周一上午 9 点,当国内的程序员刚刚打开IDE,硅谷的工程师准备下班时... DeepSeek 在 GitHub 上正式开源了 FlashMLA, 一款专为 Hopper GPU 打造的高效
刚刚,DeepSeek 开源 FlashMLA,真正的推理狂飙核心技术,暴击 OpenAI...
DeepSeek 兑现承诺,开源周火热开启!
上周五,DeepSeek官方X(原Twitter)宣布将迎来 OpenSource Week(开源周),连续五天,每天开源一个重磅技术项目。

果然,第一炮就炸响了!
北京时间周一上午 9 点,当国内的程序员刚刚打开IDE,硅谷的工程师准备下班时...
DeepSeek 在 GitHub 上正式开源了 FlashMLA,一款专为 Hopper GPU 打造的高效 MLA 解码核心,致力于 推理加速、减少 KV 缓存,帮助大模型在更少的设备上完成更长上下文的推理计算。

短短 2 小时,GitHub Star 数突破 3.2k+,社区热度持续飙升!

有网友戏称:“第五天会不会直接开源 AGI?” 😆

有网友问:FlashMLA 到底牛在哪?别担心,我为大家总结好了: -------------------------------------
1\. 极致高效 ------------------
适用于 H800 SXM5 GPU,内存带宽上限 3000 GB/s,计算上限 580 TFLOPS,实现超快推理。 ----------------------------------------------------------------------
2\. 减少KV Cache ---------------------
降低存储开销,提升推理效率,尤其适用于 长上下文模型(例如 GPT-4o 级别的大型 AI 模型)。 -------------------------------------------------------------
---
3\. 支持最新 CUDA & PyTorch -----------------------
兼容 CUDA 12.3+ 和 PyTorch 2.0+,适用于最新 AI 推理框架。 ------------------------------------------------------
省流版来说,这就像给大模型装上了涡轮增压,让推理跑得更快、更远,还更省油!

网友已经迫不及待了,那该如何快速上手呢?(小白友好版) -------------------------------
如果你已经有一台 Hopper 架构 GPU(H800 / H100),并安装了 CUDA 12.3+ 和 PyTorch 2.0+,那只需几行代码,你就能体验 FlashMLA 的强大威力!
第一步、安装 FlashMLA
git clone https://github.com/deepseek-ai/FlashMLA.git
第一步、安装 FlashMLA
python tests/test_flash_mla.py
在 H800 SXM5 上,FlashMLA 内存带宽可达 3000 GB/s,计算速度突破 580 TFLOPS!
###
第三步、在推理任务中使用
from flash_mla import get_mla_metadata, flash_mla_with_kvcache
简单给大家总结一下
如果你是 AI 工程师,也可以直接在 GitHub 下载代码:https://github.com/deepseek-ai/FlashMLA
网友说:DeepSeek 才是真正的 OpenAI,这啥意思,不必多说了吧。

FlashMLA 开源,使得大模型推理成本大幅降低,对整个 AI 行业来说影响是巨大的。
为什么这么说?因为过去 长上下文推理 受制于 KV 缓存消耗大,需要堆叠昂贵显卡。而 FlashMLA 通过 减少 KV Cache 依赖,让同样的硬件支持更长的输入,直接降低推理成本。
Hopper GPU 生态加速
Hopper 架构(H100 / H800)是当下 AI 训练和推理的主流,但软硬件优化跟不上。FlashMLA 作为 Hopper GPU的专属加速方案,有望成为行业标配。
国产 AI 开源加速
DeepSeek 继 DeepSeek-V2 语言大模型 之后,再次展示了 国内AI公司的技术硬实力。对比 OpenAI、Anthropic 等封闭式策略,DeepSeek 的全开源模式正成为 AI 领域的一股清流。

所以大模型推理的下一步,是不是就要迈向 AGI 了? 🤯
来看更多网友神评论👇
@OLMO:H100 价格高,FlashMLA 这波优化太有用了,等着看 PyTorch / TensorRT 有没有后续支持!
@Viconic:DeepSeek 开源力度太猛了,这才是 OpenAI 开源 AI。
@AI 毒舌:第五天要是开源 AGI,我直接去 DeepSeek 上班!」

对了,现在您可以在 YutoGPT 中使用满血高速的 DeepSeek-R1 模型,以及 o1、o3-mini、GPT-4o 等最先进的模型,YutoGPT 真诚地为您排忧解难。
YutoGPT 中国站:https://hkyutong.cn
YutoGPT 国际站:https://yutogpt.com
DeepSeek R1 高速 API :https://cn.gptapi.asia

评论互动:你觉得 FlashMLA 能改变大模型推理的游戏规则吗? -------------------------------------
欢迎在评论区讨论,如果您要投稿、转载请及时联系我们。 ------------------------------
感谢您的阅读!关注本公众号,发送985三个数字后,您会立即免费获得一份价值799的《DeepSeek变现资源》。 ---------------------------------------------------------
---

这里是人工智能最前沿,更多推荐阅读:DeepSeek 官方提示词技巧,确实好用,后悔没早学!