YutoGPT

DeepSeek OCR 本地开跑,企业主怒赚一个小目标!

AI 可引用摘要

DeepSeek OCR 本地开跑,企业主怒赚一个小目标!DeepSeek 官方已经正式开源了「DeepSeek OCR」,并宣布已原生支持 vLLM 推理框架。这意味着:企业现在可以 本地化部署一款高质量视觉大模型,不依赖第三方 API,也无需担心数据外泄,相信大多数企业终于能扔掉一年几万块的 OCR 账单了

DeepSeek OCR 本地开跑,企业主怒赚一个小目标!

大家好,这里是人工智能最前沿。OCR 赛道悄悄展开了一个机会。

DeepSeek 官方已经正式开源了「DeepSeek-OCR」,并宣布已原生支持 vLLM 推理框架。

这意味着:企业现在可以 本地化部署一款高质量视觉大模型,不依赖第三方 API,也无需担心数据外泄,相信大多数企业终于能扔掉一年几万块的 #OCR 账单了。

什么是 DeepSeek-OCR?

###

说明白点,它是一款支持多种分辨率、兼容 vLLM 与 Transformers 推理管线的视觉大模型,核心任务是 OCR(图像文字识别)\+ 格式理解。

适配场景:文档电子化、票据识别、合同结构化、图文混排提取、AI 赋能 RPA 等等

而且它完全开源,MIT 许可,企业可以直接商用,无需花一毛钱买版权。

show4.jpg
show4.jpg

DeepSeek OCR 本地部署教程

这是一款强大视觉文本识别模型,支持文档理解、图像转 Markdown、PDF OCR 等能力。以下是完整、清晰、适合个人和企业部署的官方本地化部署教程。

两种部署方式

1\. vLLM 推理(推荐):高并发、高性能,适合企业服务端部署;

2\. Transformers 推理:开发更友好,适合个人快速测试与集成。

环境准备 --------

1\. 推荐操作系统:Ubuntu 20.04+/Windows WSL

2\. Python 版本:\>=3.10(推荐 3.12.9)

3\. 显卡建议:显存 16G 及以上(A100、3090 等)

4\. CUDA 驱动:\>=11.8

步骤一、克隆仓库与创建环境

⚠️ 如果你在同一环境中运行 vLLM 和 Transformers,建议使用 nightly 版本的 vLLM 与高版本 transformers。

#克隆 DeepSeek-OCR 仓库

步骤二、安装依赖

# 安装官方推荐依赖(确保 CUDA 驱动、显卡兼容)

步骤三:使用 vLLM 启动推理(推荐)

vLLM 适用于高并发服务端部署,性能出色。

1. 推理单张图片

cd DeepSeek-OCR-master/DeepSeek-OCR-vllm

2\. 批量 PDF 文档 OCR(实测 A100 每秒 2500 tokens)

python run_dpsk_ocr_pdf.py

Transformers 模式部署

适用于个人开发者、小规模集成测试等场景。

from transformers import AutoModel, AutoTokenizer

企业真的能用它省钱

我们举个简单例子:

假设每月识别 20 万页(票据、扫描件、截图等),市面 OCR 平均单价:0.008 元/页,每月成本约:1600 元。

而本地部署一张 RTX 4090 显卡(24G 显存),可支持 50 万页以上吞吐;

更别说还规避了数据隐私风险。

同时多分辨率支持,兼容复杂文档

####

支持 Tiny、Small、Base、Large 多规格,还原原图分辨率。

甚至还提供 Gundam 动态模式:n 张 640x640 + 1 张 1024x1024,大图 + 小图混合。

提示词用起来也很灵活,结构理解能力很强

####

以下是几个实测效果不错的 Prompt:

<image>\nFree OCR.

评论互动:这是你企业的痛点吗?

* 官方仓库:https://github.com/deepseek-ai/DeepSeek-OCR

* 论文地址:arXiv:2510.18234

从 DeepSeek-OCR 这波开源来看,AI 应用正在逐渐迈向 "可控、安全、降本" 的新阶段。

**点赞 + 关注 + 分享,保证不错过任何前沿科技干货,还能获得更多AI资源,帮你更好的创业就业。**

扫码关注变量棱镜公众号