For the complete documentation index, see llms.txt. This page is also available as Markdown.

🐳DeepSeek-OCR 2:如何运行与微调指南

关于如何在本地运行和微调 DeepSeek-OCR-2 的指南。

DeepSeek-OCR 2 是 DeepSeek 于 2026 年 1 月 27 日发布的新一代 30 亿参数模型,面向 SOTA 视觉与文档理解。该模型专注于图像转文本,具备更强的视觉推理能力,而不仅仅是文本提取。

DeepSeek-OCR 2 引入了 DeepEncoder V2,使模型能够以与人类相同的逻辑顺序“看见”图像。

不同于传统视觉 LLM 按固定网格(左上 → 右下)扫描图像,DeepEncoder V2 会先建立全局理解,再学习类似人类的阅读顺序:先关注什么、接下来关注什么,依此类推。这通过更好地遵循列布局、将标签与数值关联、连贯地读取表格,以及处理混合文本 + 结构内容,提升了复杂版面的 OCR 效果。

现在你可以在 Unsloth 中微调 DeepSeek-OCR 2,使用我们的 免费微调 notebook. 我们展示了 88.6% 的提升 ,用于语言理解。

运行 DeepSeek-OCR 2微调 DeepSeek-OCR 2

🖥️ 运行 DeepSeek-OCR 2

为了运行该模型,和第一个模型一样,DeepSeek-OCR 2 已进行了修改,以支持在最新 transformers 上进行推理和训练(准确率无变化)。你可以在 这里找到它.

要在 transformersUnsloth中运行该模型,推荐设置如下:

⚙️ 推荐设置

DeepSeek 推荐以下设置:

  • Temperature = 0.0

  • max_tokens = 8192

  • ngram_size = 30

  • window_size = 90

支持模式 - 动态分辨率:

  • 默认: (0-6)×768×768 + 1×1024×1024 — (0-6)×144 + 256 个视觉 token

提示示例:

使用视觉因果流将任何文档转换为 markdown。

🦥 Unsloth:运行 DeepSeek-OCR 2 教程

  1. 获取最新版本 unsloth 通过 pip install --upgrade unsloth 。如果你已经安装了 Unsloth,请通过以下命令更新: pip install --upgrade --force-reinstall --no-deps --no-cache-dir unsloth unsloth_zoo

  2. 然后使用下面的代码运行 DeepSeek-OCR 2:

🤗 Transformers:运行 DeepSeek-OCR 2 教程

在 NVIDIA GPU 上使用 Huggingface transformers 进行推理。经测试的环境要求:python 3.12.9 + CUDA11.8:

🦥 微调 DeepSeek-OCR 2

Unsloth 现已支持对 DeepSeek-OCR 2 的微调。和第一个模型一样,你需要使用我们的 自定义上传 才能在 transformers 上运行(准确率无变化)。和第一个模型一样,Unsloth 训练 DeepSeek-OCR-2 的速度快 1.4 倍,显存占用减少 40%,上下文长度延长 5 倍且不降低准确率。 你现在可以通过我们的免费 Colab notebook 微调 DeepSeek-OCR 2。

下面是波斯语上 CER(字符错误率)准确率提升的结果:

单样本 CER(10 个样本)

索引
OCR1 之前
OCR1 之后
OCR2 之前
OCR2 之后

1520

1.0000

0.8000

10.4000

1.0000

1521

0.0000

0.0000

2.6809

0.0213

1522

2.0833

0.5833

4.4167

1.0000

1523

0.2258

0.0645

0.8710

0.0968

1524

0.0882

0.1176

2.7647

0.0882

1525

0.1111

0.1111

0.9444

0.2222

1526

2.8571

0.8571

4.2857

0.7143

1527

3.5000

1.5000

13.2500

1.0000

1528

2.7500

1.5000

1.0000

1.0000

1529

2.2500

0.8750

1.2500

0.8750

平均 CER(10 个样本)

  • OCR1: 之前 1.4866,之后 0.6409 (-57%)

  • OCR2: 之前 4.1863,之后 0.6018 (-86%)

📊 基准测试

DeepSeek-OCR 2 模型的基准测试数据取自官方研究论文。

表 1: OmniDocBench v1.5 上文档阅读的综合评估。V-token𝑚𝑎𝑥表示此基准中每页使用的最大视觉 token 数。R-order表示阅读顺序。除 DeepSeek OCR 和 DeepSeek OCR 2 外,本表中其他模型结果均来自 OmniDocBench 仓库。

表 2: OmniDocBench v1.5 中不同类别文档元素的编辑距离。V-token𝑚𝑎𝑥表示最低的最大视觉 token 数。

在 OmniDocBench 上优于 Gemini-3 Pro

最后更新于

这有帮助吗?