For the complete documentation index, see llms.txt. This page is also available as Markdown.

🐳DeepSeek-OCR 2: 実行とファインチューニングのガイド

DeepSeek-OCR-2 をローカルで実行・ファインチューニングする方法のガイド。

DeepSeek-OCR 2 は、DeepSeek が 2026年1月27日に公開した、SOTA のビジョンおよび文書理解向けの新しい 30億パラメータモデルです。このモデルは、単なるテキスト抽出ではなく、より強力な視覚推論を備えた画像からテキストへの変換に重点を置いています。

DeepSeek-OCR 2 は DeepEncoder V2 を導入し、画像を人間と同じ論理順で「見る」ことをモデルに可能にします。

固定グリッド(左上 → 右下)で画像を走査する従来の vision LLM とは異なり、DeepEncoder V2 はまず全体的な理解を構築し、その後、人間のような読み順、つまり最初に何に注目し、次に何を見るか、という順序を学習します。これにより、列をより適切に追い、ラベルと値を結び付け、表を一貫して読み、テキストと構造が混在する複雑なレイアウトでも OCR の精度が向上します。

Unsloth で DeepSeek-OCR 2 をファインチューニングできるようになりました。こちらの 無料ファインチューニングノートブック. で、私たちは 88.6% の改善 を実証しました。

DeepSeek-OCR 2 の実行DeepSeek-OCR 2 のファインチューニング

🖥️ DeepSeek-OCR 2 の実行

モデルを実行するために、最初のモデルと同様に、DeepSeek-OCR 2 は最新の transformers 上で推論と学習を有効にするよう編集されています(精度の変化はありません)。こちらで ご確認いただけます.

モデルを実行するには transformers または Unsloth、推奨設定は次のとおりです:

⚙️ 推奨設定

DeepSeek の推奨設定:

  • Temperature = 0.0

  • max_tokens = 8192

  • ngram_size = 30

  • window_size = 90

サポートモード - 動的解像度:

  • デフォルト: (0-6)×768×768 + 1×1024×1024 — (0-6)×144 + 256 視覚トークン

プロンプトの例:

Visual Causal Flow を使用して、あらゆる文書を markdown に変換します。

🦥 Unsloth: DeepSeek-OCR 2 実行チュートリアル

  1. 最新の unsloth 経由で pip install --upgrade unsloth 。すでに Unsloth をお使いの場合は、以下で更新してください: pip install --upgrade --force-reinstall --no-deps --no-cache-dir unsloth unsloth_zoo

  2. その後、以下のコードで DeepSeek-OCR 2 を実行します:

🤗 Transformers: DeepSeek-OCR 2 実行チュートリアル

NVIDIA GPU 上で Huggingface transformers を使った推論。python 3.12.9 + CUDA11.8 でテスト済みの要件:

🦥 DeepSeek-OCR 2 のファインチューニング

Unsloth は現在、DeepSeek-OCR 2 のファインチューニングをサポートしています。最初のモデルと同様に、動作させるにはこちらの カスタムアップロード を使用する必要があります transformers (精度の変化はありません)。最初のモデルと同様に、Unsloth は DeepSeek-OCR-2 を 40% 少ない VRAM で 1.4 倍高速に学習し、精度を損なうことなく 5 倍長いコンテキスト長を実現します。 今なら、無料の Colab ノートブックから DeepSeek-OCR 2 をファインチューニングできます。

ペルシア語における CER(文字誤り率)の精度改善は以下をご覧ください:

サンプルごとの CER(10 サンプル)

idx
OCR1 前
OCR1 後
OCR2 前
OCR2 後

1520

1.0000

0.8000

10.4000

1.0000

1521

0.0000

0.0000

2.6809

0.0213

1522

2.0833

0.5833

4.4167

1.0000

1523

0.2258

0.0645

0.8710

0.0968

1524

0.0882

0.1176

2.7647

0.0882

1525

0.1111

0.1111

0.9444

0.2222

1526

2.8571

0.8571

4.2857

0.7143

1527

3.5000

1.5000

13.2500

1.0000

1528

2.7500

1.5000

1.0000

1.0000

1529

2.2500

0.8750

1.2500

0.8750

平均 CER(10 サンプル)

  • OCR1:1.4866、後 0.6409 (-57%)

  • OCR2:4.1863、後 0.6018 (-86%)

📊 ベンチマーク

DeepSeek-OCR 2 モデルのベンチマークは、公式研究論文に基づいています。

表 1: OmniDocBench v1.5 における文書読取の包括的評価。V-token𝑚𝑎𝑥 は、このベンチマークでページごとに使用される視覚トークンの最大数を表します。R-order は読み順を示します。DeepSeek OCR および DeepSeek OCR 2 を除く他のすべてのモデル結果 は、この表では OmniDocBench リポジトリから取得しています。

表 2: OmniDocBench v1.5 における文書要素のカテゴリ別の編集距離。 V-token𝑚𝑎𝑥 は、使用される視覚トークンの最大数の最小値を示します。

OmniDocBench で Gemini-3 Pro を上回る

最終更新

役に立ちましたか?