For the complete documentation index, see llms.txt. This page is also available as Markdown.

🐳DeepSeek-OCR 2 : guide d’exécution et de fine-tuning

Guide sur la manière d’exécuter et de fine-tuner DeepSeek-OCR-2 localement.

DeepSeek-OCR 2 est le nouveau modèle de 3 milliards de paramètres pour la vision SOTA et la compréhension de documents, publié le 27 janvier 2026 par DeepSeek. Le modèle se concentre sur l’image vers texte avec un raisonnement visuel plus fort, et pas seulement sur l’extraction de texte.

DeepSeek-OCR 2 introduit DeepEncoder V2, qui permet au modèle de « voir » une image dans le même ordre logique qu’un humain.

Contrairement aux LLM de vision traditionnels qui analysent les images selon une grille fixe (haut gauche → bas droite), DeepEncoder V2 construit d’abord une compréhension globale, puis apprend un ordre de lecture proche de celui d’un humain : quoi regarder en premier, ensuite, et ainsi de suite. Cela améliore l’OCR sur les mises en page complexes en suivant mieux les colonnes, en reliant les étiquettes aux valeurs, en lisant les tableaux de manière cohérente et en gérant les mélanges de texte et de structure.

Vous pouvez désormais fine-tuner DeepSeek-OCR 2 dans Unsloth via notre notebook gratuit de fine-tuning. Nous avons démontré une amélioration de 88,6 % pour la compréhension du langage.

Exécution de DeepSeek-OCR 2Fine-tuning de DeepSeek-OCR 2

🖥️ Exécution de DeepSeek-OCR 2

Afin d’exécuter le modèle, comme le premier modèle, DeepSeek-OCR 2 a été modifié pour permettre l’inférence et l’entraînement sur les derniers transformers (sans changement de précision). Vous pouvez trouver ici.

Pour exécuter le modèle dans transformers ou Unsloth, voici les paramètres recommandés :

⚙️ Paramètres recommandés

DeepSeek recommande ces paramètres :

  • Température = 0,0

  • max_tokens = 8192

  • ngram_size = 30

  • window_size = 90

Modes de prise en charge - résolution dynamique :

  • Par défaut : (0-6)×768×768 + 1×1024×1024 — (0-6)×144 + 256 jetons visuels

Exemples d’invite :

Transforme n’importe quel document en markdown à l’aide de Visual Causal Flow.

🦥 Tutoriel Unsloth : exécuter DeepSeek-OCR 2

  1. Obtenez la dernière unsloth via pip install --upgrade unsloth . Si vous avez déjà Unsloth, mettez-le à jour via pip install --upgrade --force-reinstall --no-deps --no-cache-dir unsloth unsloth_zoo

  2. Utilisez ensuite le code ci-dessous pour exécuter DeepSeek-OCR 2 :

🤗 Transformers : tutoriel pour exécuter DeepSeek-OCR 2

Inférence à l’aide de Huggingface transformers sur des GPU NVIDIA. Exigences testées sur python 3.12.9 + CUDA11.8 :

🦥 Fine-tuning de DeepSeek-OCR 2

Unsloth prend désormais en charge le fine-tuning de DeepSeek-OCR 2. Comme pour le premier modèle, vous devrez utiliser notre téléversement personnalisé pour qu’il fonctionne sur transformers (sans changement de précision). Comme pour le premier modèle, Unsloth entraîne DeepSeek-OCR-2 1,4x plus vite avec 40 % de VRAM en moins et des longueurs de contexte 5x plus longues sans dégradation de la précision. Vous pouvez désormais fine-tuner DeepSeek-OCR 2 via notre notebook Colab gratuit.

Voir ci-dessous les améliorations de précision CER (taux d’erreur de caractères) sur la langue persane :

CER par échantillon (10 échantillons)

idx
OCR1 avant
OCR1 après
OCR2 avant
OCR2 après

1520

1.0000

0.8000

10.4000

1.0000

1521

0.0000

0.0000

2.6809

0.0213

1522

2.0833

0.5833

4.4167

1.0000

1523

0.2258

0.0645

0.8710

0.0968

1524

0.0882

0.1176

2.7647

0.0882

1525

0.1111

0.1111

0.9444

0.2222

1526

2.8571

0.8571

4.2857

0.7143

1527

3.5000

1.5000

13.2500

1.0000

1528

2.7500

1.5000

1.0000

1.0000

1529

2.2500

0.8750

1.2500

0.8750

CER moyen (10 échantillons)

  • OCR1 : avant 1.4866, après 0.6409 (-57%)

  • OCR2 : avant 4.1863, après 0.6018 (-86%)

📊 Benchmarks

Les benchmarks du modèle DeepSeek-OCR 2 sont dérivés de l’article de recherche officiel.

Tableau 1 : Évaluation complète de la lecture de documents sur OmniDocBench v1.5. V-token𝑚𝑎𝑥 représente le nombre maximal de jetons visuels utilisés par page dans ce benchmark. R-order désigne l’ordre de lecture. À l’exception de DeepSeek OCR et DeepSeek OCR 2, tous les autres résultats de modèle dans ce tableau proviennent du dépôt OmniDocBench.

Tableau 2 : Distances d’édition pour différentes catégories d’éléments documentaires dans OmniDocBench v1.5. V-token𝑚𝑎𝑥 désigne le nombre maximal le plus faible de jetons visuels.

Surpasse Gemini-3 Pro sur OmniDocBench

Mis à jour

Ce contenu vous a-t-il été utile ?