For the complete documentation index, see llms.txt. This page is also available as Markdown.

📙Devstral: So führst du es aus und feinabstimmst es

Führe Mistral Devstral 1.1 aus und feinabstimme es, einschließlich Small-2507 und 2505.

Devstral-Small-2507 (Devstral 1.1) ist Mistrals neues agentisches LLM für Softwareentwicklung. Es überzeugt beim Aufrufen von Tools, beim Erkunden von Codebasen und beim Antrieb von Coding-Agenten. Mistral AI veröffentlichte die ursprüngliche Version 2505 im Mai 2025.

Feinabgestimmt von Mistral-Small-3.1, unterstützt Devstral ein Kontextfenster von 128k. Devstral Small 1.1 hat eine verbesserte Leistung und erreicht einen Wert von 53,6 % auf SWE-bench verified, womit es (10. Juli 2025) das offene Modell Nr. 1 auf dem Benchmark ist.

Unsloth Devstral 1.1 GGUFs enthalten zusätzliche Unterstützung für Tool-Aufrufe und Korrekturen am Chat-Template. Devstral 1.1 funktioniert weiterhin gut mit OpenHands, generalisiert nun aber auch besser auf andere Prompts und Coding-Umgebungen.

Da es sich um ein reines Textmodell handelt, wurde Devstrals Vision-Encoder vor dem Feinabstimmen entfernt. Wir haben optionale Vision-Unterstützung für das Modell hinzugefügt.

Alle Devstral-Uploads verwenden unsere Unsloth- Dynamic 2.0 Methodik, die die beste Leistung bei den 5-Shot-MMLU- und KL-Divergence-Benchmarks liefert. Das bedeutet, dass Sie quantisierte Mistral-LLMs mit minimalem Genauigkeitsverlust ausführen und feinabstimmen können!

Devstral - Unsloth Dynamic Quants:

🖥️ Devstral ausführen

⚙️ Offizielle empfohlene Einstellungen

Laut Mistral AI sind dies die empfohlenen Einstellungen für die Inferenz:

  • Temperatur von 0,0 bis 0,15

  • Min_P von 0,01 (optional, aber 0,01 funktioniert gut; der Standardwert von llama.cpp ist 0,1)

  • Verwenden Sie --jinja um den System-Prompt zu aktivieren.

Ein System-Prompt wird empfohlenund ist eine Abwandlung des System-Prompts von Open Hands. Der vollständige System-Prompt wird bereitgestellt hier.

🦙 Tutorial: So führen Sie Devstral in Ollama aus

  1. Installieren ollama falls Sie es noch nicht haben!

  1. Führen Sie das Modell mit unserem dynamischen Quant aus. Beachten Sie, dass Sie ollama serve &in einem anderen Terminal aufrufen können, falls es fehlschlägt! Wir enthalten alle vorgeschlagenen Parameter (Temperatur usw.) in params in unserem Hugging-Face-Upload!

  2. Außerdem unterstützt Devstral Kontextlängen von 128K, daher ist es am besten, KV-Cache-Quantisierungzu aktivieren. Wir verwenden 8-Bit-Quantisierung, die 50 % Speicherverbrauch spart. Sie können auch "q4_0"

📖 Tutorial: So führen Sie Devstral in llama.cpp aus

  1. Laden Sie die neueste llama.cpp standardmäßig GitHub hierherunter. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie -DGGML_CUDA=ON auf -DGGML_CUDA=OFF wenn Sie keine GPU haben oder nur eine CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie -DGGML_CUDA=OFF und fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

  1. Wenn Sie llama.cpp direkt zum Laden von Modellen verwenden möchten, können Sie Folgendes tun: (:Q4_K_XL) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Dies ist ähnlich wie ollama run

  1. ODER laden Sie das Modell über herunter (nach der Installation von pip install huggingface_hub hf_transfer ). Sie können Q4_K_M oder andere quantisierte Versionen wählen (z. B. BF16 in voller Präzision).

  1. Führen Sie das Modell aus.

  2. Bearbeiten Sie --threads -1 für die maximale Anzahl CPU-Threads, --ctx-size 131072 für die Kontextlänge (Devstral unterstützt eine Kontextlänge von 128K!), --n-gpu-layers 99 für das Auslagern auf die GPU, und zwar für so viele Schichten. Passen Sie es an, falls Ihrer GPU der Speicher ausgeht. Entfernen Sie es außerdem, wenn Sie nur CPU-Inferenz haben. Wir verwenden außerdem 8-Bit-Quantisierung für den K-Cache, um den Speicherverbrauch zu reduzieren.

  3. Für den Konversationsmodus:

  1. Für den Nicht-Konversationsmodus, um unseren Flappy-Bird-Prompt zu testen:

👀Experimentelle Vision-Unterstützung

Xuan-Son von Hugging Face zeigte in seinem GGUF-Repo wie es tatsächlich möglich ist, den Vision-Encoder von Mistral 3.1 Instruct auf Devstral 2507 zu „transplantieren“. Wir haben außerdem unsere mmproj-Dateien hochgeladen, mit denen Sie Folgendes verwenden können:

Zum Beispiel:

Anleitung und Ausgabecode
Gerenderter Code

🦥 Devstral mit Unsloth feinabstimmen

Genau wie Standard-Mistral-Modelle, einschließlich Mistral Small 3.1, unterstützt Unsloth das Feinabstimmen von Devstral. Das Training ist 2x schneller, verwendet 70 % weniger VRAM und unterstützt 8x längere Kontextlängen. Devstral passt bequem in eine 24-GB-VRAM-L4-GPU.

Leider überschreitet Devstral die Speichergrenzen von 16 GB VRAM leicht, sodass das kostenlose Feinabstimmen in Google Colab derzeit nicht möglich ist. Du kannst das Modell kostenlos feinabstimmen mit unserem Kaggle-Notebook, das Zugriff auf zwei GPUs bietet. Ändere einfach den Modellnamen von Magistral im Notebook auf das Devstral-Modell.

Wenn du eine ältere Version von Unsloth hast und/oder lokal feinabstimmst, installiere die neueste Version von Unsloth:

Zuletzt aktualisiert

War das hilfreich?