📙Devstral: So führst du es aus und feinabstimmst es
Führe Mistral Devstral 1.1 aus und feinabstimme es, einschließlich Small-2507 und 2505.
Devstral-Small-2507 (Devstral 1.1) ist Mistrals neues agentisches LLM für Softwareentwicklung. Es überzeugt beim Aufrufen von Tools, beim Erkunden von Codebasen und beim Antrieb von Coding-Agenten. Mistral AI veröffentlichte die ursprüngliche Version 2505 im Mai 2025.
Feinabgestimmt von Mistral-Small-3.1, unterstützt Devstral ein Kontextfenster von 128k. Devstral Small 1.1 hat eine verbesserte Leistung und erreicht einen Wert von 53,6 % auf SWE-bench verified, womit es (10. Juli 2025) das offene Modell Nr. 1 auf dem Benchmark ist.
Unsloth Devstral 1.1 GGUFs enthalten zusätzliche Unterstützung für Tool-Aufrufe und Korrekturen am Chat-Template. Devstral 1.1 funktioniert weiterhin gut mit OpenHands, generalisiert nun aber auch besser auf andere Prompts und Coding-Umgebungen.
Da es sich um ein reines Textmodell handelt, wurde Devstrals Vision-Encoder vor dem Feinabstimmen entfernt. Wir haben optionale Vision-Unterstützung für das Modell hinzugefügt.
Wir haben außerdem im Hintergrund mit Mistral zusammengearbeitet, um beim Debuggen, Testen und Korrigieren möglicher Fehler und Probleme zu helfen! Stellen Sie sicher, Mistrals offizielle Downloads oder die GGUFs von Unsloth / Dynamic-Quants herunterzuladen, um die korrekte Implementierung (d. h. korrekter System-Prompt, korrektes Chat-Template usw.)
Bitte verwenden Sie --jinja in llama.cpp, um den System-Prompt zu aktivieren!
Alle Devstral-Uploads verwenden unsere Unsloth- Dynamic 2.0 Methodik, die die beste Leistung bei den 5-Shot-MMLU- und KL-Divergence-Benchmarks liefert. Das bedeutet, dass Sie quantisierte Mistral-LLMs mit minimalem Genauigkeitsverlust ausführen und feinabstimmen können!
Devstral - Unsloth Dynamic Quants:
🖥️ Devstral ausführen
⚙️ Offizielle empfohlene Einstellungen
Laut Mistral AI sind dies die empfohlenen Einstellungen für die Inferenz:
Temperatur von 0,0 bis 0,15
Min_P von 0,01 (optional, aber 0,01 funktioniert gut; der Standardwert von llama.cpp ist 0,1)
Verwenden Sie
--jinjaum den System-Prompt zu aktivieren.
Ein System-Prompt wird empfohlenund ist eine Abwandlung des System-Prompts von Open Hands. Der vollständige System-Prompt wird bereitgestellt hier.
Unsere Dynamic-Uploads haben das Präfix 'UD'. Diejenigen ohne dieses Präfix sind nicht dynamisch, verwenden aber dennoch unser Kalibrierungs-Dataset.
🦙 Tutorial: So führen Sie Devstral in Ollama aus
Installieren
ollamafalls Sie es noch nicht haben!
Führen Sie das Modell mit unserem dynamischen Quant aus. Beachten Sie, dass Sie
ollama serve &in einem anderen Terminal aufrufen können, falls es fehlschlägt! Wir enthalten alle vorgeschlagenen Parameter (Temperatur usw.) inparamsin unserem Hugging-Face-Upload!Außerdem unterstützt Devstral Kontextlängen von 128K, daher ist es am besten, KV-Cache-Quantisierungzu aktivieren. Wir verwenden 8-Bit-Quantisierung, die 50 % Speicherverbrauch spart. Sie können auch
"q4_0"
📖 Tutorial: So führen Sie Devstral in llama.cpp aus
Laden Sie die neueste
llama.cppstandardmäßig GitHub hierherunter. Sie können auch den folgenden Build-Anweisungen folgen. Ändern Sie-DGGML_CUDA=ONauf-DGGML_CUDA=OFFwenn Sie keine GPU haben oder nur eine CPU-Inferenz möchten. Für Apple-Mac-/Metal-Geräte, setzen Sie-DGGML_CUDA=OFFund fahren Sie dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.
Wenn Sie
llama.cppdirekt zum Laden von Modellen verwenden möchten, können Sie Folgendes tun: (:Q4_K_XL) ist der Quantisierungstyp. Sie können auch über Hugging Face herunterladen (Punkt 3). Dies ist ähnlich wieollama run
ODER laden Sie das Modell über herunter (nach der Installation von
pip install huggingface_hub hf_transfer). Sie können Q4_K_M oder andere quantisierte Versionen wählen (z. B. BF16 in voller Präzision).
Führen Sie das Modell aus.
Bearbeiten Sie
--threads -1für die maximale Anzahl CPU-Threads,--ctx-size 131072für die Kontextlänge (Devstral unterstützt eine Kontextlänge von 128K!),--n-gpu-layers 99für das Auslagern auf die GPU, und zwar für so viele Schichten. Passen Sie es an, falls Ihrer GPU der Speicher ausgeht. Entfernen Sie es außerdem, wenn Sie nur CPU-Inferenz haben. Wir verwenden außerdem 8-Bit-Quantisierung für den K-Cache, um den Speicherverbrauch zu reduzieren.Für den Konversationsmodus:
Für den Nicht-Konversationsmodus, um unseren Flappy-Bird-Prompt zu testen:
Denke daran, <bos> zu entfernen, da Devstral <bos> automatisch hinzufügt! Bitte verwende außerdem --jinja um den System-Prompt zu aktivieren!
👀Experimentelle Vision-Unterstützung
Xuan-Son von Hugging Face zeigte in seinem GGUF-Repo wie es tatsächlich möglich ist, den Vision-Encoder von Mistral 3.1 Instruct auf Devstral 2507 zu „transplantieren“. Wir haben außerdem unsere mmproj-Dateien hochgeladen, mit denen Sie Folgendes verwenden können:
Zum Beispiel:


🦥 Devstral mit Unsloth feinabstimmen
Genau wie Standard-Mistral-Modelle, einschließlich Mistral Small 3.1, unterstützt Unsloth das Feinabstimmen von Devstral. Das Training ist 2x schneller, verwendet 70 % weniger VRAM und unterstützt 8x längere Kontextlängen. Devstral passt bequem in eine 24-GB-VRAM-L4-GPU.
Leider überschreitet Devstral die Speichergrenzen von 16 GB VRAM leicht, sodass das kostenlose Feinabstimmen in Google Colab derzeit nicht möglich ist. Du kannst das Modell kostenlos feinabstimmen mit unserem Kaggle-Notebook, das Zugriff auf zwei GPUs bietet. Ändere einfach den Modellnamen von Magistral im Notebook auf das Devstral-Modell.
Wenn du eine ältere Version von Unsloth hast und/oder lokal feinabstimmst, installiere die neueste Version von Unsloth:
Zuletzt aktualisiert
War das hilfreich?

