For the complete documentation index, see llms.txt. This page is also available as Markdown.

🌠Qwen3-VL: Anleitung zum Ausführen

Lerne, Qwen3-VL lokal mit Unsloth feinabzustimmen und auszuführen.

Qwen3-VL sind Qwens neue Vision-Modelle mit Instruct- und Thinking- Versionen. Die Modelle 2B, 4B, 8B und 32B sind dicht, während 30B und 235B MoE sind. Das 235B Thinking LLM liefert modernste Vision- und Coding-Leistung, die mit GPT-5 (high) und Gemini 2.5 Pro konkurriert. Qwen3-VL verfügt über Vision-, Video- und OCR-Fähigkeiten sowie 256K Kontext (kann auf 1M erweitert werden). Unsloth unterstützt Qwen3-VL Fine-Tuning und RL. Trainiere Qwen3-VL (8B) kostenlos mit unseren Notebooks.

Qwen3-VL ausführenQwen3-VL fine-tunen

🖥️ Qwen3-VL ausführen

Um das Modell in llama.cpp, vLLM, Ollama usw. auszuführen, sind hier die empfohlenen Einstellungen:

⚙️ Empfohlene Einstellungen

Qwen empfiehlt diese Einstellungen für beide Modelle (sie unterscheiden sich leicht zwischen Instruct und Thinking):

Instruct-Einstellungen:
Thinking-Einstellungen:

Temperature = 0.7

Temperature = 1.0

Top_P = 0.8

Top_P = 0.95

presence_penalty = 1.5

presence_penalty = 0.0

Ausgabelänge = 32768 (bis zu 256K)

Ausgabelänge = 40960 (bis zu 256K)

Top_K = 20

Top_K = 20

Qwen3-VL verwendete für seine Benchmark-Werte außerdem die folgenden Einstellungen, wie auf GitHub.

Instruct-Einstellungen:

export greedy='false'
export seed=3407
export top_p=0.8
export top_k=20
export temperature=0.7
export repetition_penalty=1.0
export presence_penalty=1.5
export out_seq_length=32768

Thinking-Einstellungen:

export greedy='false'
export seed=1234
export top_p=0.95
export top_k=20
export temperature=1.0
export repetition_penalty=1.0
export presence_penalty=0.0
export out_seq_length=40960

🐛Fehlerbehebungen für Chat-Vorlagen

Bei Unsloth legen wir den größten Wert auf Genauigkeit, daher haben wir untersucht, warum nach dem 2. Durchlauf der Thinking-Modelle llama.cpp abstürzen würde, wie unten zu sehen ist:

Der Fehlercode:

terminate called after throwing an instance of 'std::runtime_error'
  what():  Value is not callable: null at row 63, column 78:
            {%- if '</think>' in content %}
                {%- set reasoning_content = ((content.split('</think>')|first).rstrip('\n').split('<think>')|last).lstrip('\n') %}
                                                                             ^

Wir haben die Thinking-Chatvorlage für die VL-Modelle erfolgreich behoben, daher haben wir alle Thinking-Quants und Unsloths Quants erneut hochgeladen. Sie sollten jetzt alle nach der 2. Unterhaltung funktionieren - andere Quants lassen sich nach der 2. Unterhaltung nicht laden.

Qwen3-VL Unsloth-Uploads:

Qwen3-VL wird ab dem 30. Oktober 2025 nun von llama.cpp für GGUFs unterstützt, sodass du sie lokal ausführen kannst!

📖 Llama.cpp: Anleitung zum Ausführen von Qwen3-VL

  1. Hole dir das neueste llama.cpp auf GitHub hier. Du kannst auch den Build-Anweisungen unten folgen. Ändere -DGGML_CUDA=ON zu -DGGML_CUDA=OFF wenn du keine GPU hast oder nur CPU-Inferenz möchtest. Für Apple Mac / Metal-Geräte, setze -DGGML_CUDA=OFF und fahre dann wie gewohnt fort - Metal-Unterstützung ist standardmäßig aktiviert.

  1. Lass uns zuerst ein Bild holen! Du kannst auch Bilder hochladen. Wir werden verwenden https://raw.githubusercontent.com/unslothai/unsloth/refs/heads/main/images/unsloth%20made%20with%20love.png, das einfach unser Mini-Logo ist und zeigt, wie Finetunes mit Unsloth erstellt werden:

  1. Laden wir dieses Bild herunter

  1. Dann nutzen wir die automatische Modell-Download-Funktion von llama.cpp, probiere dies für das 8B Instruct-Modell aus:

  1. Sobald du drin bist, wirst du den folgenden Bildschirm sehen:

  1. Lade das Bild über /image PATH also /image unsloth.png und drücke dann ENTER

  1. Wenn du ENTER drückst, wird es sagen "unsloth.png image loaded"

  1. Jetzt stellen wir eine Frage wie "Was ist dieses Bild?":

  1. Lade jetzt Bild 2 über /image picture.png und drücke dann ENTER und frage "Was ist dieses Bild?"

  1. Und schließlich fragen wir, wie beide Bilder miteinander verbunden sind (es funktioniert!)

  1. Du kannst das Modell auch über (nach der Installation von pip install huggingface_hub hf_transfer ) von HuggingFace herunterladen, snapshot_download was für große Model-Downloads nützlich ist, da der automatische Downloader von llama.cpp hinterherhinken könnte. Du kannst Q4_K_M oder andere quantisierte Versionen wählen.

  1. Führe das Modell aus und probiere einen beliebigen Prompt aus. Für Instruct:

  1. Für Thinking:

🪄Qwen3-VL-235B-A22B und Qwen3-VL-30B-A3B ausführen

Für Qwen3-VL-235B-A22B werden wir llama.cpp für optimierte Inferenz und eine Vielzahl von Optionen verwenden.

  1. Wir folgen ähnlichen Schritten wie oben, aber diesmal müssen wir auch zusätzliche Schritte durchführen, weil das Modell so groß ist.

  2. Lade das Modell über (nach der Installation von pip install huggingface_hub hf_transfer ). Du kannst UD-Q2_K_XL oder andere quantisierte Versionen wählen..

  3. Führe das Modell aus und probiere einen Prompt aus. Stelle die richtigen Parameter für Thinking vs. Instruct ein.

Instruct:

Thinking:

  1. Bearbeite, --ctx-size 16384 für die Kontextlänge, --n-gpu-layers 99 für GPU-Offloading für wie viele Layer. Versuche, ihn anzupassen, wenn deiner GPU der Speicher ausgeht. Entferne ihn auch, wenn du nur CPU-Inferenz hast.

🐋 Docker: Qwen3-VL ausführen

Wenn du bereits Docker Desktop hast, führe den folgenden Befehl aus, um Unsloths Modelle von Hugging Face zu verwenden, und fertig:

Oder du kannst die von Docker hochgeladenen Qwen3-VL-Modelle ausführen:

🦥 Qwen3-VL fine-tunen

Unsloth unterstützt Fine-Tuning und Reinforcement Learning (RL) für Qwen3-VL, einschließlich der größeren Modelle 32B und 235B. Dazu gehört auch Unterstützung für Fine-Tuning von Video und Objekterkennung. Wie üblich macht Unsloth das Training von Qwen3-VL-Modellen 1,7x schneller, mit 60 % weniger VRAM und 8x längeren Kontexten ohne Genauigkeitsverlust. Wir haben zwei Trainings-Notebooks für Qwen3-VL (8B) erstellt, die du kostenlos auf Colab trainieren kannst:

Das Ziel des GRPO-Notebooks ist es, ein Vision-Language-Modell mit einem Bildinput wie unten gezeigt mathematische Probleme per RL lösen zu lassen:

Diese Qwen3-VL-Unterstützung integriert außerdem unser neuestes Update für noch speichereffizienteres und schnelleres RL, einschließlich unserer Standby-Funktion, die im Vergleich zu anderen Implementierungen einzigartig die Geschwindigkeitsverschlechterung begrenzt. Mehr darüber, wie man Vision-LLMs mit RL trainiert, kannst du in unserem VLM GRPO-Leitfaden.

Training mit mehreren Bildern

Um Qwen3-VL mit mehreren Bildern feinzujustieren oder zu trainieren, ist die einfachste Änderung,

durch folgendes zu ersetzen:

Die Verwendung von map aktiviert Dataset-Standardisierung und Arrow-Verarbeitungsregeln, die streng und komplizierter zu definieren sein können.

Zuletzt aktualisiert

War das hilfreich?