> For the complete documentation index, see [llms.txt](https://unsloth.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://unsloth.ai/docs/de/neu/studio/data-recipe.md).

# Unsloth-Datenrezepte

Mit den Data Recipes von Unsloth Studio können Sie Dokumente wie PDFs oder CSV-Dateien hochladen und in nutzbare/synthetische Datensätze umwandeln. Erstellen und bearbeiten Sie Datensätze visuell über einen Graph-Knoten-Workflow. Dieser Leitfaden macht Sie zunächst mit den Grundlagen vertraut, bevor Sie in Unsloth Data Recipes eintauchen.

<div data-with-frame="true"><figure><img src="/files/a5caf1df8ad39383bc850172cfb4148a532e424b" alt=""><figcaption></figcaption></figure></div>

### So funktioniert Data Recipes

Data Recipes folgt demselben grundlegenden Ablauf. Sie öffnen die Rezepte-Seite, erstellen oder wählen ein Rezept aus, bauen den Workflow im Editor auf, validieren ihn, führen eine Vorschau aus und starten dann den vollständigen Datensatz, sobald die Ausgabe gut aussieht. Fügen Sie Seed-Daten und Generierungsblöcke hinzu, validieren Sie den Workflow, sehen Sie sich eine Vorschau mit Beispieldaten an und führen Sie dann einen vollständigen Datensatzaufbau aus. Unsloth Data Recipes wird angetrieben von **NVIDIA Nemo** [**Data Designer**](https://github.com/NVIDIA-NeMo/DataDesigner).

<div data-with-frame="true"><figure><img src="/files/c07619e6444e7df4863719d03e1ccf428156b6f6" alt=""><figcaption><p>Beispiel für das Erzeugen eines Datensatzes und das Feinabstimmen eines Modells</p></figcaption></figure></div>

Auf den ersten Blick sollte ein üblicher Workflow so aussehen:

1. Öffnen Sie die Rezepte-Seite.
2. Erstellen Sie ein neues Rezept oder öffnen Sie ein vorhandenes.
3. Fügen Sie Blöcke hinzu, um Ihren Datensatz-Workflow zu definieren.
4. Klicken Sie auf **Validieren** um Konfigurationsprobleme frühzeitig zu erkennen.
5. Führen Sie eine Vorschau aus, um Beispielzeilen schnell zu prüfen.
6. Führen Sie einen vollständigen Datensatzaufbau aus, wenn das Rezept bereit ist.
7. Überprüfen Sie Fortschritt und Ausgabe live im Diagramm oder in **Ausführungen** Ansicht für weitere Details.
8. Wählen Sie den resultierenden Datensatz in **Unsloth** und feintunen Sie ein Modell.

### Los geht's

Die Rezepte-Seite ist der zentrale Einstiegspunkt. Rezepte werden lokal im Browser gespeichert, sodass Sie später zu gespeicherten Arbeiten zurückkehren können. Von hier aus können Sie ein leeres Rezept erstellen oder ein geführtes Lernrezept öffnen.

{% hint style="info" %}
Rezepte können exportiert und importiert werden, sodass es einfach ist, Workflows mit anderen Unsloth-Nutzern zu teilen :tada:. Wenn Sie versuchen, ein bestimmtes Datensatzmuster zu erstellen, fragen Sie im Unsloth Discord nach. Vielleicht hat bereits jemand ein Rezept, das geteilt werden kann.
{% endhint %}

<div data-with-frame="true"><figure><img src="/files/5204c373809238a612f5259aeef0e36618efd84f" alt="" width="563"><figcaption><p>Rezepte-Startseite</p></figcaption></figure></div>

Wenn Sie neu beim Konzept von Workflows sind, sind Lernrezepte der schnellste Weg zu sehen, wie Seed-Daten, Prompts, Ausdrücke und Validatoren in einem funktionierenden Beispiel zusammenwirken. Wenn Sie bereits wissen, wie der gewünschte Datensatz aussehen soll, ist es meist schneller, leer zu starten.

#### Wählen Sie einen Startpfad

<table><thead><tr><th>Wenn Sie Folgendes möchten:</th><th>Beginnen mit:</th><th data-hidden></th></tr></thead><tbody><tr><td><sub><strong>Einen benutzerdefinierten Workflow schnell erstellen</strong></sub></td><td><sub><strong>Leer starten</strong></sub></td><td></td></tr><tr><td><sub><strong>Das Produkt an einem Beispiel kennenlernen</strong></sub></td><td><sub><strong>Mit einem Lernrezept starten</strong></sub></td><td></td></tr><tr><td><sub><strong>Frühere Arbeit fortsetzen</strong></sub></td><td><sub><strong>Ein gespeichertes Rezept öffnen</strong></sub></td><td></td></tr></tbody></table>

### Was Sie im Editor erstellen

Im Editor nimmt das Rezept Gestalt an. Sie fügen Blöcke aus dem Blockblatt hinzu, konfigurieren sie in Dialogen, verbinden sie auf der Leinwand und validieren oder starten dann den Workflow.

<div data-with-frame="true"><figure><img src="/files/e5c181a578c5682de6a5ddc14c6873268ff14cbb" alt="" width="563"><figcaption><p>Beispiel für den Aufbau eines Workflows für Produktbeschreibungen</p></figcaption></figure></div>

{% columns %}
{% column %}
Der Editor hat einige Kernbestandteile:

* Die Rezeptkopfzeile, in der Sie das Rezept umbenennen und zwischen **Editor** und **Ausführungen**
* Die Leinwand, auf der der Rezept-Graph angezeigt wird
* Das Blockblatt, in dem Sie neue Blöcke hinzufügen
* Konfigurationsdialoge, in denen Sie Prompts, Referenzen, Modell-Aliasnamen, Validatoren und Seed-Einstellungen definieren.
* Die schwebenden **Führen Sie aus** und **Validieren** Steuerelemente
* hier muss noch mehr hinzugefügt werden

{% endcolumn %}

{% column %}
Die häufigsten Blöcke in einem Rezept sind:

* **Seed** für Eingabedaten von Hugging Face, lokalen strukturierten Dateien (oder unstrukturierten Dokumenten, die in Zeilen zerlegt werden).
* **LLM + Modelle** für Anbieter, Modellkonfigurationen, LLM-Generierungsblöcke und gemeinsame Tool-Profile.
* **Expression** für auf Jinja2 basierende Transformationen, die keinen LLM-Aufruf erfordern.
* **Validatoren** zum Filtern von fehlerhaft generiertem Code mit integrierten Lintern für Python, SQL und JavaScript/TypeScript.
* **Sampler** für deterministische Spalten wie Kategorien und Unterkategorien.
  {% endcolumn %}
  {% endcolumns %}

### Wie Referenzen funktionieren

Die meisten Blöcke, die Daten erzeugen (mit einigen Ausnahmen), werden zu einer Referenz für spätere Blöcke. Das ist eine der zentralen Ideen hinter Data Recipes. Sie erstellen einen Wert einmal und verwenden ihn dann erneut in Prompts, Ausdrücken, strukturierten Ausgaben und Validierungsschritten.

{% hint style="info" %}
Jinja-Ausdrücke helfen Ihnen dabei, mit Werten zu arbeiten, die bereits im Rezept vorhanden sind. Sie können verschachtelte Felder wie `{{customer.first_name}}` , Werte verknüpfen wie `{{customer.first_name}} {{customer.last_name}}` und bedingte Logik mit Mustern wie `{% if condition %}...{% endif %}`&#x20;
{% endhint %}

<div data-with-frame="true"><figure><img src="/files/d720a2e7f1bd667ab1cc93bc9baf07a33c890faf" alt="" width="563"><figcaption><p>Beispiel für im Editor angezeigte Referenzen</p></figcaption></figure></div>

Zum Beispiel:

* Ein Kategorie-Block namens `domain` kann referenziert werden als `{{ domain }}`
* eine Seed-Spalte kann direkt in einem LLM-Prompt verwendet werden, die Spalten in Ihren Seed-Daten (z. B. HF-Datensatzspalten, CSV)
* eine strukturierte LLM-Ausgabe kann Felder für spätere Prompts bereitstellen
* ein Ausdrucksblock kann frühere Werte kombinieren, ohne einen weiteren Modellaufruf

### Was passiert danach?

Vorschauausführungen dienen dem schnellen Iterieren. Sie liefern Beispielzeilen und Analysen im Editor, damit Sie die generierten Daten prüfen können, bevor Sie sich für einen vollständigen Lauf entscheiden.

Vollständige Läufe erstellen ein persistentes lokales Datensatz-Artefakt. Diese Ausgabe erscheint später in Unsloths lokaler Datensatz-Auswahl, wo Sie sie erneut prüfen und für das Fine-Tuning verwenden können. Optional können Sie Ihren Datensatz in Ihrem Hugging-Face-Repo veröffentlichen.

### Kernbausteine

{% columns %}
{% column %}

<div data-with-frame="true"><figure><img src="/files/7476deebda4d3b5e0d49343189258751a13c1df1" alt="" width="188"><figcaption><p>Kernbausteine</p></figcaption></figure></div>
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/e56f0c22d4af755d0a42e713c52907425dc4a89c" alt="" width="188"><figcaption><p>Modell- und LLM-Blöcke</p></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

#### Das Modell-Setup ist in zwei nutzbare Ebenen unterteilt:

* **Modellanbieter** definiert den Endpunkt und die Authentifizierung
* **Modellkonfiguration** definiert den Modellnamen und die Inferenz-Einstellungen

Dieses Setup funktioniert mit gehosteten Anbietern, selbst gehosteten Endpunkten, `vLLM` , `llama.cpp` oder jeder OpenAI-kompatiblen API, die Sie außerhalb von Unsloth betreiben.

{% hint style="info" %}
Rezepte sind nicht auf ein Modell beschränkt. Sie können mehrere **Modellanbieter** und **Modellkonfigurationen** Blöcke hinzufügen und dann verschiedene Modelle für unterschiedliche Schritte verwenden, zum Beispiel eines für Code und ein anderes für allgemeine Textaufgaben.
{% endhint %}

Nach dem Modell-Setup können Sie vier LLM-Blocktypen verwenden:

| Block            | Ausgabe              | Am besten geeignet für                                                          |
| ---------------- | -------------------- | ------------------------------------------------------------------------------- |
| LLM Text         | Freiformtext         | Anweisungen, Erklärungen, Gespräche und Beschreibungen                          |
| LLM Strukturiert | JSON                 | Ausgaben, die feste Felder und eine vorhersehbare Struktur benötigen            |
| LLM Code         | Code                 | Python-, SQL-, Typescript- und andere Code-Generierungsaufgaben                 |
| LLM-Prüfer       | Bewertete Auswertung | Bewertung von Ausgaben mit einer oder mehreren benutzerdefinierten Punkteskalen |

#### Tool-Profile

{% columns %}
{% column %}
Tool-Profil-Blöcke definieren gemeinsamen, auf MCP basierenden Tool-Zugriff für einen oder mehrere LLM-Blöcke. Verwenden Sie sie, wenn ein Generierungsschritt Tools benötigt, zum Beispiel zum Nachschlagen von Code-Dokumentation über `Context7`.

Das Bild links zeigt Context7 MCP, hinzugefügt und im Dialog des Tool-Profil-Blocks konfiguriert:
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/4c275d6e64f3c2c851a71b56edd7a37d4a2c3c35" alt="" width="375"><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

#### Validatoren

{% columns %}
{% column %}
Der Validierungsblock zielt primär auf LLM-Code-Blöcke ab, indem er generierte Codeausgaben durch Linter- und Syntaxvalidierung laufen lässt. Das hilft Ihnen, schlechten oder ungültigen Code aus dem endgültigen Datensatz herauszuhalten, indem er herausgefiltert wird. Die integrierten Optionen decken Python-, SQL- und JavaScript/TypeScript-Validierung ab.
{% endcolumn %}

{% column %}

<div data-with-frame="true"><figure><img src="/files/71139afdb46b9d517a5a64b46a00d82fc31ff3eb" alt=""><figcaption></figcaption></figure></div>
{% endcolumn %}
{% endcolumns %}

### Validieren, Vorschau und ausführen

Sobald der Rezept-Workflow steht, ist der nächste Schritt die Ausführung. Das empfohlene Muster ist: zuerst validieren, dann eine Vorschau für schnelles Feedback ausführen und die generierten Daten in der Ausführungsansicht prüfen; anschließend den vollständigen Datensatz ausführen, wenn Sie das Gefühl haben, dass die Ausgabe Ihrem Plan entspricht.

Verwenden Sie die Ausführungssteuerungen in dieser Reihenfolge:

{% stepper %}
{% step %}

#### Validieren

Klicken Sie auf **Validieren** um Konfigurationsprobleme zu erkennen.
{% endstep %}

{% step %}

#### Vorschau

Führen Sie eine Vorschau aus, um Beispielzeilen und Analysen zu prüfen
{% endstep %}

{% step %}

#### Verfeinern

Verfeinern Sie Prompts, Referenzen, Seed-Einstellungen oder Validatoren.

Iterieren Sie, bis Sie mit den generierten Daten zufrieden sind
{% endstep %}

{% step %}

#### Führen Sie den vollständigen Datensatzaufbau aus

{% endstep %}
{% endstepper %}

<figure><img src="/files/d00a7aed4d815cce3f2d77e797eaafff444e5bef" alt="" width="188"><figcaption></figcaption></figure>


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://unsloth.ai/docs/de/neu/studio/data-recipe.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
