For the complete documentation index, see llms.txt. This page is also available as Markdown.

Unsloth Data Recipes

Unsloth StudioのData Recipesを使って、データセットを作成・構築・編集する方法を学びましょう。

Unsloth Studio の Data Recipes では、PDF や CSV ファイルなどのドキュメントをアップロードして、使用可能な / 合成データセットに変換できます。グラフノードのワークフローで、データセットを視覚的に作成・編集できます。このガイドでは、Unsloth Data Recipes に入る前に、基本を紹介します。

Data Recipes の仕組み

Data Recipes も基本的には同じ流れです。レシピページを開き、レシピを作成するか選び、エディタでワークフローを組み立て、検証し、プレビューを実行してから、出力が問題なければフルデータセットを実行します。シードデータと生成ブロックを追加し、ワークフローを検証して、サンプル出力をプレビューし、最後にフルデータセットのビルドを実行します。Unsloth Data Recipes は次によって支えられています NVIDIA NeMo Data Designer.

データセット生成とモデルのファインチューニング例

一見すると、通常のワークフローは次のようになります:

  1. レシピページを開きます。

  2. 新しいレシピを作成するか、既存のものを開きます。

  3. ブロックを追加して、データセットのワークフローを定義します。

  4. クリック 検証 して、設定の問題を早めに見つけます。

  5. プレビューを実行して、サンプル行をすばやく確認します。

  6. レシピの準備ができたら、フルデータセットのビルドを実行します。

  7. 進捗と出力をグラフ上または 実行 ビューで詳細を確認します。

  8. 結果のデータセットを Unsloth で選択して、モデルをファインチューニングします。

始める

レシピページは主な प्रवेश点です。レシピはブラウザ内にローカル保存されるため、保存した作業に後で戻れます。ここから、空のレシピを作成するか、ガイド付き学習レシピを開けます。

レシピはエクスポートとインポートができるので、他の Unsloth ユーザーとワークフローを簡単に共有できます 🎉。特定のデータセットパターンを作りたい場合は、Unsloth Discord で質問してみてください。すでに共有できるレシピを持っている人がいるかもしれません。

レシピのランディングページ

ワークフローの概念に慣れていないなら、学習用レシピは、シードデータ、プロンプト、式、バリデーターが1つの動作する例でどう組み合わさるかを最速で確認できる方法です。すでに欲しいデータセットの形がわかっているなら、最初から空で始めるほうがたいてい早いです。

開始パスを選ぶ

次のような場合:
開始するもの:

カスタムワークフローをすばやく構築したい

空から始める

例から製品を学ぶ

学習用レシピから始める

前回の作業を続ける

保存済みレシピを開く

エディタで作成するもの

エディタは、レシピが形になる場所です。ブロックシートからブロックを追加し、ダイアログで設定し、キャンバス上で接続し、最後にワークフローを検証または実行します。

商品説明ワークフローを構築する例

エディタにはいくつかの主要部分があります:

  • レシピヘッダー。ここでレシピ名を変更し、次の間を切り替えます エディタ実行

  • レシピグラフが表示されるキャンバス

  • 新しいブロックを追加するブロックシート

  • 設定ダイアログ。ここでプロンプト、参照、モデルエイリアス、バリデーター、シード設定を定義します。

  • フローティング 実行します検証 コントロール

  • ここにはさらに追加する必要があります

Data Recipes で最も一般的なブロックは次のとおりです:

  • シード Hugging Face の入力データ、ローカルの構造化ファイル、または行にチャンク化される非構造化ドキュメント用。

  • LLM + モデル プロバイダー、モデル設定、LLM 生成ブロック、共有ツールプロファイル用。

  • LLM 呼び出しを必要としない Jinja2 ベースの変換用。

  • バリデーター Python、SQL、JavaScript/TypeScript 用の組み込みリンターで、生成された不正なコードを除外するため。

  • サンプラー カテゴリやサブカテゴリなどの決定的な列用。

参照の仕組み

データを生成するほとんどのブロックは(いくつかの例外を除き)後続のブロックで参照できる参照になります。これが Data Recipes の中心的な考え方の1つです。値は一度作成し、プロンプト、式、構造化出力、検証ステップで再利用します。

Jinja 式は、レシピ内にすでに存在する値を扱うのに役立ちます。次のようなネストされたフィールドを参照できます {{customer.first_name}} 、値を結合する場合は {{customer.first_name}} {{customer.last_name}} 、次のようなパターンで条件ロジックを追加できます {% if condition %}...{% endif %}

エディタで表示される参照の例

たとえば:

  • という名前のカテゴリブロック domain は次のように参照できます {{ domain }}

  • シード列は LLM プロンプトで直接使えます。シードデータ内の列(例: HF データセットの列、CSV)

  • 構造化 LLM 出力は、後続のプロンプト用のフィールドを公開できます

  • 式ブロックは、別のモデル呼び出しなしで前段の値を組み合わせられます

その後は?

プレビュー実行は素早い反復のためのものです。エディタにサンプル行と分析を返すので、フル実行する前に生成データを確認できます。

フル実行では、永続化されたローカルデータセット成果物が作成されます。その出力は後で Unsloth のローカルデータセット選択画面に表示され、再確認してファインチューニングに使用できます。必要に応じて、データセットを Hugging Face リポジトリに公開することもできます。

主要な構成ブロック

主要な構成ブロック
モデルと LLM ブロック

モデル設定は、次の2つの使いやすいレイヤーに分かれています:

  • モデルプロバイダー エンドポイントと認証を定義します

  • モデル設定 モデル名と推論設定を定義します

この構成は、ホスト型プロバイダー、自前でホストするエンドポイント、 vLLM , llama.cpp 、または Unsloth の外で実行する任意の OpenAI 互換 API に対応します。

レシピは1つのモデルに限定されません。複数の モデルプロバイダーモデル設定 ブロックを追加して、ステップごとに異なるモデルを使えます。たとえば、1つはコーディング用、別の1つは一般的なテキストタスク用にできます。

モデル設定の後は、4種類の LLM ブロックを使えます:

ブロック
出力
最適用途

LLM テキスト

自由形式テキスト

指示、説明、会話、説明文

LLM 構造化

JSON

固定フィールドと予測可能な構造が必要な出力

LLM コード

コード

Python、SQL、TypeScript などのコード生成タスク

LLM ジャッジ

スコア付き評価

1つ以上のユーザー定義スコアで出力を採点

ツールプロファイル

ツールプロファイルブロックは、1つ以上の LLM ブロックに共通の MCP ベースのツールアクセスを定義します。生成ステップでツールが必要な場合に使用します。たとえば、次を通じてコードドキュメントを参照する場合などです Context7.

左の画像は、Context7 MCP が追加され、ツールプロファイルブロックのダイアログで設定されている様子を示しています:

バリデーター

バリデーターブロックは主に LLM コードブロックを対象とし、生成されたコード出力をリンターと構文検証に通します。これにより、不正または無効なコード行をフィルタリングして最終データセットに入らないようにできます。組み込みオプションは Python、SQL、JavaScript/TypeScript の検証をカバーします。

検証、プレビュー、実行

レシピのワークフローが整ったら、次は実行です。推奨パターンは、まず検証し、次にプレビューで素早くフィードバックを得て、実行ビューで生成データを確認し、出力が計画に合っていると感じたらフルデータセットを実行することです。

実行コントロールを次の順序で使います:

1

検証

クリック 検証 設定の問題を見つけるために。

2

プレビュー

プレビューを実行して、サンプル行と分析を確認します

3

改善

プロンプト、参照、シード設定、またはバリデーターを調整します。

生成データに満足できるまで反復します

4

フルデータセットのビルドを実行します

最終更新

役に立ちましたか?