ファインチューニング済みモデルを保存して、お気に入りの推論エンジンで実行する方法を学びます。
以下を使用して、ファインチューニング済みモデルを実行することもできます Unsloth の2倍高速な推論.
Unsloth Studio Chat
llama.cpp - GGUFへの保存
Unsloth API エンドポイント
vLLM
Ollama
プロバイダーへの接続
SGLang
トラブルシューティング
llama-server と OpenAI エンドポイント
NVFP4
最終更新 27 分前
役に立ちましたか?