Apprenez à enregistrer votre modèle affiné afin de pouvoir l'exécuter dans votre moteur d'inférence préféré.
Vous pouvez également exécuter vos modèles affinés en utilisant l'inférence deux fois plus rapide d'Unsloth.
Chat Unsloth Studio
llama.cpp - Enregistrement au format GGUF
point de terminaison de l'API Unsloth
vLLM
Ollama
Connexion à un fournisseur
SGLang
Dépannage
llama-server et point de terminaison OpenAI
NVFP4
Mis à jour il y a 1 mois
Ce contenu vous a-t-il été utile ?