For the complete documentation index, see llms.txt. This page is also available as Markdown.

Enregistrer des modèles pour Ollama

Consultez notre guide ci-dessous pour le processus complet sur la façon d’enregistrer des modèles sur Ollama:

🦙Tutorial: Finetune Llama-3 and Use In Ollama

Enregistrement sur Google Colab

Vous pouvez enregistrer le modèle affiné sous la forme d’un petit fichier de 100 Mo appelé adaptateur LoRA, comme ci-dessous. Vous pouvez aussi le pousser vers le hub Hugging Face si vous souhaitez téléverser votre modèle ! N’oubliez pas d’obtenir un jeton Hugging Face via : https://huggingface.co/settings/tokens et ajoutez votre jeton !

Après avoir enregistré le modèle, nous pouvons à nouveau utiliser Unsloth pour exécuter le modèle lui-même ! Utilisez FastLanguageModel à nouveau pour l’appeler en inférence !

Exporter vers Ollama

Enfin, nous pouvons exporter notre modèle affiné vers Ollama lui-même ! D’abord, nous devons installer Ollama dans le notebook Colab :

Ensuite, nous exportons le modèle affiné que nous avons vers les formats GGUF de llama.cpp comme ci-dessous :

Rappel de convertir False en True pour 1 ligne, et ne changez pas chaque ligne en True, sinon vous attendrez très longtemps ! Nous suggérons normalement de définir la première ligne sur True, afin que nous puissions exporter rapidement le modèle affiné vers Q8_0 format (quantification 8 bits). Nous vous permettons également d’exporter vers toute une liste de méthodes de quantification, l’une des plus populaires étant q4_k_m.

Rendez-vous sur https://github.com/ggml-org/llama.cpp pour en savoir plus sur GGUF. Nous avons aussi des instructions manuelles sur la façon d’exporter vers GGUF si vous le souhaitez ici : https://github.com/unslothai/unsloth/wiki#manually-saving-to-gguf

Vous verrez une longue liste de texte comme ci-dessous — veuillez patienter 5 à 10 minutes !!

Et enfin, tout à la fin, cela ressemblera à ceci :

Ensuite, nous devons lancer Ollama lui-même en arrière-plan. Nous utilisons subprocess car Colab n’aime pas les appels asynchrones, mais normalement on exécute simplement ollama serve dans le terminal / l’invite de commande.

Création automatique de Modelfile

L’astuce qu’Unsloth fournit est que nous créons automatiquement un automatique de que Ollama exige ! C’est simplement une liste de paramètres et elle inclut le modèle de chat que nous avons utilisé pour le processus d’affinage ! Vous pouvez aussi afficher le automatique de généré comme ci-dessous :

Nous demandons ensuite à Ollama de créer un modèle compatible avec Ollama, en utilisant le automatique de

Inférence Ollama

Et nous pouvons maintenant appeler le modèle en inférence si vous voulez appeler le serveur Ollama lui-même, qui s’exécute sur votre machine locale / dans le notebook Colab gratuit en arrière-plan. N’oubliez pas que vous pouvez modifier la partie soulignée en jaune.

L’exécution dans Unsloth fonctionne bien, mais après exportation et exécution sur Ollama, les résultats sont médiocres

Vous pouvez parfois rencontrer un problème où votre modèle s’exécute et produit de bons résultats dans Unsloth, mais lorsque vous l’utilisez sur une autre plateforme comme Ollama, les résultats sont médiocres ou vous pouvez obtenir du charabia, des générations sans fin/infinies ou des sorties répétées.

  • La cause la plus fréquente de cette erreur est l’utilisation d’un mauvais modèle de chat. Il est essentiel d’utiliser le MÊME modèle de chat que celui utilisé lors de l’entraînement du modèle dans Unsloth, puis lorsque vous l’exécutez dans un autre framework, tel que llama.cpp ou Ollama. Lors de l’inférence à partir d’un modèle enregistré, il est crucial d’appliquer le bon modèle.

  • Vous devez utiliser le bon jeton eos. Sinon, vous pourriez obtenir du charabia lors de générations plus longues.

  • Cela peut aussi être dû au fait que votre moteur d’inférence ajoute un jeton inutile de « début de séquence » (ou, au contraire, à son absence), alors assurez-vous de vérifier les deux hypothèses !

  • Utilisez nos notebooks conversationnels pour imposer le modèle de chat — cela corrigera la plupart des problèmes.

Mis à jour

Ce contenu vous a-t-il été utile ?