Enregistrement au format GGUF
model.save_pretrained_gguf("directory", tokenizer, quantization_method = "q4_k_m")
model.save_pretrained_gguf("directory", tokenizer, quantization_method = "q8_0")
model.save_pretrained_gguf("directory", tokenizer, quantization_method = "f16")model.push_to_hub_gguf("hf_username/directory", tokenizer, quantization_method = "q4_k_m")
model.push_to_hub_gguf("hf_username/directory", tokenizer, quantization_method = "q8_0")# https://github.com/ggml-org/llama.cpp/blob/master/examples/quantize/quantize.cpp#L19
ALLOWED_QUANTS = \
{
"not_quantized" : "Recommandé. Conversion rapide. Inférence lente, fichiers volumineux.",
"fast_quantized" : "Recommandé. Conversion rapide. Inférence correcte, taille de fichier correcte.",
"quantized" : "Recommandé. Conversion lente. Inférence rapide, fichiers petits.",
"f32" : "Non recommandé. Conserve 100 % de précision, mais très lent et gourmand en mémoire.",
"f16" : "Conversion la plus rapide + conserve 100 % de précision. Lent et gourmand en mémoire.",
"q8_0" : "Conversion rapide. Forte utilisation des ressources, mais généralement acceptable.",
"q4_k_m" : "Recommandé. Utilise Q6_K pour la moitié des tenseurs attention.wv et feed_forward.w2, sinon Q4_K",
"q5_k_m" : "Recommandé. Utilise Q6_K pour la moitié des tenseurs attention.wv et feed_forward.w2, sinon Q5_K",
"q2_k" : "Utilise Q4_K pour les tenseurs attention.wv et feed_forward.w2, Q2_K pour les autres tenseurs.",
"q3_k_l" : "Utilise Q5_K pour les tenseurs attention.wv, attention.wo et feed_forward.w2, sinon Q3_K",
"q3_k_m" : "Utilise Q4_K pour les tenseurs attention.wv, attention.wo et feed_forward.w2, sinon Q3_K",
"q3_k_s" : "Utilise Q3_K pour tous les tenseurs",
"q4_0" : "Méthode de quantification originale, 4 bits.",
"q4_1" : "Précision plus élevée que q4_0 mais pas aussi élevée que q5_0. Cependant, inférence plus rapide que les modèles q5.",
"q4_k_s" : "Utilise Q4_K pour tous les tenseurs",
"q4_k" : "alias de q4_k_m",
"q5_k" : "alias de q5_k_m",
"q5_0" : "Précision plus élevée, utilisation plus importante des ressources et inférence plus lente.",
"q5_1" : "Précision encore plus élevée, utilisation des ressources et inférence plus lente.",
"q5_k_s" : "Utilise Q5_K pour tous les tenseurs",
"q6_k" : "Utilise Q8_K pour tous les tenseurs",
"iq2_xxs" : "Quantification à 2,06 bpw",
"iq2_xs" : "Quantification à 2,31 bpw",
"iq3_xxs" : "Quantification à 3,06 bpw",
"q3_k_xs" : "Quantification extra petite à 3 bits",
}L’exécution dans Unsloth fonctionne bien, mais après l’exportation et l’exécution sur d’autres plateformes, les résultats sont médiocres
L’enregistrement en GGUF / vLLM 16 bits plante
Comment enregistrer manuellement en GGUF ?
Mis à jour
Ce contenu vous a-t-il été utile ?

