Articles / Fine-tuning LLM : trois questions avant d'entraîner un modèle
fine-tuning
Fine-tuning LLM : trois questions avant d'entraîner un modèle
Finn ·
Le fine-tuning d'un LLM consiste à poursuivre l'entraînement d'un modèle existant sur tes propres exemples, pour qu'il adopte un comportement précis : classer, répondre dans un ton, trancher dans un format. Il n'apprend pas au modèle des faits qui changent et, face à un prompt mis en cache, il ne réduit la facture que s'il permet de descendre d'une taille de modèle. La décision tient en trois questions.
Les trois questions, avant tout le reste
Le seuil n'est ni un volume d'appels ni un prix. C'est le moment où ce que tu demandes au modèle passe de « ce qu'il sait » à « comment il tranche », et où tu peux le prouver avec des exemples validés.
Première question : tu veux changer ce que le modèle sait, ou comment il se comporte ? Tarifs, catalogue, fiches clients : c'est du savoir, il change, et il va dans le contexte, à la main ou par recherche (RAG). Une étude de 2023 a trouvé que le RAG bat régulièrement le fine-tuning non supervisé pour injecter des connaissances.
Deuxième question : le prompt avec exemples, plus une sortie structurée, échoue-t-il encore sur un jeu de test ? Colle trois à cinq exemples validés dans le prompt et impose le format par un schéma : chez OpenAI, Structured Outputs garantit un JSON conforme, donc le format seul ne justifie pas un fine-tuning. Reste le jugement : quelle étiquette, quel ton. Des quatre méthodes de prompts ChatGPT que j'ai comparées, exemples et format imposé sont les deux à essayer. Mesure sur une quarantaine de cas étiquetés à la main ; si le prompt passe, arrête-toi.
Troisième question : as-tu au moins cinquante exemples validés, et un jeu de test que tu n'utilises pas pour entraîner ? OpenAI fixe le minimum à dix exemples et en recommande cinquante, avec les évaluations construites avant, et prévient : si cinquante exemples n'ont aucun effet, c'est la tâche ou le prompt qu'il faut repenser. Pour Claude 3 Haiku sur Bedrock, AWS conseille 50 à 100 lignes. Ma règle par-dessus ces recommandations : aucun entraînement tant que ces cinquante lignes ne sont pas écrites et quarante cas tenus à l'écart.
Trois oui, et tu entraînes ; un non, et tu récoltes d'abord tes exemples en corrigeant les sorties du modèle en production.
Le prix qui double, et ce qu'il reste comme argument
Deux faits documentés cassent, chez OpenAI, l'argument de l'économie par prompt raccourci.
La page de tarifs, consultée le 12 septembre 2026, facture l'inférence d'un modèle fine-tuné exactement le double du modèle de base : gpt-4.1-mini passe de 0,40 $ à 0,80 $ par million de tokens en entrée, de 0,10 $ à 0,20 $ en entrée mise en cache, de 1,60 $ à 3,20 $ en sortie, hors taxes ; même ratio sur gpt-4.1 et gpt-4.1-nano, et 5 $ par million de tokens d'entraînement sur mini. Et le cache de prompt est activé par défaut : un préfixe inchangé, consignes et exemples, se paie au tarif réduit dès qu'il est réutilisé, au-delà d'une longueur minimale qui dépend des réglages, et tant que les appels s'enchaînent (expiration typique après cinq à dix minutes d'inactivité).
Un cas chiffré, avec des volumes posés pour l'exemple : 2 000 tokens de consignes et d'exemples en préfixe stable, 300 tokens d'email, 40 tokens de réponse. Sur gpt-4.1-mini de base avec cache, mille appels coûtent 0,20 $ pour le préfixe, 0,12 $ pour les emails, 0,06 $ pour les sorties : 0,38 $. Sur gpt-4.1-mini fine-tuné, avec un prompt réduit à 100 tokens : 0,32 $ d'entrée et 0,13 $ de sortie, soit 0,45 $, plus 0,33 $ d'entraînement une fois (50 exemples de 440 tokens, trois époques posées pour l'exemple). Ici, le modèle fine-tuné coûte plus cher par appel que le prompt mis en cache.
L'argument du prix ne revient que dans deux cas. Si tes appels sont espacés, le cache expire et le prompt long se paie plein tarif : 0,98 $ les mille appels contre 0,45 $. Si le fine-tuning te fait descendre d'une taille, un gpt-4.1-nano fine-tuné (0,20 $ en entrée, 0,80 $ en sortie) fait les mille appels pour 0,11 $, à condition que ton jeu de test montre qu'il classe aussi bien que le mini avec prompt.
Le fine-tuning apprend au modèle comment trancher ; les faits qui changent restent dans le contexte, pas dans les poids.
Un exemple complet : classer les emails d'un support
Le cas est fictif, les emails aussi. Une personne seule vend un logiciel en abonnement et veut router chaque email de support par catégorie (facturation, bug, fonctionnalite, resiliation, autre) et urgence. Sur son jeu de test, le prompt à exemples confond résiliations polies et questions de facturation : du jugement, pas du format, et elle a cinquante emails corrigés à la main.
Le fichier d'entraînement est un JSONL, une ligne par exemple : la même consigne système, l'email, la réponse attendue. Deux lignes ; les quarante-huit autres suivent le même moule, surtout sur les cas ambigus.
{"messages":[{"role":"system","content":"Classe cet email de support en JSON : categorie (facturation, bug, fonctionnalite, resiliation, autre) et urgent (true ou false)."},{"role":"user","content":"Bonjour, j'ai été prélevé deux fois ce mois-ci pour le même abonnement. Merci de rembourser le doublon."},{"role":"assistant","content":"{\"categorie\":\"facturation\",\"urgent\":true}"}]}
{"messages":[{"role":"system","content":"Classe cet email de support en JSON : categorie (facturation, bug, fonctionnalite, resiliation, autre) et urgent (true ou false)."},{"role":"user","content":"Je souhaite arrêter à la fin du mois, sans reproche, je n'utilise plus l'outil. Vous me confirmez qu'il n'y aura plus de prélèvement ?"},{"role":"assistant","content":"{\"categorie\":\"resiliation\",\"urgent\":false}"}]}
Ce format à trois rôles est celui du guide OpenAI, Bedrock attend le même principe. À adapter : catégories, consigne, et surtout les emails, à prendre dans ta boîte, anonymisés.
Vérifie sur les quarante emails tenus à l'écart : taux de catégories exactes du modèle de base avec prompt, même taux pour le modèle fine-tuné avec la consigne courte, et nombre de sorties hors format, zéro attendu des deux côtés. Garde le modèle fine-tuné seulement s'il gagne sur la première mesure. Le reste du routage est dans mon exemple d'agent IA qui trie les emails en six étapes.
Le chemin open weights : LoRA, QLoRA, un GPU gratuit
Pour posséder le modèle, même règle, autres outils. LoRA, d'après la documentation PEFT de Hugging Face, gèle les poids d'origine et n'entraîne que deux petites matrices par couche visée ; l'adaptateur se fusionne ensuite au modèle sans ajouter de latence. QLoRA charge le modèle en 4 bits pendant l'entraînement : l'article de 2023 affinait un modèle de 65 milliards de paramètres sur un seul GPU de 48 Go.
La table de mémoire d'Unsloth donne environ 6 Go de VRAM pour un modèle de 8 milliards de paramètres en QLoRA ; son guide propose des notebooks gratuits sur Colab et Kaggle et un export de l'adaptateur (environ 100 Mo) ou d'un GGUF pour Ollama. Sans GPU, Together facture l'entraînement LoRA 0,34 $ par million de tokens jusqu'à 9 milliards de paramètres, minimum 4 $ par job.
Une étude de 2024, LoRA Learns Less and Forgets Less, a mesuré que LoRA apprend nettement moins qu'un entraînement complet sur un nouveau domaine entier, mais dégrade moins le modèle sur le reste : le bon outil pour un comportement, un mauvais pari pour faire entrer une spécialité entière dans les poids. Unsloth affirme l'inverse, que le fine-tuning couvre tout ce que fait le RAG ; l'étude de 2023 en donne le prix : multiplier les variantes de chaque fait dans les données.
Au 12 septembre 2026, l'offre s'est rétrécie chez les fournisseurs fermés. L'API Claude ne le propose pas ; le seul chemin est Claude 3 Haiku sur Amazon Bedrock, région Oregon. L'API Gemini n'a plus de modèle ajustable depuis mai 2025. La documentation Mistral marque sa fonction comme dépréciée. OpenAI reste ouvert sur la famille gpt-4.1. Sur Claude ou Gemini, « fine-tuner » veut donc dire changer de modèle ou passer en open weights.
Le cas où je changerais d'avis
Un petit modèle local change l'ordre des questions. Sur ta machine, pour la confidentialité ou pour ne rien payer au token, il n'y a plus de tarif de cache à comparer et un adaptateur ne coûte rien à servir : je passerais au fine-tuning dès que le prompt échoue sur le jeu de test.
À l'inverse, si tes catégories bougent tous les mois, chaque changement veut dire réentraîner et réévaluer, quand un prompt se corrige en une minute. Reste sur le prompt tant que la règle n'est pas stable. Et un modèle fine-tuné en production a besoin du même validateur que tout agent qui tourne sans toi, celui que je décris dans le seuil où un agent IA gratuit casse.
Avant d'entraîner quoi que ce soit, écris les cinquante exemples et les quarante cas de test. Si tu n'arrives pas à les écrire, tu n'as pas encore un comportement à apprendre au modèle ; tu as une règle à préciser dans ton prompt.
Cet article vous a servi ?
Recevez les meilleurs articles, sélectionnés avec soin pour vous faire gagner du temps.
À lire ensuite
OpenClaw ne fournit aucune intégration de courtier : la liste officielle des outils intégrés ne contient ni broker ni marché. Le trading arrive donc par une skill tierce, que la documentation demande de traiter comme du code non fiable, ou par un programme que tu écris. Ce qui décide de tout ensuite, c'est qui détient la clé qui passe l'ordre : le modèle, ou ton code.
OpenClaw est un assistant IA open source que tu peux héberger et utiliser depuis des messageries comme Telegram ou WhatsApp. Il relie un modèle à des outils capables de lire des données ou d'agir sur des services. Avant l'installation, prépare l'accès au modèle, une machine disponible et un premier usage limité ; vérifie les permissions avant de connecter tes comptes.
À la une
Un pivot, c'est souvent le mot poli qu'on emploie devant les investisseurs quand la première entreprise est morte et qu'on a décidé d'en construire une autre. Et c'est très bien. Pas parce que l'échec serait noble, mais parce que la chance a besoin d'exposition : chaque marché où l'on entre, chaque produit qu'on livre, chaque canal qu'on teste est une surface de plus où quelque chose d'inattendu peut se poser.
Articles Marketing
Les UTM sont des paramètres ajoutés à une URL pour identifier une source de trafic, un canal et une campagne dans un outil de mesure. Ils servent, par exemple, à distinguer les visites venues d'une newsletter de celles d'un post LinkedIn. Pour commencer, choisis des noms cohérents, construis un lien complet et vérifie ce que ton outil enregistre après un clic.
Le seuil de rentabilité est le chiffre d'affaires hors taxes à partir duquel tes recettes couvrent toutes tes charges. Il se calcule en divisant tes charges fixes par ton taux de marge sur coûts variables. Quand tu travailles seul en micro-entreprise, ajoute ta rémunération aux charges fixes avant de diviser : sans elle, le seuil obtenu décrit une année payée zéro euro.
Projets

ReadyToPost
Votre community manager IA : il crée vos posts, répond aux commentaires et aux DM, suit les résultats. Vous validez, c'est tout.

Mira Ceti
Et si vous étiez vraiment bien chez vous ? Un studio d'architecture d'intérieur qui repense les appartements, avec l'IA en renfort.
L'essentiel, par mail.
Ce qui marche, ce qui ne marche pas, ce que je referais autrement. Envoyé quand j'ai quelque chose d'utile à dire.