Le devis arrive avec une ligne en gras : « Fine-tuning du modèle sur vos données — 12 jours. » Le besoin, lui, tient en une phrase : « que l'assistant réponde avec nos procédures, pas avec Wikipedia. » Ce n'est pas le même problème. Le fine-tuning ne le résout presque jamais en premier. Le RAG, souvent. Un bon prompt, encore plus souvent.
Trois leviers reviennent dans presque tous les devis d'intégration LLM. Ils ne font pas la même chose. Les confondre coûte cher et ne règle rien.
Ce que chaque technique change réellement
| Prompt / few-shot | RAG | Fine-tuning | |
|---|---|---|---|
| Ce que ça modifie | Les instructions envoyées au modèle | Le contexte (extraits de vos documents) | Les poids du modèle |
| Ajoute des faits à jour ? | Non, sauf ce que vous collez | Oui, si l'index est à jour | Mal — le modèle n'est pas une base de données |
| Données nécessaires | Quelques exemples | Vos documents, propres et accessibles | Un jeu annoté, souvent des milliers d'exemples |
| Coût de mise en place | Faible | Moyen | Élevé (données + entraînement + evals) |
| Quand les documents changent | — | On réindexe | On réentraîne, ou les réponses vieillissent |
Une analogie qui tient : le prompt, c'est la consigne au stagiaire. Le RAG, c'est lui donner le classeur du jour. Le fine-tuning, c'est lui faire faire 3 000 exercices pour qu'il prenne vos tics d'écriture. Personne n'entraîne un stagiaire pendant trois semaines pour qu'il « apprenne » un tarif qui change lundi.
Trois besoins, trois réponses
« Rédige cet e-mail comme nous »
Format, ton, langue, structure : c'est le prompt, éventuellement avec deux ou trois exemples (few-shot). Si le modèle a le texte sous les yeux, inutile d'aller plus loin. Détail : prompt engineering en entreprise.
« Réponds avec notre procédure, pas une généralité »
Le modèle ne connaît pas votre dernière grille, votre exception client, votre mode opératoire mis à jour mardi. Il peut les lire si vous les lui donnez au bon moment : c'est le RAG. Guide : RAG.
« Classe ces tickets toujours dans les mêmes 12 catégories »
Là, le fine-tuning (ou un classifieur plus simple) peut valoir le coup : schéma stable, volume, besoin de tenir un format que le prompt n'arrive pas à figer. Encore faut-il des exemples annotés par vous, pas un export CRM sale.
Le prompt suffit plus souvent qu'on ne le dit
Avant de parler architecture, je demande : « Qu'est-ce qui cloche si on colle le document dans le chat et qu'on écrit trois phrases d'instruction ? » Si la réponse est « rien, ça marche », le projet n'est pas un projet. C'est une consigne et une relecture.
Le prompt suffit notamment pour :
- un JSON, un e-mail, un compte-rendu dont le canevas est fixe ;
- une extraction sur un texte déjà fourni (pas « cherche dans tout le drive ») ;
- une traduction, une reformulation, un plan.
Le RAG, et pourquoi il rate quand on le pose trop tôt
Le RAG est le levier standard dès que la réponse doit s'appuyer sur vos documents. Il rate pour des raisons terre à terre :
- trois versions de la même procédure, dont une de 2019 encore dans le dossier « Archive_final_V3 » ;
- des PDF scannés illisibles, des tableaux explosés ;
- personne ne mesure si l'extrait récupéré est le bon — on juge « le style » ;
- on attend un oui/non juridique sans humain derrière.
Un RAG honnête commence par un jeu de 20 à 40 questions réelles (celles que posent les équipes) et un verdict : bon extrait / mauvais extrait / pas dans le corpus. Sans ça, vous déballez un moteur de recherche habillé en IA, et vous ne saurez pas pourquoi « ça hallucine ».
Le fine-tuning : utile, rarement en premier
Fine-tuner, c'est ajuster les poids sur des exemples. Ça aide pour :
- un format très stable (classification, extraction toujours dans le même schéma) ;
- un style que le prompt n'arrive pas à tenir sur la durée ;
- un modèle plus petit, moins cher à l'inférence, une fois le comportement verrouillé (LoRA / QLoRA sur un modèle open source, par exemple).
Ça n'aide pas à « apprendre le catalogue 2026 ». Un modèle fine-tuné continue d'inventer des références. Pour les faits, on indexe. On n'entraîne pas. C'est un constat partagé chez les éditeurs de modèles et dans la littérature : le fine-tuning supervise le comportement, le RAG fournit la connaissance actualisable.
Autre réalité : constituer un jeu propre (qualité, droits, données personnelles) prend plus de temps que l'entraînement. La CNIL a publié des recommandations sur le développement des systèmes d'IA (bases d'entraînement, intérêt légitime, sécurité). Fine-tuner sur des e-mails clients n'est plus seulement un choix technique.
Hybride : oui, mais dans cet ordre
On peut combiner : RAG pour les faits, léger fine-tuning pour le format de sortie. On ne combine pas « parce que le devis a les deux lignes ». L'ordre qui évite les factures inutiles :
- Prompt + exemples + relecture — quelques jours.
- Si le modèle n'a pas vos documents : RAG + jeu de questions de test.
- Si le format ou le style reste instable et que vous avez des exemples annotés : fine-tuning ciblé, mesuré avant / après sur le même jeu.
Inverser (fine-tuner d'abord) est le schéma que je vois le plus souvent dans les devis trop chers. Ce n'est pas interdit. C'est rarement le chemin le plus court vers un résultat mesurable.
Comment trancher en une réunion
Posez ces quatre questions au tableau :
- La réponse doit-elle citer nos documents à jour ? → RAG (ou coller le doc).
- Le modèle a-t-il déjà le texte sous les yeux ? → prompt.
- Doit-il toujours produire le même schéma, à volume ? → classifieur ou fine-tuning, après les deux premiers.
- A-t-on un jeu d'exemples annotés de qualité ? Si non, le fine-tuning n'est pas « en retard » : il n'est pas prêt.
Conclusion
Prompt = consignes. RAG = vos faits. Fine-tuning = comportement. On empile dans cet ordre. On n'achète pas un fine-tuning pour compenser des documents mal rangés — ni pour rassurer un comité qui a entendu le mot en conférence.
Un devis vous parle de fine-tuning ?
Je relis le besoin avec vous et je vous dis si un prompt, un RAG ou un vrai réentraînement est justifié. Premier échange gratuit.
Cet article vous a été utile ? Partagez-le.