Prompts RAG : retrieval-augmented generation qui marche
Comment structurer le prompt RAG : injection de contexte, gestion des sources manquantes, citations, refus contrôlé. Patterns testés en production.
Le RAG (Retrieval-Augmented Generation) ne se joue pas qu\'au niveau de l\'index vectoriel. Le prompt qui reçoit les chunks récupérés détermine si la réponse est utile, hallucinée, ou honnêtement « je ne sais pas ». Voici les patterns qui tiennent en production.
1. Structure du prompt RAG
# CONTEXTE RÉCUPÉRÉ
[Chunks injectés ici, numérotés, avec métadonnées source]
# INSTRUCTIONS
Réponds UNIQUEMENT à partir du contexte ci-dessus.
- Cite tes sources entre crochets [1], [2]...
- Si l'info n'est pas dans le contexte : réponds « Information non trouvée dans les documents fournis. »
- Ne complète pas par ta connaissance interne.
- Si les sources contredisent : signale la contradiction.
# QUESTION UTILISATEUR
[Question]2. Gérer le contexte manquant (le point critique)
Le retriever ne trouve pas toujours. Le prompt doit forcer le refus explicite, pas l\'hallucination. Testez avec des questions hors sujet : le modèle doit répondre « Information non trouvée » et non inventer une réponse plausible.
3. Chunking et injection : taille et ordre
- Taille des chunks : 300-500 tokens (chevauchement 50-100). Trop petit = perte de contexte. Trop grand = bruit et coût tokens.
- Nombre de chunks : 3-5 typiquement. Au-delà, le modèle « oublie » le début.
- Ordre : du plus pertinent au moins pertinent (score de similarité décroissant).
- Métadonnées : incluez titre, date, source, section dans chaque chunk pour les citations.
4. Citations vérifiables
Exigez des citations au format [Source N] où N renvoie au chunk numéroté. En post-traitement, vous pouvez remplacer [1] par un lien vers le document source. Cela rend la réponse auditable — critique pour le juridique, la conformité, le support.
5. Reranking : améliorer avant de promtper
Un reranker (cross-encoder) sur les 20 premiers chunks du retriever (bi-encoder) remonte les véritablement pertinents. Le prompt reçoit alors 3 chunks de haute qualité au lieu de 5 bruités. Gain de qualité > gain de prompt engineering.
Templates RAG complets (juridique, support, doc technique, connaissance interne) dans les packs de prompts.
Prêt à gagner du temps chaque jour ?
300 prompts testés et organisés par métier, compatibles ChatGPT, Claude et Gemini. Garantie 14 jours satisfait ou remboursé.
Voir les packs →