← Tous les articles
Technique29 août 2026 · 9 min de lecture

Prompts RAG : retrieval-augmented generation qui marche

Comment structurer le prompt RAG : injection de contexte, gestion des sources manquantes, citations, refus contrôlé. Patterns testés en production.

Le RAG (Retrieval-Augmented Generation) ne se joue pas qu\'au niveau de l\'index vectoriel. Le prompt qui reçoit les chunks récupérés détermine si la réponse est utile, hallucinée, ou honnêtement « je ne sais pas ». Voici les patterns qui tiennent en production.

1. Structure du prompt RAG

# CONTEXTE RÉCUPÉRÉ
        [Chunks injectés ici, numérotés, avec métadonnées source]

        # INSTRUCTIONS
        Réponds UNIQUEMENT à partir du contexte ci-dessus.
        - Cite tes sources entre crochets [1], [2]...
        - Si l'info n'est pas dans le contexte : réponds « Information non trouvée dans les documents fournis. »
        - Ne complète pas par ta connaissance interne.
        - Si les sources contredisent : signale la contradiction.

        # QUESTION UTILISATEUR
        [Question]

2. Gérer le contexte manquant (le point critique)

Le retriever ne trouve pas toujours. Le prompt doit forcer le refus explicite, pas l\'hallucination. Testez avec des questions hors sujet : le modèle doit répondre « Information non trouvée » et non inventer une réponse plausible.

3. Chunking et injection : taille et ordre

  • Taille des chunks : 300-500 tokens (chevauchement 50-100). Trop petit = perte de contexte. Trop grand = bruit et coût tokens.
  • Nombre de chunks : 3-5 typiquement. Au-delà, le modèle « oublie » le début.
  • Ordre : du plus pertinent au moins pertinent (score de similarité décroissant).
  • Métadonnées : incluez titre, date, source, section dans chaque chunk pour les citations.

4. Citations vérifiables

Exigez des citations au format [Source N] où N renvoie au chunk numéroté. En post-traitement, vous pouvez remplacer [1] par un lien vers le document source. Cela rend la réponse auditable — critique pour le juridique, la conformité, le support.

5. Reranking : améliorer avant de promtper

Un reranker (cross-encoder) sur les 20 premiers chunks du retriever (bi-encoder) remonte les véritablement pertinents. Le prompt reçoit alors 3 chunks de haute qualité au lieu de 5 bruités. Gain de qualité > gain de prompt engineering.

Templates RAG complets (juridique, support, doc technique, connaissance interne) dans les packs de prompts.

Prêt à gagner du temps chaque jour ?

300 prompts testés et organisés par métier, compatibles ChatGPT, Claude et Gemini. Garantie 14 jours satisfait ou remboursé.

Voir les packs →