← Tous les articles
Technique29 août 2026 · 8 min de lecture

Prompts d'évaluation : mesurer la qualité sans ground truth parfait

Comment évaluer vos prompts en production : auto-évaluation LLM-as-judge, golden sets, A/B testing, métriques proxy. Framework pratique sans infrastructure lourde.

Vous avez un prompt qui « marche bien » sur 3 exemples. En production, il reçoit 1000 entrées variées par jour. Comment savoir s\'il tient la route sans lire chaque réponse ? Voici un cadre d\'évaluation pragmatique.

1. Le golden set : votre référence

Constituez 30-100 paires (entrée, sortie idéale) couvrant : cas nominal, cas limite, cas adverses, styles variés. Ce jeu est figé — il ne change que quand le besoin métier change. C\'est votre « test unitaire » du prompt.

2. LLM-as-judge : auto-évaluation peu coûteuse

Utilisez un modèle (même petit, ex. GPT-4o-mini, Haiku) pour noter les réponses sur une grille : pertinence (1-5), respect du format (oui/non), ton (1-5), hallucination détectée (oui/non). Coût : ~0,001 $/évaluation. Lancez-le sur 10 % du trafic production + 100 % du golden set à chaque déploiement.

Tu es un évaluateur. Note la réponse sur :
        1. Pertinence par rapport à la question (1-5)
        2. Respect du format demandé (oui/non)
        3. Ton conforme aux consignes (1-5)
        4. Hallucination ou info non sourcée (oui/non)

        Question : [entrée]
        Réponse : [sortie du prompt testé]
        Contexte/Contraintes : [system prompt + quelques exemples]

        Réponds en JSON : {pertinence, format, ton, hallucination, commentaire}

3. Métriques proxy automatisées (sans LLM juge)

  • Longueur réponse : chute brutale = troncature ou refus.
  • Répétition n-grammes : boucle = modèle coincé.
  • Taux de refus : « Je ne peux pas » > 10 % = prompt trop restrictif.
  • Validité JSON/Schéma : % de réponses parsable.
  • Latence p95 : dérive = prompt trop long ou modèle surchargé.

4. A/B testing en production

Déployez v1 et v2 sur 50/50 du trafic. Comparez : score juge, métriques proxy, feedback utilisateur explicite (👍/👎). Durée minimum : 1000 requêtes par variante ou 1 semaine. Décision basée sur la significativité statistique, pas l\'intuition.

5. Régression nightly

Chaque nuit, lancez le golden set sur la version en prod. Alerte si : score moyen juge < seuil - 0,5, ou taux hallucination > 2 %, ou format invalide > 1 %. Cela détecte les régressions silencieuses (mise à jour provider, changement de prompt non testé).

Grilles d\'évaluation prêtes à l\'emploi + scripts d\'auto-éval + golden sets par métier dans les packs de prompts.

Prêt à gagner du temps chaque jour ?

300 prompts testés et organisés par métier, compatibles ChatGPT, Claude et Gemini. Garantie 14 jours satisfait ou remboursé.

Voir les packs →