Prompts d'évaluation : mesurer la qualité sans ground truth parfait
Comment évaluer vos prompts en production : auto-évaluation LLM-as-judge, golden sets, A/B testing, métriques proxy. Framework pratique sans infrastructure lourde.
Vous avez un prompt qui « marche bien » sur 3 exemples. En production, il reçoit 1000 entrées variées par jour. Comment savoir s\'il tient la route sans lire chaque réponse ? Voici un cadre d\'évaluation pragmatique.
1. Le golden set : votre référence
Constituez 30-100 paires (entrée, sortie idéale) couvrant : cas nominal, cas limite, cas adverses, styles variés. Ce jeu est figé — il ne change que quand le besoin métier change. C\'est votre « test unitaire » du prompt.
2. LLM-as-judge : auto-évaluation peu coûteuse
Utilisez un modèle (même petit, ex. GPT-4o-mini, Haiku) pour noter les réponses sur une grille : pertinence (1-5), respect du format (oui/non), ton (1-5), hallucination détectée (oui/non). Coût : ~0,001 $/évaluation. Lancez-le sur 10 % du trafic production + 100 % du golden set à chaque déploiement.
Tu es un évaluateur. Note la réponse sur :
1. Pertinence par rapport à la question (1-5)
2. Respect du format demandé (oui/non)
3. Ton conforme aux consignes (1-5)
4. Hallucination ou info non sourcée (oui/non)
Question : [entrée]
Réponse : [sortie du prompt testé]
Contexte/Contraintes : [system prompt + quelques exemples]
Réponds en JSON : {pertinence, format, ton, hallucination, commentaire}3. Métriques proxy automatisées (sans LLM juge)
- Longueur réponse : chute brutale = troncature ou refus.
- Répétition n-grammes : boucle = modèle coincé.
- Taux de refus : « Je ne peux pas » > 10 % = prompt trop restrictif.
- Validité JSON/Schéma : % de réponses parsable.
- Latence p95 : dérive = prompt trop long ou modèle surchargé.
4. A/B testing en production
Déployez v1 et v2 sur 50/50 du trafic. Comparez : score juge, métriques proxy, feedback utilisateur explicite (👍/👎). Durée minimum : 1000 requêtes par variante ou 1 semaine. Décision basée sur la significativité statistique, pas l\'intuition.
5. Régression nightly
Chaque nuit, lancez le golden set sur la version en prod. Alerte si : score moyen juge < seuil - 0,5, ou taux hallucination > 2 %, ou format invalide > 1 %. Cela détecte les régressions silencieuses (mise à jour provider, changement de prompt non testé).
Grilles d\'évaluation prêtes à l\'emploi + scripts d\'auto-éval + golden sets par métier dans les packs de prompts.
Prêt à gagner du temps chaque jour ?
300 prompts testés et organisés par métier, compatibles ChatGPT, Claude et Gemini. Garantie 14 jours satisfait ou remboursé.
Voir les packs →