Construire le dataset autour des besoins d'information réels
Je commence par des questions représentatives des utilisateurs, et non uniquement par des variantes générées. Chaque exemple doit contenir :- la demande brute et le contexte utilisateur utile ;
- le périmètre de sources et les contraintes d'accès ;
- les documents ou passages requis ;
- les éléments attendus dans la réponse ;
- les affirmations interdites ;
- le comportement acceptable de refus ou de clarification ;
- les labels d'intention, difficulté, langue et risque.
Évaluer le retrieval avant la génération
L'évaluation du retrieval cherche à savoir si le système a trouvé les preuves utiles et les a classées assez haut pour la couche de réponse. Les métriques courantes incluent :- Recall at k : au moins une source requise apparaît-elle parmi les candidats ?
- Precision at k : quelle part du contexte sélectionné est pertinente ?
- MRR : à quelle position apparaît le premier résultat pertinent ?
- nDCG : le classement complet respecte-t-il les niveaux de pertinence ?
- justesse des filtres : accès, statut, langue et date ont-ils été appliqués ?
Évaluer séparément réponses sourcées et citations
Une fois le retrieval compris, j'évalue :| Dimension | Question d'évaluation |
|---|---|
| Groundedness | Chaque affirmation importante est-elle soutenue par les preuves ? |
| Complétude | La réponse couvre-t-elle les points requis sans masquer l'incertitude ? |
| Validité des citations | Chaque citation vise-t-elle un passage accessible qui soutient l'affirmation ? |
| Politique | Le système a-t-il clarifié, refusé ou escaladé lorsque les preuves manquaient ? |
| Présentation | La réponse est-elle utilisable par le workflow et l'audience visés ? |
Preuves associées à la version candidate
Transformer les métriques en décision fondée sur le risque
Il n'existe pas de seuil universel de groundedness ou de recall qui rende chaque RAG sûr. Une gate doit venir d'une baseline validée, de l'importance de chaque intention, du coût d'une mauvaise réponse et du bruit de l'évaluateur. J'utilise trois catégories :- Blocages stricts pour les défauts d'autorisation, citations inaccessibles, affirmations interdites et réponses critiques non sourcées.
- Comparaisons segmentées pour les intentions, langues, familles de sources et questions difficiles.
- Revue des tendances pour les mouvements de qualité, latence, coût, fallback et couverture qui exigent du contexte.