Alias
Jeu de test IA, eval dataset.
Définition
Chaque cas décrit la demande, les pièces accessibles et les comportements attendus. Les cas utilisés pour améliorer le système doivent être distingués de ceux réservés à la mesure finale. Sinon, le score risque surtout de mesurer l'adaptation aux questions déjà vues.
Pour un assistant documentaire, les documents utiles font partie de l'entrée autorisée. Le corrigé de l'évaluation, lui, ne doit pas être inséré dans le contexte fourni au système.
Exemple
Exemple pédagogique : un cas fournit un compte-rendu incomplet. Le corrigé attend que l'assistant signale l'absence de validation, sans lui fournir cette phrase dans les pièces.
Ajouter aussi des variantes avec document contradictoire ou non pertinent. Si deux cas ne diffèrent que par le nom du projet, les séparer entre réglage et test peut encore donner une impression exagérée de généralisation.
À ne pas confondre avec
Un corpus documentaire et un jeu d'évaluation ont des rôles différents. Les réunir sans distinguer pièces et corrigés peut contaminer la mesure.
Voir aussi
Évaluation IA, RAG, Traçabilité IA.
Sources
scikit-learn — Common pitfalls (nouvel onglet), Anthropic — Define success criteria and build evaluations (nouvel onglet). Application au travail de projet et exemple pédagogique originaux, sans résultat d'essai revendiqué.