"Ça a l'air de marcher" n'est pas une mesure. Les systèmes RAG se dégradent silencieusement, aussi partir en production sans mesure comporte un risque.
01. Deux mesures distinctes
Qualité de recherche et qualité de réponse se mesurent séparément. Si le bon document n'est pas trouvé, le problème vient de la recherche ; s'il est trouvé et que la réponse est fausse, de la consigne ou du modèle.
02. Construire un jeu de questions
Rassemblez cinquante à cent vraies questions d'utilisateurs avec les réponses attendues. Ce jeu devient la copie d'examen du système et est rejoué après chaque changement.
03. Ancrage
Chaque affirmation de la réponse figure-t-elle dans les documents retrouvés ? Ce contrôle est le moyen le plus pratique d'attraper une réponse inventée. Qu'un modèle parle depuis ses connaissances générales est inacceptable en entreprise.
04. Savoir dire non
Le système sait-il dire qu'il ne sait pas ? Un système qui produit une réponse à toute question perd la confiance dès la première erreur.
05. Test de régression
Quand des documents s'ajoutent, que le modèle change ou que la consigne évolue, le même jeu doit être rejoué. Une partie des changements crus bénéfiques casse ailleurs.
06. Surveillance en production
Recueillez les réponses jugées mauvaises par les utilisateurs et examinez-les régulièrement. Les données de test les plus précieuses viennent de là.