"Parece que funciona" no es una medición. Los sistemas RAG se degradan en silencio, así que salir a producción sin medir entraña riesgo.
01. Dos mediciones separadas
Calidad de recuperación y calidad de respuesta deben medirse aparte. Si no se encuentra el documento correcto, el problema es la recuperación; si se encuentra y la respuesta es errónea, es la instrucción o el modelo.
02. Construir un conjunto de preguntas
Reúna de cincuenta a cien preguntas reales de usuarios con sus respuestas esperadas. Ese conjunto se convierte en el examen del sistema y se repite tras cada cambio.
03. Fundamentación
¿Está cada afirmación de la respuesta en los documentos recuperados? Esa comprobación es la vía más práctica de detectar respuestas inventadas. Que el modelo hable desde su conocimiento general es inaceptable en el entorno corporativo.
04. Saber qué queda fuera
¿Puede el sistema decir que no lo sabe? Un sistema que produce respuesta a toda pregunta pierde la confianza del usuario en la primera equivocada.
05. Prueba de regresión
Cuando se añaden documentos, cambia el modelo o se actualiza la instrucción, hay que repetir el mismo conjunto. Parte de los cambios que se creen mejoras rompen algo en otro sitio.
06. Vigilancia en producción
Recoja las respuestas que los usuarios marcan como malas y revíselas con regularidad. Los datos de prueba más valiosos salen de ahí.