Conjunto de evaluación
Colección versionada de preguntas representativas y comportamientos esperados que permite probar de forma consistente la recuperación y las respuestas generadas.
Ejemplo en una empresa
Un equipo de RRHH prueba 30 preguntas aprobadas contra un conjunto fijo de políticas. Cada fila registra la fuente esperada, los hechos obligatorios, el perfil de acceso y si el asistente debe responder, pedir precisión o no responder.
Cómo funciona
- 1.Selecciona preguntas representativas de las personas usuarias y los flujos previstos.
- 2.Asigna a cada pregunta fuentes, hechos, reglas de acceso y un resultado esperado.
- 3.Incluye casos difíciles: paráfrasis, fuentes obsoletas, permisos denegados, contradicciones y conocimiento ausente.
- 4.Ejecuta la misma versión contra el sistema y puntúa por separado recuperación y respuesta generada.
- 5.Revisa los fallos con responsables de dominio, corrige fuentes o sistema y conserva versiones para poder comparar.
Ideas equivocadas
Conceptos relacionados
Lecturas relacionadas
Fuentes
- https://learn.microsoft.com/en-us/azure/databricks/agents/tutorials/ai-cookbook/fundamentals-evaluation-monitoring-rag
- https://cloud.google.com/blog/products/ai-machine-learning/optimizing-rag-retrieval?hl=en
- https://docs.aws.amazon.com/bedrock/latest/userguide/evaluation.html
Revisado:
Revisado por: Javier Chulvi Bernad · LLM Engineer · Madrid