Volver al glosario
Calidad y seguridad de IA

Conjunto de evaluación

Colección versionada de preguntas representativas y comportamientos esperados que permite probar de forma consistente la recuperación y las respuestas generadas.

Ejemplo en una empresa

Un equipo de RRHH prueba 30 preguntas aprobadas contra un conjunto fijo de políticas. Cada fila registra la fuente esperada, los hechos obligatorios, el perfil de acceso y si el asistente debe responder, pedir precisión o no responder.

Cómo funciona

  1. 1.Selecciona preguntas representativas de las personas usuarias y los flujos previstos.
  2. 2.Asigna a cada pregunta fuentes, hechos, reglas de acceso y un resultado esperado.
  3. 3.Incluye casos difíciles: paráfrasis, fuentes obsoletas, permisos denegados, contradicciones y conocimiento ausente.
  4. 4.Ejecuta la misma versión contra el sistema y puntúa por separado recuperación y respuesta generada.
  5. 5.Revisa los fallos con responsables de dominio, corrige fuentes o sistema y conserva versiones para poder comparar.

Ideas equivocadas

Un golden dataset es una colección permanente de respuestas perfectas del modelo.
Es una referencia revisada para una versión concreta de fuentes y uso; debe cambiar cuando cambian políticas, flujos o riesgos.
Un conjunto grande es automáticamente representativo.
Muchas preguntas fáciles y repetidas pueden omitir permisos, vigencia, ambigüedad y casos sin respuesta que determinan la seguridad empresarial.

Conceptos relacionados

Lecturas relacionadas

Fuentes

Revisado:

Revisado por: Javier Chulvi Bernad · LLM Engineer · Madrid