Volver al blog
General5 min de lectura

Cómo evaluar una búsqueda interna con IA: lista de 15 preguntas

Lista reproducible de 15 preguntas para probar búsqueda interna con IA: relevancia, permisos, actualización, citas y calidad de respuesta.

Una demo de búsqueda interna con IA puede resultar convincente y, aun así, evitar las preguntas que importan después del lanzamiento. Una respuesta pulida ante una consulta preparada no demuestra que el sistema respete permisos, encuentre la política vigente, reconozca que falta evidencia o siga siendo útil cuando una persona pregunta de forma ambigua.

La forma práctica de comparar herramientas consiste en probarlas con el mismo pequeño conjunto de conocimiento sintético y puntuar comportamientos observables. Esta lista ofrece a operaciones, TI, seguridad y gestión del conocimiento un método repetible. No presupone que una arquitectura o un proveedor sea siempre la mejor opción.

Empieza con un conjunto de evaluación controlado

Crea entre 15 y 25 documentos ficticios que se parezcan a tu mezcla real sin utilizar datos de clientes ni empleados. Incluye una política vigente, una versión obsoleta, una hoja de cálculo, una nota de reunión, dos documentos con títulos parecidos, un documento restringido y una pregunta cuya respuesta no exista.

Redacta diez preguntas realistas antes de subir nada. Para cada una, anota la fuente esperada, los hechos que deben aparecer, los que no deben aparecer y qué perfiles pueden ver la respuesta. Así evitas cambiar la prueba después de observar la salida de cada proveedor.

La guía actual de arquitectura RAG de Microsoft separa las decisiones de recuperación, filtrado, ranking y reranking. La guía de evaluación de Google Cloud también distingue fundamentación, seguimiento de instrucciones y calidad de respuesta. Para quien compra, la conclusión es sencilla: «ha respondido» no constituye por sí solo un aprobado.

Recuperación y relevancia

1. ¿Encuentra terminología exacta?

Pregunta por un número de factura, un código de política, una referencia de producto o un acrónimo poco habitual. Los identificadores exactos revelan los sistemas que dependen demasiado de una similitud semántica amplia. Una buena herramienta debe conservar la precisión de palabras clave y comprender el lenguaje natural.

2. ¿Entiende paráfrasis?

Formula la misma pregunta sin utilizar las palabras del documento. Así compruebas si la búsqueda semántica conecta el lenguaje cotidiano con la terminología formal de la empresa.

3. ¿Coloca primero el documento autoritativo?

Incluye una política vigente y un borrador antiguo con texto parecido. El sistema debe preferir la fuente aprobada y actual, no solo el fragmento más similar.

4. ¿Explica qué fuente respalda cada afirmación?

Una lista de documentos es menos útil que la trazabilidad por afirmación. Comprueba si una persona revisora puede pasar de una frase de la respuesta al fragmento exacto que la respalda.

5. ¿Qué ocurre cuando falta la respuesta?

El resultado correcto puede ser «no encuentro esa información en las fuentes conectadas». Premia la negativa calibrada; no premies una suposición bien redactada.

Permisos y confidencialidad

6. ¿Se aplican los permisos antes de recuperar información?

Prueba la misma pregunta con dos perfiles sintéticos. Un documento restringido no debe influir en la respuesta, las citas, los fragmentos ni las sugerencias de quien no tiene acceso.

7. ¿Puede el equipo administrador explicar la herencia de permisos?

Pregunta cómo se representan y actualizan los permisos procedentes de Drive, SharePoint u otra fuente. «Le dijimos al modelo que no lo revelara» no es un diseño de control de acceso.

8. ¿Cómo trata instrucciones maliciosas dentro de documentos?

Incluye una prueba inocua de inyección de prompt que pida al asistente ignorar su tarea. OWASP identifica la inyección de prompt y la divulgación de información sensible como riesgos recurrentes de las aplicaciones. La prueba consiste en comprobar si un texto no fiable puede redirigir el comportamiento o exponer contexto ajeno.

Actualización y ciclo de vida

9. ¿Cuánto tarda una actualización en aparecer?

Modifica una política sintética y mide el tiempo hasta que la nueva versión se pueda consultar. Registra si la versión antigua sigue visible y cómo se resuelven los conflictos.

10. ¿Desaparece de forma fiable el contenido eliminado o revocado?

Eliminar también forma parte de la corrección. Pide evidencia de que una eliminación o revocación se propaga por índices, cachés y respuestas generadas.

11. ¿Ayuda a identificar conocimiento obsoleto?

La herramienta debería mostrar áreas desactualizadas, contradictorias o sin respuesta, en vez de ocultarlas detrás de una interfaz segura de sí misma.

Calidad de respuesta y evaluación

12. ¿Mide por separado fundamentación y utilidad?

Una respuesta puede estar totalmente respaldada y, aun así, no resolver la pregunta. Google Cloud documenta la fundamentación y la calidad de pregunta-respuesta como dimensiones diferentes. Puntúa ambas.

13. ¿Puedes repetir las mismas pruebas después de un cambio?

Un proceso útil mantiene versionadas las preguntas, fuentes esperadas, permisos y resultados. Los recursos del AI RMF de NIST insisten en probar, evaluar, verificar y validar durante todo el ciclo de vida, no solo durante una demo.

14. ¿Son visibles los compromisos entre latencia y calidad?

El reranking puede mejorar la relevancia, pero añade trabajo después de la recuperación inicial. Pide percentiles de tiempo de respuesta con tu conjunto de prueba, no únicamente el ejemplo más rápido.

15. ¿Puede el equipo revisar fallos sin leer todas las conversaciones?

Busca un flujo que agrupe preguntas sin respuesta, resultados de baja confianza, citas ausentes y lagunas recurrentes en las fuentes. Un buen modelo operativo convierte los fallos en una cola de mejora.

Utiliza una puntuación sencilla

Puntúa cada pregunta de 0 a 2:

  • 0: no existe, no se puede verificar o falla la prueba.
  • 1: funciona parcialmente, requiere interpretación manual o sus controles no están claros.
  • 2: supera la prueba con evidencia observable.

Mantén los controles de seguridad fuera de la suma. Una herramienta que filtra un documento restringido debe suspender aunque su nota agregada sea alta. Para el resto, compara el total, la categoría más débil y el esfuerzo operativo necesario para mantener el sistema sano.

Ejecuta la misma evaluación con al menos dos perfiles y repítela después de modificar una política. Obtendrás evidencia sobre recuperación, permisos y actualización en lugar de una colección de impresiones de demo.

Qué pedir en una evaluación real de Polp

La página pública de Polp describe respuestas basadas en documentos conectados de la empresa y fuentes trazables. Tómalo como una afirmación que debes comprobar, no como una razón para saltarte las pruebas. Utiliza la lista con una carpeta sintética, inspecciona las fuentes devueltas y formula la misma pregunta con permisos distintos.

El kit de gobernanza de IA ayuda a asignar responsables y revisiones. Si quieres ejecutar esta puntuación con Polp, solicita una demo y trae tus pruebas y respuestas esperadas.

Regla de decisión

Elige la herramienta que rinda mejor con tus preguntas controladas, respete todos los límites de acceso y permita mejorar los fallos de manera práctica. No decidas solo por el nombre del modelo, el número de conectores o una respuesta espectacular.

El proceso de compra más útil es pequeño, reproducible y difícil de manipular: documentos fijos, perfiles fijos, preguntas fijas, fuentes visibles y una condición de aprobado escrita.

Deja de buscar. Empieza a preguntar.
Sube tus PDFs, Excels y Docs. El resto lo hace la IA.
evaluar búsqueda interna con IAlista evaluación IA empresarialguía compra RAGevaluación asistente de conocimientobúsqueda con permisos

Mas articulos

9 de cada 10 búsquedas internas en empresas fracasan al primer intento. Descubre cómo la búsqueda conversacional con IA está eliminando este problema en 2026.
Tus empleados dedican una parte enorme de su jornada a buscar información: en correos, en carpetas compartidas, en manuales de procedimientos...