Volver al glosario
Calidad y seguridad de IA

Inyección de prompts

Ataque o instrucción accidental que intenta que un sistema de IA ignore sus reglas, revele datos o utilice herramientas indebidamente.

Ejemplo en una empresa

Una instrucción maliciosa oculta en una web pide al agente divulgar información confidencial cuando la resume.

Cómo funciona

  1. 1.Contenido no confiable entra en el contexto del modelo.
  2. 2.El contenido imita una instrucción de mayor prioridad.
  3. 3.El aislamiento, mínimo privilegio y confirmación limitan el impacto.

Ideas equivocadas

Un prompt de sistema más fuerte resuelve el problema.
El prompt ayuda, pero también hacen falta permisos, límites de datos y monitorización.

Conceptos relacionados

Lecturas relacionadas

Fuentes

Revisado:

Revisado por: Javier Chulvi Bernad · LLM Engineer · Madrid