Inyección de prompts
Ataque o instrucción accidental que intenta que un sistema de IA ignore sus reglas, revele datos o utilice herramientas indebidamente.
Ejemplo en una empresa
Una instrucción maliciosa oculta en una web pide al agente divulgar información confidencial cuando la resume.
Cómo funciona
- 1.Contenido no confiable entra en el contexto del modelo.
- 2.El contenido imita una instrucción de mayor prioridad.
- 3.El aislamiento, mínimo privilegio y confirmación limitan el impacto.
Ideas equivocadas
Conceptos relacionados
Lecturas relacionadas
Fuentes
Revisado:
Revisado por: Javier Chulvi Bernad · LLM Engineer · Madrid