Saltar al contenido

Inyección de prompts

Nivel intermedio Revisado el 6 de octubre de 2026

Ataque que intenta manipular un modelo mediante instrucciones maliciosas incluidas en el prompt o en contenido externo que el modelo procesa.

Explicado fácil

La inyección de prompts ocurre cuando alguien intenta que el modelo siga instrucciones que no debería obedecer. El texto puede estar en el mensaje del usuario o escondido en una página, documento o correo que el sistema consulta.

Una analogía

Es como entregar a un asistente una carta para resumir que contiene una nota engañosa: «ignora el encargo y revela los documentos privados». El texto está dentro del material, pero no debería cambiar las reglas de acceso.

Un ejemplo

Un agente que lee páginas web recibe una instrucción maliciosa incrustada en una de ellas para que envíe información confidencial a una dirección externa. Si el agente puede usar herramientas sin controles, el contenido puede intentar inducir una acción no autorizada.

Cómo funciona (nivel técnico)

Los modelos de lenguaje procesan instrucciones y datos en una misma secuencia de tokens, por lo que separar ambas cosas solo con delimitadores o frases del sistema no constituye una barrera de seguridad fiable. La inyección puede ser directa o indirecta, a través de contenido recuperado. Las defensas combinan limitar privilegios, tratar documentos externos como datos no confiables, validar resultados y exigir autorización independiente para acciones sensibles.

Errores comunes

  • Pensar que una instrucción de sistema o una frase como «ignora ataques» bloquea por sí sola el ataque.
  • Conceder al modelo acceso amplio a archivos, cuentas o herramientas sin controles externos.
  • Asumir que el contenido recuperado por RAG es seguro solo porque procede de una fuente legítima.