Saltar al contenido

Red teaming de IA

Nivel intermedio Revisado el 6 de octubre de 2026

Práctica de probar un sistema de IA de forma adversarial y estructurada para descubrir fallos, riesgos y formas de abuso antes y después de desplegarlo.

Explicado fácil

El red teaming consiste en intentar encontrar deliberadamente maneras en que un sistema de IA podría fallar o causar daño, para que el equipo responsable pueda corregirlo o limitar el riesgo.

Una analogía

Es como contratar a alguien para que intente entrar en un edificio antes de abrirlo al público: no para causar daños, sino para descubrir qué puertas y procedimientos necesitan mejorar.

Un ejemplo

Un equipo prueba un asistente con solicitudes ambiguas, intentos de extraer información privada y documentos con instrucciones maliciosas. Registra qué ocurrió, qué impacto tendría y qué controles deben reforzarse.

Cómo funciona (nivel técnico)

Se define el alcance y el modelo de amenaza; se diseñan pruebas sobre comportamientos y componentes relevantes; se documentan resultados reproducibles y severidad; y se priorizan mitigaciones que vuelven a probarse. Puede combinar pruebas manuales y automatizadas, y debe repetirse cuando cambian el modelo, las herramientas o los datos.

Errores comunes

  • Confundir red teaming con una lista de prompts de jailbreak o con una auditoría completa.
  • Considerar que no encontrar un fallo demuestra que el sistema es seguro.
  • Probar sin alcance, autorización o reglas claras, especialmente si se usan sistemas y datos de terceros.