Red teaming de IA
Práctica de probar un sistema de IA de forma adversarial y estructurada para descubrir fallos, riesgos y formas de abuso antes y después de desplegarlo.
Explicado fácil
El red teaming consiste en intentar encontrar deliberadamente maneras en que un sistema de IA podría fallar o causar daño, para que el equipo responsable pueda corregirlo o limitar el riesgo.
Una analogía
Es como contratar a alguien para que intente entrar en un edificio antes de abrirlo al público: no para causar daños, sino para descubrir qué puertas y procedimientos necesitan mejorar.
Un ejemplo
Un equipo prueba un asistente con solicitudes ambiguas, intentos de extraer información privada y documentos con instrucciones maliciosas. Registra qué ocurrió, qué impacto tendría y qué controles deben reforzarse.
Cómo funciona (nivel técnico)
Se define el alcance y el modelo de amenaza; se diseñan pruebas sobre comportamientos y componentes relevantes; se documentan resultados reproducibles y severidad; y se priorizan mitigaciones que vuelven a probarse. Puede combinar pruebas manuales y automatizadas, y debe repetirse cuando cambian el modelo, las herramientas o los datos.
Errores comunes
- Confundir red teaming con una lista de prompts de jailbreak o con una auditoría completa.
- Considerar que no encontrar un fallo demuestra que el sistema es seguro.
- Probar sin alcance, autorización o reglas claras, especialmente si se usan sistemas y datos de terceros.