Saltar al contenido

Envenenamiento de datos

Nivel avanzado Revisado el 6 de octubre de 2026

Ataque que altera o introduce datos de entrenamiento para degradar un modelo, sesgar su comportamiento o insertar una asociación no deseada.

Explicado fácil

Si un atacante consigue contaminar los ejemplos con los que se entrena una IA, puede influir en lo que aprende. El resultado puede ser un modelo menos fiable o que responda de forma maliciosa ante ciertos patrones.

Una analogía

Es como cambiar algunas respuestas de un libro de ejercicios antes de que el estudiante lo use: quizá aprenda una regla equivocada o falle justo en ciertos casos.

Un ejemplo

Alguien introduce ejemplos manipulados en un conjunto de entrenamiento para que un clasificador asocie una marca concreta con una etiqueta incorrecta. El impacto depende de cómo se recopilan y revisan los datos.

Cómo funciona (nivel técnico)

El envenenamiento afecta el proceso de entrenamiento o los datos de los que depende. Puede buscar degradación general, sesgos dirigidos o una puerta trasera que se active con una señal específica. No es lo mismo que una evasión, que modifica una entrada durante la inferencia. Las defensas incluyen procedencia verificable, controles de acceso, análisis de anomalías y evaluación con casos diseñados para detectar comportamientos no deseados.

Errores comunes

  • Confundir envenenamiento de datos con inyección de prompts, que intenta manipular el comportamiento durante el uso.
  • Creer que limpiar duplicados o datos mal formados detecta cualquier envenenamiento dirigido.
  • Suponer que solo los conjuntos propios pueden contaminarse; también hay dependencias y fuentes externas.