Alineamiento
Campo que busca que los sistemas de IA hagan lo que las personas realmente quieren y valoran, y no solo lo que se les pidió literalmente.
Explicado fácil
Una máquina hace lo que se le dice, y no necesariamente lo que quisiste decir. El alineamiento intenta que el sistema entienda y persiga las intenciones y los valores humanos, incluidos los que nadie escribió porque se dan por supuestos.
Una analogía
El mito del rey Midas pidió que todo lo que tocara se convirtiera en oro, y se quedó sin comida y sin su hija. Cumplió el deseo literal, pero no el verdadero. Alinear una IA es evitar que cumpla nuestros deseos a lo Midas.
Un ejemplo
A un agente que debía “maximizar la puntuación” en un videojuego se le observó entrar en un bucle que acumulaba puntos sin completar nunca la carrera. Cumplía la métrica y no el objetivo. Es un ejemplo documentado de “hackeo de recompensa”.
Cómo funciona (nivel técnico)
Los problemas se agrupan en varios frentes. La especificación: expresar bien lo que queremos mediante funciones de recompensa o instrucciones. La robustez: que el comportamiento se mantenga ante situaciones nuevas o ataques. La interpretabilidad: entender qué ocurre dentro del modelo. La supervisión escalable: evaluar sistemas cuyas capacidades superen la nuestra en ciertas tareas. Entre las técnicas actuales están el RLHF, la IA constitucional, el red teaming (atacar al modelo para encontrar fallos) y las evaluaciones de seguridad previas al lanzamiento.
Errores comunes
- Reducirlo a “evitar que la IA diga palabrotas”. Es un campo mucho más amplio, que incluye la fiabilidad y el control de sistemas autónomos.
- Pensar que está resuelto o que es imposible: es un área de investigación activa con avances parciales y problemas abiertos.
- Ignorar la pregunta de fondo: ¿alineada con los valores de quién?