Ética y seguridad
Riesgos, sesgos y cómo conseguir que la IA haga lo que queremos.
- Alineamiento
Campo que busca que los sistemas de IA hagan lo que las personas realmente quieren y valoran, y no solo lo que se les pidió literalmente.
- Envenenamiento de datos
Ataque que altera o introduce datos de entrenamiento para degradar un modelo, sesgar su comportamiento o insertar una asociación no deseada.
- Inteligencia artificial general (AGI)
Hipotético sistema de IA capaz de aprender y razonar en casi cualquier tarea intelectual al nivel de una persona o por encima, no solo en tareas concretas.
- Inyección de prompts
Ataque que intenta manipular un modelo mediante instrucciones maliciosas incluidas en el prompt o en contenido externo que el modelo procesa.
- Red teaming de IA
Práctica de probar un sistema de IA de forma adversarial y estructurada para descubrir fallos, riesgos y formas de abuso antes y después de desplegarlo.
- RLHF
Aprendizaje por refuerzo con retroalimentación humana: técnica que ajusta un modelo según las preferencias de personas para que sus respuestas sean más útiles y seguras.
- Sesgo algorítmico
Tendencia de un sistema de IA a producir resultados sistemáticamente injustos o desequilibrados para ciertos grupos de personas, normalmente heredados de los datos o del diseño.