Modelo multimodal
Modelo de IA capaz de procesar o generar varios tipos de información a la vez, como texto, imágenes, audio y vídeo.
Explicado fácil
Los primeros modelos de lenguaje solo entendían texto. Un modelo multimodal puede, además, “ver” una imagen, “oír” un audio o analizar un vídeo, y relacionar todo ello en una misma conversación.
Una analogía
Es la diferencia entre alguien que solo sabe leer y alguien que además puede mirar fotos, escuchar música y entender una conversación. Combina los sentidos para comprender mejor.
Un ejemplo
Sacas una foto a la nevera abierta y preguntas “¿qué puedo cocinar con esto?”. El modelo identifica los ingredientes de la imagen y propone recetas.
Cómo funciona (nivel técnico)
La idea central es representar todas las modalidades en un espacio común de embeddings. Un codificador de imágenes (por ejemplo, un Vision Transformer) convierte una imagen en vectores que el modelo de lenguaje procesa junto con los tokens de texto. Un hito fue CLIP, que aprendió a alinear imágenes y descripciones mediante aprendizaje contrastivo. Hoy existen modelos que manejan texto, imagen y audio de forma nativa, tanto en entrada como en salida.
Errores comunes
- Suponer que “ver” una imagen equivale a verla como una persona: pueden fallar al contar objetos, leer texto pequeño o interpretar relaciones espaciales.
- Subir imágenes con datos personales sin considerar la privacidad.