Meta ha presentado Chameleon, su nueva inteligencia artificial multimodal, diseñada para abordar la creciente competencia en el campo de la IA generativa. Chameleon se distingue por ser multimodal de forma nativa, integrando de manera fluida componentes de diferentes modalidades como imágenes, texto y código.
Según el paper publicado por el equipo de investigación, la arquitectura de Chameleon permite un rendimiento sobresaliente en tareas que requieren una comprensión profunda tanto de información visual como textual. Entre las capacidades destacadas de Chameleon se encuentran el subtitulado de imágenes y la respuesta a preguntas visuales (VQA), además de su competitividad en tareas exclusivamente textuales.
Tradicionalmente, los modelos multimodales se crean mediante un proceso conocido como “fusión tardía”, donde el sistema de IA procesa diferentes modalidades por separado y luego fusiona las codificaciones para la inferencia. Sin embargo, este enfoque limita la capacidad de los modelos para integrar información de manera fluida entre diferentes modalidades.
Chameleon ha adoptado una arquitectura de “fusión temprana basada en tokens mixtos”, lo que significa que ha sido diseñado desde cero para aprender a partir de una mezcla intercalada de imágenes, texto y otras modalidades. Esta metodología transforma las imágenes en tokens discretos, similar a cómo los modelos lingüísticos manejan las palabras, y utiliza un vocabulario unificado de tokens de texto, código e imagen.
En comparación con modelos similares como Google Gemini, Chameleon ofrece una integración más cohesiva de las modalidades durante la generación de contenido, ya que no requiere componentes específicos para cada modalidad.

El entrenamiento de Chameleon se llevó a cabo en dos etapas, utilizando un vasto conjunto de datos que incluye 4,4 billones de tokens de texto, pares imagen-texto y secuencias de texto e imágenes intercaladas. Los modelos de Chameleon, con 7.000 y 34.000 millones de parámetros, se entrenaron durante más de 5 millones de horas en GPUs Nvidia A100 de 80 GB.
Los experimentos demostraron que Chameleon puede realizar una amplia gama de tareas de texto y multimodales con un rendimiento líder en el mercado. En pruebas de VQA y subtitulado de imágenes, Chameleon-34B superó a modelos como Flamingo, IDEFICS y Llava-1.5. Además, igualó el rendimiento de otros modelos con menos ejemplos de entrenamiento en contexto y con modelos de menor tamaño.
A pesar de la complejidad de la multimodalidad, Chameleon sigue siendo competitivo en tareas de solo texto, comparable a modelos como Mixtral 8x7B y Gemini-Pro en pruebas de razonamiento lógico y comprensión lectora. Los investigadores destacan que Chameleon desbloquea nuevas capacidades de razonamiento y generación multimodal, ofreciendo resultados preferidos por los usuarios en documentos que combinan texto e imágenes de manera intercalada.