Qué son los LMM: IA que combina texto, imágenes y sonido
Los modelos grandes multimodales relacionan distintos tipos de información. Sus capacidades dependen de las modalidades y tareas de cada versión.

Los modelos grandes multimodales, conocidos como LMM por sus siglas en inglés, pueden relacionar distintos tipos de información dentro de una misma tarea. En lugar de trabajar únicamente con texto, algunos reciben imágenes, audio o video. La diferencia permite hacer preguntas sobre un documento fotografiado o analizar contenido visual, según las capacidades de cada modelo.
Multimodal significa que interviene más de una modalidad de información. No implica que cualquier sistema acepte todos los formatos ni que genere todo lo que puede recibir. Antes de usarlo, conviene distinguir sus entradas y salidas: comprender una imagen, describirla y producir una imagen nueva son capacidades diferentes.
Un ejemplo documentado es Qwen3-VL. Su informe técnico, publicado en noviembre de 2025 por el equipo Qwen, describe la integración de texto, imágenes y video. Es un modelo de visión y lenguaje: esa denominación indica qué combina, sin convertirlo automáticamente en una herramienta para cualquier tarea.
El reporte explica que la arquitectura incorpora información visual en distintas capas y emplea marcas temporales para el video. En términos prácticos, relacionar una pregunta escrita con lo que aparece en una imagen requiere conectar representaciones de ambas entradas. No basta con reconocer objetos aislados: también importa el contexto de la consulta.
Otro caso es Qwen3-Omni, presentado en un informe de septiembre de 2025. Sus autores describen un modelo que procesa texto, imágenes, audio y video, y genera texto y voz. Estos documentos son ejemplos verificables de multimodalidad; no constituyen por sí solos una clasificación de todos los productos disponibles.
Como ejercicio de uso, puedes pedir una descripción de una gráfica y compararla con sus etiquetas originales. Solicita que el sistema separe lo que observa de lo que infiere. Si hay letras pequeñas, partes borrosas o información fuera del encuadre, conserva esa limitación en el resultado en vez de completar los espacios con suposiciones.
Recibir más formatos tampoco elimina las respuestas falsas. El NIST advierte que las confabulaciones pueden aparecer en distintos contextos de IA generativa. Por eso una descripción convincente de una fotografía debe contrastarse con la imagen, y una transcripción importante, con el audio original.
Para elegir una herramienta, prepara una muestra de la tarea que realmente necesitas resolver y revisa su resultado. Comprueba si conserva unidades, nombres y secuencias; anota qué falla. Evita subir archivos privados cuando puedas utilizar ejemplos sin datos personales y revisa las condiciones del servicio antes de compartir material.
Lo que sigue es evaluar estos modelos por tareas y versiones concretas. La etiqueta LMM informa que combinan modalidades, pero no garantiza precisión universal. Para el usuario, la mejor prueba consiste en verificar qué reciben, qué producen y cuánto trabajo de revisión exige su respuesta antes de incorporarla a una decisión o publicación.


