Saltar al contenido
martes 6 de octubre de 2026 · Ciudad de México 🌤 --° El poder, cuadro por cuadro.
Última hora

Ciencia y Tecnología

Qué son los LMM: IA que combina texto, imágenes y sonido

Los modelos grandes multimodales relacionan distintos tipos de información. Sus capacidades dependen de las modalidades y tareas de cada versión.

Por Editor web Maya Comunicación · 5 de octubre de 2026 · Lectura de 3 min

Ilustración editorial: cámara, micrófono y formas visuales convergen hacia una pantalla.

Los modelos grandes multimodales, conocidos como LMM por sus siglas en inglés, pueden relacionar distintos tipos de información dentro de una misma tarea. En lugar de trabajar únicamente con texto, algunos reciben imágenes, audio o video. La diferencia permite hacer preguntas sobre un documento fotografiado o analizar contenido visual, según las capacidades de cada modelo.

Multimodal significa que interviene más de una modalidad de información. No implica que cualquier sistema acepte todos los formatos ni que genere todo lo que puede recibir. Antes de usarlo, conviene distinguir sus entradas y salidas: comprender una imagen, describirla y producir una imagen nueva son capacidades diferentes.

Un ejemplo documentado es Qwen3-VL. Su informe técnico, publicado en noviembre de 2025 por el equipo Qwen, describe la integración de texto, imágenes y video. Es un modelo de visión y lenguaje: esa denominación indica qué combina, sin convertirlo automáticamente en una herramienta para cualquier tarea.

El reporte explica que la arquitectura incorpora información visual en distintas capas y emplea marcas temporales para el video. En términos prácticos, relacionar una pregunta escrita con lo que aparece en una imagen requiere conectar representaciones de ambas entradas. No basta con reconocer objetos aislados: también importa el contexto de la consulta.

Otro caso es Qwen3-Omni, presentado en un informe de septiembre de 2025. Sus autores describen un modelo que procesa texto, imágenes, audio y video, y genera texto y voz. Estos documentos son ejemplos verificables de multimodalidad; no constituyen por sí solos una clasificación de todos los productos disponibles.

Como ejercicio de uso, puedes pedir una descripción de una gráfica y compararla con sus etiquetas originales. Solicita que el sistema separe lo que observa de lo que infiere. Si hay letras pequeñas, partes borrosas o información fuera del encuadre, conserva esa limitación en el resultado en vez de completar los espacios con suposiciones.

Recibir más formatos tampoco elimina las respuestas falsas. El NIST advierte que las confabulaciones pueden aparecer en distintos contextos de IA generativa. Por eso una descripción convincente de una fotografía debe contrastarse con la imagen, y una transcripción importante, con el audio original.

Para elegir una herramienta, prepara una muestra de la tarea que realmente necesitas resolver y revisa su resultado. Comprueba si conserva unidades, nombres y secuencias; anota qué falla. Evita subir archivos privados cuando puedas utilizar ejemplos sin datos personales y revisa las condiciones del servicio antes de compartir material.

Lo que sigue es evaluar estos modelos por tareas y versiones concretas. La etiqueta LMM informa que combinan modalidades, pero no garantiza precisión universal. Para el usuario, la mejor prueba consiste en verificar qué reciben, qué producen y cuánto trabajo de revisión exige su respuesta antes de incorporarla a una decisión o publicación.

ANÚNCIATE AQUÍTu marca frente al poder y a miles de lectores diariosCotizar campaña

Más de Ciencia y Tecnología

Sigue leyendo

Ver todo

Sincronización en tiempo real

México

--:--:--  

--°C

Cargando datos…

 

 
Trayectoria solar
Tendencia 24 horas
Pronóstico 7 días

Datos meteorológicos: Open-Meteo · Calidad del aire: Open-Meteo AQ · Actualización cada 30 min

WhatsApp 56 1486 0138