El benchmark MMMU (Massive Multi-discipline Multimodal Understanding) se ha convertido en la vara de medir para saber qué modelos de IA entienden imágenes de verdad y cuáles se limitan a describirlas por encima. Mide comprensión a nivel universitario en disciplinas como medicina, ingeniería, arte o derecho, con preguntas que combinan texto e imagen. Este ranking ordena los cinco modelos con mejor puntuación MMMU disponibles comercialmente en España en 2026, de mayor a menor. Nada de "los mejores": manda el número.
Un aviso previo. Las puntuaciones de MMMU las publican los propios laboratorios y el leaderboard oficial del proyecto MMMU (mmmu-benchmark.github.io). Cuando un proveedor no ha publicado cifra oficial de su modelo estrella actual, lo indicamos.
Criterio del ranking: qué mide MMMU y por qué importa
MMMU plantea unas 11.500 preguntas multimodales de nivel universitario, repartidas en seis áreas y 30 materias. No basta con "ver" la imagen: hay que razonar sobre ella. Un modelo puede describir bien una foto y fallar estrepitosamente al interpretar un diagrama de circuito o una radiografía. De ahí que MMMU sea, hoy por hoy, la referencia más honesta para comprensión visual profunda.
Ordenamos por puntuación MMMU (validación estándar, sin chain-of-thought extendido salvo que se indique). En empate técnico, prioriza el acceso comercial en España y el precio por millón de tokens de entrada de imagen.
1. OpenAI GPT-5 — el techo actual en comprensión visual
GPT-5, lanzado por OpenAI a mediados de 2025 y con acceso pleno en España vía ChatGPT y API, marca el techo del ranking. Según datos publicados por OpenAI, ronda un 84-85% en MMMU, por encima de cualquier rival comercial abierto al público general. En la práctica, es el modelo al que recurrimos cuando hay que interpretar tablas complejas, planos técnicos o capturas de código con errores tipográficos: se equivoca menos que el resto y explica su razonamiento con más orden.
¿El pero? El precio. La API de visión de GPT-5 sigue siendo cara si se procesan miles de imágenes al mes, y la versión web con capacidades completas requiere ChatGPT Plus (22 €/mes con IVA en España) o superior.
| Especificación | Valor |
|---|---|
| Puntuación MMMU | ~84-85% |
| Proveedor | OpenAI |
| Casos de uso destacados | Análisis de documentos, diagramas técnicos, código en captura |
| Vía de acceso en España | ChatGPT web/app, API OpenAI, Azure OpenAI |
| Precio desde | 22 €/mes (ChatGPT Plus); API por uso |
| On-premise | No |
2. Google Gemini 2.5 Pro — el rival directo, más barato en API
Gemini 2.5 Pro se queda muy cerca. Google reporta cifras en torno al 82% en MMMU, y su ventaja real está en la ventana de contexto y en el precio por imagen procesada vía API, notablemente inferior al de OpenAI. Se accede desde gemini.google.com, la app Gemini para Android/iOS y Vertex AI en Google Cloud, todo disponible en España.
A nuestro juicio, Gemini 2.5 Pro es la mejor opción cuando hay que analizar vídeos largos o PDFs con cientos de páginas escaneadas. Eso sí, en razonamiento visual muy fino sobre imágenes ambiguas, GPT-5 sigue un escalón por encima.
| Especificación | Valor |
|---|---|
| Puntuación MMMU | ~82% |
| Proveedor | Google DeepMind |
| Casos de uso destacados | Vídeo largo, PDFs escaneados, OCR multilenguaje |
| Vía de acceso en España | Gemini web/app, API Google AI Studio, Vertex AI |
| Precio desde | 21,99 €/mes (Google AI Pro); API por uso |
| On-premise | No (sí en Vertex AI privado) |
3. Anthropic Claude 3.5 Sonnet — el más fiable en documentos densos
Aquí conviene ser precisos: Anthropic ha publicado cifras oficiales de MMMU para Claude 3.5 Sonnet en torno al 68-70%, y las versiones posteriores de la familia Claude han seguido subiendo. En España se accede desde claude.ai, la API de Anthropic y AWS Bedrock. Claude destaca por su tono cauteloso al interpretar imágenes: reconoce lo que no sabe, algo que otros modelos disimulan con seguridad injustificada.
En análisis de contratos escaneados, gráficas financieras o screenshots con muchísimo texto, para mi gusto rinde por encima de lo que sugiere su número. La puntuación MMMU no siempre refleja utilidad real, y este es un buen ejemplo.
| Especificación | Valor |
|---|---|
| Puntuación MMMU | ~68-70% |
| Proveedor | Anthropic |
| Casos de uso destacados | Documentos legales, gráficas, capturas con mucho texto |
| Vía de acceso en España | Claude.ai, API Anthropic, AWS Bedrock |
| Precio desde | 18,00 €/mes (Claude Pro); API por uso |
| On-premise | No (sí en Bedrock privado) |
4. Mistral Pixtral Large — la mejor opción europea con pesos abiertos
Pixtral Large, presentado por Mistral AI a finales de 2024, es la apuesta europea seria en multimodal. Mistral reporta un MMMU en torno al 64%, cifra respetable para un modelo con pesos abiertos bajo licencia Mistral Research. Se accede vía Le Chat (chat.mistral.ai), API La Plateforme y, sobre todo, se puede desplegar on-premise — la gran diferencia frente a los tres anteriores. Eso, para una empresa española con datos sensibles, no es un detalle: es el argumento.
Rinde peor que Gemini o GPT-5 en razonamiento visual complejo, y en la práctica queda por detrás en OCR fino. Para muchos escenarios corporativos, compensa. En otros, no.
| Especificación | Valor |
|---|---|
| Puntuación MMMU | ~64% |
| Proveedor | Mistral AI (Francia) |
| Casos de uso destacados | Despliegue privado, RAG multimodal, análisis interno |
| Vía de acceso en España | Le Chat, API La Plateforme, on-premise |
| Precio desde | Gratis en Le Chat; API por uso; licencia empresarial bajo consulta |
| On-premise | Sí (pesos disponibles) |
5. Meta Llama 3.2 90B Vision — el abierto de referencia
Cierra el ranking Llama 3.2 90B Vision, el modelo multimodal de Meta con licencia abierta (Llama Community License). Meta reporta un MMMU cercano al 60% en su versión de 90B parámetros. En España se puede usar vía Meta AI en WhatsApp/Instagram, a través de proveedores como Groq, Together AI o Fireworks, y desplegado en local por quien tenga hardware.
Su gran baza es el precio: en API llega a costar céntimos por millón de tokens de imagen frente a los euros que piden los cerrados. Sobre el papel, es la opción más barata para volumen alto. En la práctica, hay que aceptar que fallará más en preguntas visuales complejas.
| Especificación | Valor |
|---|---|
| Puntuación MMMU | ~60% |
| Proveedor | Meta |
| Casos de uso destacados | Alto volumen a bajo coste, despliegue local, prototipado |
| Vía de acceso en España | Meta AI, Groq, Together AI, on-premise |
| Precio desde | Gratis (Meta AI); API por uso desde ~0,20 $/M tokens |
| On-premise | Sí (pesos disponibles) |
Qué se ha quedado fuera y por qué
Grok 2 Vision de xAI ronda cifras de MMMU competitivas, pero su acceso en España sigue atado a X Premium+ y con condiciones cambiantes; preferimos no listarlo hasta que se estabilice. Qwen2-VL de Alibaba puntúa alto en MMMU, pero su acceso comercial estable en España es limitado fuera de Hugging Face. Y GPT-4o queda descartado: OpenAI lo ha desplazado a un segundo plano frente a GPT-5, y en API se considera generación anterior.
Tabla resumen con puntuación TecnoRankings
Puntuación 1-10 ponderando MMMU (50%), acceso en España (20%), precio (20%) y flexibilidad de despliegue (10%).
| # | Modelo | MMMU | Acceso ES | Precio desde | On-premise | Nota TR |
|---|---|---|---|---|---|---|
| 1 | OpenAI GPT-5 | ~84-85% | ChatGPT, API | 22 €/mes | No | 9,2 |
| 2 | Google Gemini 2.5 Pro | ~82% | Gemini, Vertex AI | 21,99 €/mes | Parcial | 9,0 |
| 3 | Anthropic Claude 3.5 Sonnet | ~68-70% | Claude.ai, Bedrock | 18 €/mes | Parcial | 8,1 |
| 4 | Mistral Pixtral Large | ~64% | Le Chat, API | Gratis / bajo consulta | Sí | 7,8 |
| 5 | Meta Llama 3.2 90B Vision | ~60% | Meta AI, Groq | Gratis / API bajo coste | Sí | 7,5 |
Veredicto: mejor absoluto y mejor relación precio-prestaciones
Mejor absoluto en comprensión de imágenes: OpenAI GPT-5. Manda el número MMMU, y en pruebas cualitativas sobre diagramas técnicos y documentos escaneados sigue siendo el más consistente. Perfil de usuario: profesional que necesita fiabilidad máxima y puede pagarla.
Mejor relación precio-prestaciones: Google Gemini 2.5 Pro. Está a dos o tres puntos porcentuales del primero, la API es más barata para volumen y el nivel gratuito en gemini.google.com es sorprendentemente generoso. Para el 90% de casos, no notarás la diferencia con GPT-5, y pagarás bastante menos.
Si tu caso pasa por datos sensibles y despliegue on-premise, la respuesta cambia: Pixtral Large gana por descarte. Ni GPT-5 ni Gemini se dejan instalar en tu servidor. Para ese perfil, Mistral es hoy la única opción europea seria con pesos abiertos y soporte comercial. Puede completarse con lo que vimos en los modelos de IA locales para PC cuando el hardware es más modesto.
Y si lo que buscas es un chatbot generalista sin pagar suscripción, el análisis de los buscadores con IA en 2026 complementa este ranking desde otro ángulo.
FAQ
¿Qué mide exactamente el benchmark MMMU y por qué es la referencia en 2026?
MMMU (Massive Multi-discipline Multimodal Understanding) evalúa modelos con unas 11.500 preguntas multimodales de nivel universitario en 30 materias, desde medicina hasta ingeniería. Es la referencia porque combina imagen y razonamiento experto, no simple descripción visual.
¿GPT-5 es siempre mejor que Gemini 2.5 Pro para analizar imágenes?
En puntuación MMMU, sí, por unos 2-3 puntos porcentuales. En la práctica, Gemini 2.5 Pro rinde mejor con vídeos largos y PDFs de cientos de páginas gracias a su ventana de contexto, y su API es más barata. Depende del caso de uso.
¿Puedo usar Pixtral Large o Llama 3.2 Vision sin conexión a internet?
Sí. Ambos tienen pesos abiertos y pueden desplegarse on-premise si dispones de hardware adecuado (GPUs con VRAM suficiente, típicamente 80 GB para Pixtral Large y similar para Llama 3.2 90B). GPT-5, Gemini y Claude requieren siempre conexión a los servidores del proveedor.
¿Qué modelo elijo si trabajo con documentos legales o médicos en España?
Claude 3.5 Sonnet suele ser el más prudente al reconocer sus límites, algo valioso en contextos sensibles. Para volumen alto con requisitos de privacidad, Pixtral Large desplegado en servidor propio permite cumplir RGPD sin enviar datos fuera de la UE. Consulta siempre con el DPO de tu organización antes de procesar datos personales o clínicos con IA.
