Modelos LLM open-source que compiten con los de pago en 2026: comparativa práctica
Durante años, la conversación sobre los grandes modelos de lenguaje de vanguardia estuvo dominada por APIs cerradas y de pago: GPT, Claude y Gemini. Esa brecha se ha reducido de forma drástica. En el último Artificial Analysis Intelligence Index (v4.0), que agrega diez evaluaciones independientes (GDPval-AA, τ²-Bench Telecom, Terminal-Bench Hard, SciCode, AA-LCR, AA-Omniscience, IFBench, Humanity’s Last Exam, GPQA Diamond y CritPt), varios modelos de pesos abiertos se sitúan a pocos puntos de los mejores sistemas propietarios y, a menudo, a una fracción del coste.
Este artículo repasa las alternativas open-source más cercanas en calidad a los grandes modelos de pago, en qué destaca cada una y cuándo tiene sentido real sustituir una API comercial por una opción auto-alojada o de pesos abiertos.
Qué significa realmente «open-source» aquí
En el mundo de los LLM se usa «open-source» de manera laxa. La mayoría de los modelos aquí comentados son open-weights: los pesos se pueden descargar y auto-alojar, y muchos (pero no todos) permiten uso comercial. Una minoría son totalmente abiertos (pesos + datos + receta de entrenamiento). En este artículo, «open» se refiere a modelos de pesos abiertos utilizables con coste cero o casi cero si se auto-alojan, o muy baratos vía proveedores de inferencia de terceros.
Principales candidatos de pesos abiertos
Según el Intelligence Index v4.0, lideran GLM-5.1 (Zhipu/Z AI) con 51 puntos, MiniMax-M2.7 (50) y Qwen3.5 397B A17B (Alibaba, 46). Otros contendientes serios: DeepSeek V3.2 (42), gpt-oss-120B de OpenAI (36), Gemma 4 31B de Google (39), NVIDIA Nemotron 3 Super (33), Mistral Small 4 (26) y Llama 4 Maverick (18). Como referencia, Claude Opus 4.7, Gemini 3.1 Pro Preview y GPT-5.4 empatan en 57.
Tabla comparativa: Intelligence Index
| Modelo | Tipo | Intelligence Index | Pesos abiertos | Notas |
|---|---|---|---|---|
| Claude Opus 4.7 (max) | Propietario | 57 | ❌ | Insignia de Anthropic |
| Gemini 3.1 Pro Preview | Propietario | 57 | ❌ | Insignia de Google |
| GPT-5.4 (xhigh) | Propietario | 57 | ❌ | Insignia de OpenAI |
| GLM-5.1 | Abierto | 51 | ✅ | Mejor modelo abierto global |
| MiniMax-M2.7 | Abierto | 50 | ✅ | Razonamiento fuerte |
| Qwen3.5 397B A17B | Abierto | 46 | ✅ | MoE, 17B parámetros activos |
| DeepSeek V3.2 | Abierto | 42 | ✅ | Gran relación calidad/precio |
| Gemma 4 31B | Abierto | 39 | ✅ | Ligero y eficiente |
| gpt-oss-120B (high) | Abierto | 36 | ✅ | Modelo abierto de OpenAI |
| NVIDIA Nemotron 3 Super | Abierto | 33 | ✅ | Ecosistema NVIDIA |
| Mistral Small 4 | Abierto | 26 | ✅ | Tamaño reducido |
| Llama 4 Maverick | Abierto | 18 | ✅ | MoE de Meta |
Fuente: Artificial Analysis Intelligence Index v4.0.
Tabla comparativa: Precio (blended, USD por 1M de tokens)
| Modelo | Precio blended (USD / 1M tok) |
|---|---|
| Claude Opus 4.7 (max) | 10,00 $ |
| GPT-5.4 (xhigh) | 6,00 $ |
| Gemini 3.1 Pro Preview | 5,60 $ |
| Claude Sonnet 4.6 (max) | 4,50 $ |
| GLM-5.1 | 2,10 $ |
| DeepSeek V3.2 | 0,30 $ |
| gpt-oss-120B (high) | 0,30 $ |
| NVIDIA Nemotron 3 Super | 0,40 $ |
DeepSeek V3.2 cuesta unas 33 veces menos que Claude Opus 4.7, con una calidad muy cercana para muchas tareas cotidianas.
Fortalezas específicas por caso de uso
- Agentes / uso de herramientas (τ²-Bench Telecom): GLM-5.1 lidera todos los modelos con un 98%, seguido de Kimi K2.5 y Qwen3.6 Max Preview (96%).
- Programación (SciCode): Qwen3.5 397B A17B (89%) y Gemma 4 31B (87%).
- Seguimiento de instrucciones (IFBench): Qwen3.5 397B A17B (50%), por encima de Claude Sonnet 4.6 (46%).
- Razonamiento (GPQA Diamond): Qwen3.5 397B A17B (79%) y MiMo-V2-Pro (72%).
- Control de alucinaciones (AA-Omniscience): los propietarios siguen por delante.
Ventana de contexto
| Modelo | Ventana de contexto |
|---|---|
| Llama 4 Maverick | 10.000.000 tokens |
| Grok 4.20 (propietario) | 2.000.000 |
| Gemini 3.1 Pro | 1.050.000 |
| Claude Opus 4.7 | 1.000.000 |
| GPT-5.4 | 400.000 |
| Qwen3.5 397B | 262.000 |
| GLM-5.1 | 200.000 |
| DeepSeek V3.2 | 131.000 |
¿Cuándo tiene sentido elegir open-source?
- Privacidad y despliegue on-prem, cuando enviar datos a OpenAI, Anthropic o Google no es una opción.
- Coste a escala, con millones de tokens diarios donde el precio marca la diferencia.
- Personalización mediante fine-tuning, LoRA o reentrenamiento completo.
- Independencia de proveedor, evitando el lock-in.
Los modelos propietarios siguen liderando en razonamiento extremo (Humanity’s Last Exam, CritPt), control de alucinaciones y multimodalidad nativa.
Conclusión
La distancia entre abierto y cerrado ha pasado de ser «otra liga» a ser «unos pocos puntos en un benchmark». GLM-5.1, MiniMax-M2.7, Qwen3.5 397B y DeepSeek V3.2 ofrecen hoy entre un 80% y un 90% de la calidad de los líderes de pago a un 5–20% de su coste. La pregunta ya no es si el open-source puede competir, sino qué modelo abierto encaja mejor con tu caso de uso.
Fuente de datos: Artificial Analysis Intelligence Index v4.0, consultado en abril de 2026.