El 8 de abril de 2026, Meta enterró siete años de historia open-source con el lanzamiento de Muse Spark, su primer modelo deliberadamente cerrado. once días después, el 19 de abril, Nvidia publicó los pesos de Nemotron 3 Ultra en Hugging Face — el modelo open-weight más grande jamás creado, con 550 mil millones de parámetros. En cuestión de semanas, el bando occidental del open-weight se partió en dos.
Mientras tanto, China no esperó. DeepSeek V4, Qwen 3.6 y GLM-5.2 siguen llegando mensualmente, cada vez más cerca de los líderes cerrados. El market share de los modelos open-weight pasó de 1% a 15% en doce meses, y el 89% de las empresas ya usa al menos un modelo open-source en producción.
En este análisis —con datos cerrados a Q2 2026— desglosamos: qué pasó con Meta, qué está construyendo Nvidia, quién lidera realmente el open-weight, y — lo más importante — cómo decidir qué modelos usar hoy.
🔑 El titular en una línea
Occidente ya no tiene un solo bando open-weight. Meta cerró. Nvidia abrió. China domina. Y el gap de rendimiento entre abierto y cerrado se redujo al 1.7% en benchmarks generales — aunque en razonamiento complejo la brecha sigue siendo de 15-25 puntos.
1. La Traición de Meta: De Llama 4 a Muse Spark
Si hay un evento que define el 2026 en el mundo open-weight, es la transformación de Meta. Durante años, Mark Zuckerberg fue el campeón del open-source — liberando cada modelo de Llama bajo licencia abierta, construyendo un ecosistema masivo de desarrolladores que hicieron de Llama 2 y Llama 3 el estándar de facto para auto-hosting.
Todo cambió con Llama 4.
📉 El Desastre de Llama 4
Lanzado en abril de 2025, Llama 4 Maverick obtuvo un puntaje de 18 en el Intelligence Index de Artificial Analysis. Para contexto: GPT-5.4 obtuvo 57. Modelos con la mitad de su presupuesto de entrenamiento lo superaron.
La comunidad que había impulsado Llama 2 y Llama 3 se volvió abiertamente hostil. Surgieron acusaciones de manipulación de benchmarks. Behemoth, la variante estrella de 2 billones de parámetros, se retrasó indefinidamente — convirtiéndose en vaporware. El gap entre Llama 4 (18) y Muse Spark (52) es más grande que el gap entre Muse Spark y el #1 del ranking.
Zuckerberg no iteró. Quemó todo y empezó de cero.
Zuckerberg firma un cheque de $14.300 millones
Compra el 49% de Scale AI. Nombra a Alexandr Wang (28 años, CEO de Scale) como Chief AI Officer de Meta — el movimiento más agresivo de contratación ejecutiva en la historia de la industria.
Nace Meta Superintelligence Labs (MSL)
Wang arma un equipo cazando talento de OpenAI, Anthropic y DeepMind con paquetes de compensación de $100M—$300M. El equipo construye desde cero: nueva arquitectura de preentrenamiento, nuevos pipelines de datos, nuevos sistemas de RL con "penalizaciones por tiempo de pensamiento" y "compresión de pensamiento".
Yann LeCun se va
El padrino del open-weight en Meta abandona la compañía, calificando al nuevo liderazgo de "inexperto". La salida de LeCun es el golpe simbólico final para el open-source en Meta.
🔴 Muse Spark: el primer Meta cerrado
MSL lanza Muse Spark 1.0. Puntaje: 52 en Intelligence Index. Es propietario. No hay pesos. No hay descarga. Solo API. El Llama era terminó.
Muse Spark 1.1 — sigue cerrado
Meta confirma que no habrá vuelta atrás. Todos los modelos futuros de MSL serán propietarios. El ecosistema Llama queda en soporte heredado, sin nuevos lanzamientos open-weight.
⚠️ ¿Y los modelos Llama existentes?
Los pesos de Llama 3.x y Llama 4 siguen disponibles para auto-hosting y fine-tuning. Pero no habrá Llama 5 open-weight. El ecosistema Llama está congelado: lo que ves hoy es lo que hay, y no volverá a actualizarse. Para empresas que construyeron su stack sobre Llama, el mensaje es claro: es hora de migrar o diversificar.
2. Nvidia: El Nuevo Campeón Open-Weight
Mientras Meta cerraba sus puertas, Nvidia abría las suyas de par en par. En marzo de 2026, la compañía reveló en un filing de la SEC un plan para invertir $26 mil millones en modelos open-weight en los próximos cinco años. Es la apuesta más grande en la historia del desarrollo de modelos de IA.
💰 $26B: La apuesta más grande de la historia
$26B
Más de lo que Meta gastó en Reality Labs en 2025. Aproximadamente equivalente a la valorización completa de Anthropic. Y coloca a Nvidia en competencia directa con sus propios clientes — OpenAI, Anthropic — que hasta ahora eran sus mayores compradores de GPUs.
El 19 de abril de 2026, días después de que Meta anunciara Muse Spark, Nvidia subió los pesos de Nemotron 3 Ultra a Hugging Face. Con 550 mil millones de parámetros totales (55B activos en arquitectura MoE híbrida Mamba-Transformer), es el modelo open-weight más grande e inteligente jamás liberado, según Artificial Analysis.
La Familia Nemotron 3 (Lanzamientos 2026)
| Modelo | Parámetros | Activos | Arquitectura | Uso ideal |
|---|---|---|---|---|
| Nemotron 3 Nano | 30B | 3B | Mamba-Transformer MoE | Sub-agentes, edge |
| Nemotron 3 Nano Omni | 30B | 3B | Híbrido multimodal | Video, audio, imagen, texto |
| Nemotron 3 Super | 120B | 12B | Mamba-Transformer MoE | Tareas complejas multi-agente |
| Nemotron 3 Ultra 🏆 | 550B | 55B | Mamba-Transformer MoE + Latent MoE | Agentes enterprise, razonamiento frontera |
Nemotron 3 Ultra usa innovaciones técnicas significativas: Latent MoE (una capa de routing latente que mejora la eficiencia en 4x), MTP Layers (capas de predicción multi-token), y entrenamiento en NVFP4 (formato de punto flotante de 4 bits de Nvidia). Corre en 16 GPUs H200 y ofrece 1M de contexto.
🔬 La jugada maestra de Nvidia
La estrategia de Nvidia es brillante: al liberar modelos open-weight de clase frontier, incentivan la adopción de su hardware. Cada desarrollador que fine-tunea Nemotron 3 Ultra necesita GPUs Nvidia. Es un caballo de Troya: open-weight como estrategia para vender más GPUs, justo cuando sus clientes (OpenAI, Anthropic) empiezan a diseñar sus propios chips.
Nvidia no está sola. Formó la Nemotron Coalition con Mistral AI, Cohere, y otros laboratorios occidentales para crear un ecosistema abierto que compita tanto con los cerrados (OpenAI, Anthropic, Google) como con los chinos (DeepSeek, Alibaba, Moonshot AI).
3. Los Chinos no Tienen Dilema: Open-Weight por Default
Mientras Occidente debate si abrir o cerrar, China ya decidió. DeepSeek, Alibaba (Qwen), Zhipu AI (GLM), Moonshot AI (Kimi) y MiniMax publican sistemáticamente todos sus modelos con pesos abiertos. No es filantropía — es estrategia geopolítica e industrial.
| Modelo | Lab | Tamaño | Costo Input (por M tokens) | Benchmark Clave |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | 236B MoE | $0.14 | SWE-bench: 80.6% |
| DeepSeek V4 Pro | DeepSeek | ~600B | $0.43 | SWE-bench: 80.6% |
| Qwen 3.5 (legado) | Alibaba | 235B MoE | $0.18 | Multilingual #1 |
| Qwen 3.6 | Alibaba | ~240B | $0.20 | Visión + lenguaje |
| Kimi K2.6 | Moonshot AI | ~200B MoE | $0.35 | Razonamiento largo contexto |
| GLM-5.2 | Zhipu AI | ~150B | $0.25 | Código + chino |
| MiniMax M3 | MiniMax | ~120B | $0.22 | Text-to-speech + video |
📊 El dato que lo cambia todo
DeepSeek V4 Flash cuesta $0.14 por millón de tokens de entrada. GPT-5.5 cuesta $3.00. La diferencia es de 21x. Y en benchmarks como MMLU, GSM8K y HumanEval, el rendimiento está dentro de 5 puntos porcentuales. Para tareas estándar, la pregunta "¿cerrado o abierto?" ya no es técnica — es económica.
El dominio chino tiene una excepción importante: los benchmarks de razonamiento complejo (ARC-AGI-2, FrontierMath, Humanity's Last Exam) siguen mostrando una brecha de 15-25 puntos a favor de GPT-5.5 y Claude 4.7 Opus. Para agentes autónomos, planificación multi-paso y razonamiento matemático profundo, los modelos cerrados occidentales siguen siendo superiores.
4. Mistral y Europa: El Tercer Polo
En medio del cisma Meta-Nvidia y el avance chino, Mistral AI emerge como el tercer polo del open-weight occidental. 23 de sus 32 modelos lanzados son open-weight (Apache 2.0). En julio de 2026, la compañía francesa lanzó acceso temprano a un nuevo modelo frontier open-weight, apuntando directamente al gap que dejó Meta.
🇪🇺 Europa apuesta por el open-weight
Mistral no solo libera pesos; también se unió a la Nemotron Coalition de Nvidia y está construyendo el ecosistema europeo de IA soberana. Su modelo más reciente compite directamente con Claude Haiku 4.5 y GPT-5.5 mini, completamente open-weight bajo licencia Apache 2.0.
5. El Panorama de Precios (Datos Q2 2026)
La decisión entre open-weight y cerrado ya no es técnica — es económica. Aquí están los precios reales de mercado (julio 2026):
| Modelo | Tipo | Input (por M tokens) | Output (por M tokens) | Costo relativo |
|---|---|---|---|---|
| GPT-5.6 Sol | Cerrado | $3.00 | $15.00 | 21x |
| GPT-5.6 Terra | Cerrado | $1.50 | $6.00 | 10x |
| GPT-5.6 Luna | Cerrado | $0.35 | $1.40 | 2.5x |
| GPT-5.5 (legado) | Cerrado | $3.00 | $15.00 | 21x |
| Claude 4.7 Opus | Cerrado | $3.00 | $15.00 | 21x |
| Gemini 3.1 Pro | Cerrado | $1.25 - $2.50 | $5.00 - $10.00 | 9-18x |
| GPT-5.5 mini | Cerrado | $0.15 | $0.60 | 1.1x |
| Claude Haiku 4.5 | Cerrado | $0.20 | $0.80 | 1.4x |
| DeepSeek V4 Flash | Open-weight | $0.14 | $0.28 (off-peak) | 1x |
| Qwen 3.6 | Open-weight | $0.18 | $0.36 | 1.3x |
| Nemotron 3 Ultra | Open-weight | ~$0.40 (auto-host) | ~$0.80 | ~3x (depende HW) |
| Muse Spark (Meta) | Cerrado | $2.50 | $10.00 | 18x |
6. Market Share: El Open-Weight Crece, Pero Sigue Siendo Nicho
Según datos de Presenc AI (mayo 2026), el market share de inferencia se distribuye así:
| Proveedor | Share ener 2025 | Share ener 2026 | Tendencia |
|---|---|---|---|
| OpenAI (GPT-4o, GPT-5, GPT-5.5) | ~45% | ~33% | ⬇ -12pp |
| Anthropic (Claude 3.5, 4.x) | ~14% | ~22% | ⬆ +8pp |
| Google (Gemini) | ~13% | ~17% | ⬆ +4pp |
| Total Open-Weight | ~1% | ~15% | ⬆ +14pp |
| DeepSeek (V3, V4) | ~0.5% | ~6% | 🚀 12x |
| Qwen (3, 3.5) | ~0.4% | ~5% | 🚀 12.5x |
| Llama (3.x, 4.x) | ~1% | ~3% | ⬆ 3x |
| Otros (xAI, Mistral, etc.) | ~26% | ~13% | ⬇ |
📈 89% de las empresas ya usa open-source en producción
La adopción enterprise pasó de 32% en 2024 a 89% en 2026. Pero ojo: la mayoría usa modelos open-weight junto con modelos cerrados, no como reemplazo. La estrategia dominante es híbrida: tareas estándar con open-weight (DeepSeek, Qwen), tareas complejas con cerrados (GPT-5.5, Claude 4.7).
7. ¿Qué Significa Esto Para Tu Empresa? (Guía de Decisión)
Con este panorama, la decisión ya no es binaria. Aquí te damos un framework práctico:
| Si tu caso de uso es... | Usa | Por qué |
|---|---|---|
| Chatbot de atención al cliente | DeepSeek V4 Flash | $0.14/M tokens. Calidad suficiente. Auto-hosteas y controlas datos. |
| Agente autónomo complejo (planificación multi-paso) | Claude 4.7 Opus o Nemotron 3 Ultra | Razonamiento profundo. Claude gana en precisión, Nemotron si necesitas auto-hosting. |
| Generación de código en producción | DeepSeek V4 Pro | 80.6% en SWE-bench. Mejor que GPT-5.5 en coding. Open-weight. |
| Análisis de documentos largos (+100K tokens) | Kimi K2.6 o GLM-5.2 | Contextos de 1M+ tokens a costo razonable. |
| Multimodal (video, audio, imágenes) | Nemotron 3 Nano Omni | 30B con visión+audio+texto nativo. Open-weight. |
| Fine-tuning propietario con datos sensibles | Cualquier open-weight | Control total de datos. El fine-tuning sigue siendo el mayor diferenciador. |
| Razonamiento matemático/investigación | GPT-5.5 o Claude 4.7 | Brecha de 15-25 puntos en FrontierMath, ARC-AGI-2. Aquí los cerrados siguen ganando. |
| Infraestructura soberana / cumplimiento regulatorio | Nemotron, DeepSeek, Mistral | Auto-hosting. Sin fuga de datos a APIs externas. Cumplimiento Ley 21.719. |
8. Lo Que Nadie Te Está Diciendo: El Verdadero Salto No Será un Modelo
OpenAI acaba de lanzar GPT-5.6 Sol, Terra y Luna el 9 de julio de 2026 — hace apenas 3 días. Sol marca un nuevo SOTA en Terminal-Bench 2.1 y Agents' Last Exam (53.6, superando por 13.1 puntos a Claude Fable 5). Pero aquí viene lo que realmente importa y que casi nadie está cubriendo.
Mientras Dario Amodei (CEO de Anthropic) declara en Davos que la AGI llegará en early 2027 y que para entonces tendremos "IA con capacidad de Nobel", en Wagner Solutions AI tenemos una lectura distinta. El consenso está empezando a virar, y por buenas razones.
🔥 GPT-5.6 Sol, Terra, Luna: Lo Que Llegó (y Lo Que No)
| Modelo | Rol | Lo Nuevo | Costo Relativo |
|---|---|---|---|
| Sol ☀️ | Flagship frontier | Ultra mode (multi-agente coordinado). SOTA en Terminal-Bench 2.1, Agents' Last Exam 53.6. Computer use mejorado. | Más caro, pero +eficiente por token |
| Terra 🌍 | Balanceado diario | Rendimiento de GPT-5.5 a 2x menor costo. Ideal para el 80% de tareas empresariales. | 2x más barato que GPT-5.5 |
| Luna 🌙 | Económico rápido | El más rápido y barato de la familia. Supera a Fable 5 a 1/16 del costo. | ~1/16 de Fable 5 |
🎯 El movimiento que pasó desapercibido
GPT-5.6 Sol introduce ultra mode: no es un modelo más grande, es un orquestador de sub-agentes que coordina múltiples workstreams en paralelo. OpenAI está apostando a que el próximo salto no viene de escalar parámetros — viene de escalar el harness (el sistema de orquestación alrededor del modelo). Y en eso, coincidimos totalmente.
🧠 Nuestra Tesis: Harness Scaling > Model Scaling
Hay un paper de mayo 2026 que debería estar en boca de todos: "From Model Scaling to System Scaling: Scaling the Harness in Agentic AI" (arXiv:2605.26112). Su tesis es simple pero profunda: el próximo bottleneck en IA agentica no va a ser tener modelos más inteligentes, sino diseñar mejores sistemas — lo que llaman scaling the harness.
El harness es la capa de orquestación alrededor del modelo: memoria persistente, enrutamiento de skills, gestión de contexto, loops de verificación, gobernanza. Y los datos son contundentes:
- Self-Harness (2026): Agentes que mejoran autónomamente su propio harness lograron 15-52% de mejora en Terminal-Bench 2.0, sin tocar los pesos del modelo.
- Lilian Weng (OpenAI, julio 2026): Publicó "Harness Engineering for Self-Improvement", un análisis exhaustivo de cómo el diseño del harness está superando al fine-tuning como palanca de mejora.
- CheetahClaws (arXiv): Un harness Python-native de referencia que compite con Claude Code y OpenClaw — todo open-source.
⚡ Nuestra posición (Wagner Solutions AI)
Llevamos meses construyendo sobre esta premisa en SHIVA y nuestros proyectos: el modelo importa, pero el harness importa más. Hemos visto mejoras de 3x-5x en rendimiento de agentes optimizando el harness — sin cambiar el modelo base. Mientras la industria corre tras el próximo GPT, nosotros estamos construyendo la capa que hace que cualquier modelo sea 10x más efectivo.
🚫 Dario Amodei Está Equivocado (Y te Explicamos Por Qué)
En enero 2026, en Davos, Amodei declaró que la AGI llegaría en early 2027 y que para entonces tendríamos "IA con capacidad de Nobel". En junio 2026 lo reafirmó: Anthropic es la única compañía que ha publicado timelines oficiales de SAI (Superinteligencia Artificial) para 2027.
Nosotros disentimos respetuosamente. Y no somos los únicos.
🔴 Por qué la SAI no llegará en 2027
1. El harness es el cuello de botella, no el modelo. Como demostró el paper de arXiv 2605.26112, la performance de los agentes emerge de la interacción modelo + harness. Mejorar solo el modelo sin escalar el sistema de orquestación produce rendimientos decrecientes. Estamos en la fase de system scaling, y eso toma años, no meses.
2. Los benchmarks de razonamiento complejo no se mueven. ARC-AGI-2, FrontierMath y Humanity's Last Exam siguen mostrando una brecha de 15-25 puntos entre modelos frontier y rendimiento superhumano consistente. No hay evidencia de que escalar parámetros por sí solo cierre esa brecha.
3. El propio GPT-5.6 Sol lo confirma. OpenAI tuvo que introducir ultra mode (orquestación multi-agente) para ganar rendimiento — no un modelo más grande. La mejora vino del sistema, no del escalamiento.
4. Demis Hassabis (DeepMind) lo dijo en Davos: frente a Amodei, Hassabis argumentó que faltan "ingredientes clave" como creatividad científica de alto nivel e interacción con el mundo físico que retrasarán la AGI más allá de 2027.
No estamos diciendo que la SAI no llegará. Estamos diciendo que llegará por una vía distinta: no por un modelo milagroso, sino por la integración sistemática de modelos cada vez más capaces con harnesses cada vez más sofisticados. Y ese proceso ya empezó — solo que no se llama "AGI", se llama "ingeniería de sistemas".
📅 Proyección Q3-Q4 2026
✅ GPT-5.6 Sol, Terra, Luna — en producción
OpenAI mueve la frontera cerrada con ultra mode (orquestación multi-agente) y precios más agresivos. Terra a 2x menos costo que GPT-5.5 presiona a todo el mercado.
Nemotron 3 Ultra v2 + respuesta de Mistral
Nvidia promete actualización del Ultra con mejor rendimiento en razonamiento. Mistral prepara su modelo frontier open-weight más grande — posiblemente el primero en superar a GPT-5.5 en benchstests estándar.
DeepSeek V5: el trueque del mercado
Si DeepSeek logra cerrar el gap de razonamiento complejo (ARC-AGI-2, FrontierMath), el modelo de negocio de los modelos cerrados se desploma. DeepSeek V4 Flash ya cuesta 1/21 de GPT-5.5.
¿Anthropic se resquebraja? Presión por abrir
Con Meta cerrando y Nvidia abriendo, Anthropic queda en una posición incómoda: es el único lab occidental sin estrategia open-weight. La presión de la Nemotron Coalition y los avances chinos podría forzarlos a liberar un modelo pequeño.
Maduración de harnesses open-source
CheetahClaws, OpenClaw y los harnesses modulares empiezan a cerrar el gap con Claude Code y Codex. El "voto de castigo" a los modelos cerrados se acelera cuando los harnesses open-weight alcanzan paridad en experiencia de desarrollo.
¿La SAI? No. ¿Agentes realmente útiles? Sí.
Nuestra predicción: para fin de año veremos agentes autónomos mucho más confiables, no porque los modelos sean SAI, sino porque los harnesses habrán madurado lo suficiente como para que los modelos actuales rindan al 100% de su potencial. La SAI no llegará en 2027 — pero los sistemas agenticos que parecen SAI, sí.
📡 Señal vs Ruido: Nuestro Radar para Q4 2026
Lo que vamos a estar mirando: (1) La evolución de ultra mode en GPT-5.6 — si otros labs copian la orquestación multi-agente como estándar. (2) Los harnesses open-source que alcancen paridad con los propietarios. (3) DeepSeek V5 y si finalmente cierra el gap de razonamiento. (4) El primer modelo de Mistral que supere a GPT-5.5 en benchmarks estándar. Cualquiera de estos eventos es más transformador que el próximo keynote de Amodei anunciando SAI.
Conclusión: Bienvenidos al Mercado Bipolar del Open-Weight
El Q3 2026 marca un punto de inflexión. El open-weight ya no es un movimiento unificado liderado por Meta. Se fragmentó en tres polos:
- 🇺🇸 Polo Nvidia-Nemotron: Open-weight occidental con respaldo de $26B y la Nemotron Coalition. Enfoque: agentes empresariales, razonamiento frontier, ecosistema de hardware.
- 🇨🇳 Polo Chino (DeepSeek-Qwen-GLM-Kimi): Open-weight por defecto. Enfoque: eficiencia de costos, rendimiento por dólar, ciclos de lanzamiento agresivos (semanas, no meses).
- 🇪🇺 Polo Europeo (Mistral): Open-weight soberano. Enfoque: cumplimiento regulatorio, transparencia, ecosistema Apache 2.0.
Y enfrente, los cerrados (OpenAI, Anthropic, Google, Meta/Muse Spark) mantienen su ventaja en razonamiento complejo — pero pierden market share cada mes.
🎯 El veredicto para empresas LATAM
Para la mayoría de las empresas en LATAM, la respuesta hoy es clara: estrategia híbrida con sesgo open-weight. Usa DeepSeek V4 Flash o Qwen 3.6 para el 80% de tus tareas (costo 21x menor que GPT-5.6 Sol). Para tareas que antes requerían GPT-5.5, hoy GPT-5.6 Terra ofrece el mismo rendimiento a la mitad de costo. Y si necesitas frontier cerrado, Sol con ultra mode es la herramienta correcta — pero solo para el 10% de los casos que realmente lo requieren.
Nuestra recomendación: construye tu stack con DeepSeek V4 + Qwen 3.6 + Nemotron 3 para el día a día. Reserva GPT-5.6 Sol y Claude 4.7 para razonamiento complejo. Y pon atención a los harnesses (CheetahClaws, OpenClaw) — ahí es donde se está moviendo la aguja más rápido que en cualquier modelo nuevo. Si solo sigues los lanzamientos de modelos, te vas a perder la verdadera revolución.
El open-weight no murió con Meta. Se mudó a China, encontró un nuevo hogar en Nvidia, y encontró un aliado en Europa. El cisma de Occidente fue, paradójicamente, la mejor noticia para la democratización de la IA.
🚀 ¿No sabes por dónde empezar?
En Wagner Solutions AI te ayudamos a diseñar tu estrategia híbrida de modelos: qué tareas delegar a open-weight, cuáles requieren closed-source, y cómo auto-hostear sin morir en el intento. Trabajamos con DeepSeek, Nemotron, Qwen, Mistral y los principales modelos cerrados.
Agenda una asesoría gratuita →