📊 Análisis de Mercado · Q2 2026 en Retrospectiva

El Cisma de Occidente: Meta Cierra, Nvidia Apuesta $26B y China Domina el Open-Weight

12 julio, 2026 12 min de lectura Wagner Solutions AI

El 8 de abril de 2026, Meta enterró siete años de historia open-source con el lanzamiento de Muse Spark, su primer modelo deliberadamente cerrado. once días después, el 19 de abril, Nvidia publicó los pesos de Nemotron 3 Ultra en Hugging Face — el modelo open-weight más grande jamás creado, con 550 mil millones de parámetros. En cuestión de semanas, el bando occidental del open-weight se partió en dos.

Mientras tanto, China no esperó. DeepSeek V4, Qwen 3.6 y GLM-5.2 siguen llegando mensualmente, cada vez más cerca de los líderes cerrados. El market share de los modelos open-weight pasó de 1% a 15% en doce meses, y el 89% de las empresas ya usa al menos un modelo open-source en producción.

En este análisis —con datos cerrados a Q2 2026— desglosamos: qué pasó con Meta, qué está construyendo Nvidia, quién lidera realmente el open-weight, y — lo más importante — cómo decidir qué modelos usar hoy.

🔑 El titular en una línea

Occidente ya no tiene un solo bando open-weight. Meta cerró. Nvidia abrió. China domina. Y el gap de rendimiento entre abierto y cerrado se redujo al 1.7% en benchmarks generales — aunque en razonamiento complejo la brecha sigue siendo de 15-25 puntos.

1. La Traición de Meta: De Llama 4 a Muse Spark

Si hay un evento que define el 2026 en el mundo open-weight, es la transformación de Meta. Durante años, Mark Zuckerberg fue el campeón del open-source — liberando cada modelo de Llama bajo licencia abierta, construyendo un ecosistema masivo de desarrolladores que hicieron de Llama 2 y Llama 3 el estándar de facto para auto-hosting.

Todo cambió con Llama 4.

📉 El Desastre de Llama 4

Lanzado en abril de 2025, Llama 4 Maverick obtuvo un puntaje de 18 en el Intelligence Index de Artificial Analysis. Para contexto: GPT-5.4 obtuvo 57. Modelos con la mitad de su presupuesto de entrenamiento lo superaron.

La comunidad que había impulsado Llama 2 y Llama 3 se volvió abiertamente hostil. Surgieron acusaciones de manipulación de benchmarks. Behemoth, la variante estrella de 2 billones de parámetros, se retrasó indefinidamente — convirtiéndose en vaporware. El gap entre Llama 4 (18) y Muse Spark (52) es más grande que el gap entre Muse Spark y el #1 del ranking.

Zuckerberg no iteró. Quemó todo y empezó de cero.

Junio 2025

Zuckerberg firma un cheque de $14.300 millones

Compra el 49% de Scale AI. Nombra a Alexandr Wang (28 años, CEO de Scale) como Chief AI Officer de Meta — el movimiento más agresivo de contratación ejecutiva en la historia de la industria.

Mediados 2025

Nace Meta Superintelligence Labs (MSL)

Wang arma un equipo cazando talento de OpenAI, Anthropic y DeepMind con paquetes de compensación de $100M—$300M. El equipo construye desde cero: nueva arquitectura de preentrenamiento, nuevos pipelines de datos, nuevos sistemas de RL con "penalizaciones por tiempo de pensamiento" y "compresión de pensamiento".

Inicios 2026

Yann LeCun se va

El padrino del open-weight en Meta abandona la compañía, calificando al nuevo liderazgo de "inexperto". La salida de LeCun es el golpe simbólico final para el open-source en Meta.

8 Abril 2026

🔴 Muse Spark: el primer Meta cerrado

MSL lanza Muse Spark 1.0. Puntaje: 52 en Intelligence Index. Es propietario. No hay pesos. No hay descarga. Solo API. El Llama era terminó.

Julio 2026

Muse Spark 1.1 — sigue cerrado

Meta confirma que no habrá vuelta atrás. Todos los modelos futuros de MSL serán propietarios. El ecosistema Llama queda en soporte heredado, sin nuevos lanzamientos open-weight.

⚠️ ¿Y los modelos Llama existentes?

Los pesos de Llama 3.x y Llama 4 siguen disponibles para auto-hosting y fine-tuning. Pero no habrá Llama 5 open-weight. El ecosistema Llama está congelado: lo que ves hoy es lo que hay, y no volverá a actualizarse. Para empresas que construyeron su stack sobre Llama, el mensaje es claro: es hora de migrar o diversificar.

2. Nvidia: El Nuevo Campeón Open-Weight

Mientras Meta cerraba sus puertas, Nvidia abría las suyas de par en par. En marzo de 2026, la compañía reveló en un filing de la SEC un plan para invertir $26 mil millones en modelos open-weight en los próximos cinco años. Es la apuesta más grande en la historia del desarrollo de modelos de IA.

💰 $26B: La apuesta más grande de la historia

$26B

Más de lo que Meta gastó en Reality Labs en 2025. Aproximadamente equivalente a la valorización completa de Anthropic. Y coloca a Nvidia en competencia directa con sus propios clientes — OpenAI, Anthropic — que hasta ahora eran sus mayores compradores de GPUs.

El 19 de abril de 2026, días después de que Meta anunciara Muse Spark, Nvidia subió los pesos de Nemotron 3 Ultra a Hugging Face. Con 550 mil millones de parámetros totales (55B activos en arquitectura MoE híbrida Mamba-Transformer), es el modelo open-weight más grande e inteligente jamás liberado, según Artificial Analysis.

La Familia Nemotron 3 (Lanzamientos 2026)

Modelo Parámetros Activos Arquitectura Uso ideal
Nemotron 3 Nano 30B 3B Mamba-Transformer MoE Sub-agentes, edge
Nemotron 3 Nano Omni 30B 3B Híbrido multimodal Video, audio, imagen, texto
Nemotron 3 Super 120B 12B Mamba-Transformer MoE Tareas complejas multi-agente
Nemotron 3 Ultra 🏆 550B 55B Mamba-Transformer MoE + Latent MoE Agentes enterprise, razonamiento frontera

Nemotron 3 Ultra usa innovaciones técnicas significativas: Latent MoE (una capa de routing latente que mejora la eficiencia en 4x), MTP Layers (capas de predicción multi-token), y entrenamiento en NVFP4 (formato de punto flotante de 4 bits de Nvidia). Corre en 16 GPUs H200 y ofrece 1M de contexto.

🔬 La jugada maestra de Nvidia

La estrategia de Nvidia es brillante: al liberar modelos open-weight de clase frontier, incentivan la adopción de su hardware. Cada desarrollador que fine-tunea Nemotron 3 Ultra necesita GPUs Nvidia. Es un caballo de Troya: open-weight como estrategia para vender más GPUs, justo cuando sus clientes (OpenAI, Anthropic) empiezan a diseñar sus propios chips.

Nvidia no está sola. Formó la Nemotron Coalition con Mistral AI, Cohere, y otros laboratorios occidentales para crear un ecosistema abierto que compita tanto con los cerrados (OpenAI, Anthropic, Google) como con los chinos (DeepSeek, Alibaba, Moonshot AI).

3. Los Chinos no Tienen Dilema: Open-Weight por Default

Mientras Occidente debate si abrir o cerrar, China ya decidió. DeepSeek, Alibaba (Qwen), Zhipu AI (GLM), Moonshot AI (Kimi) y MiniMax publican sistemáticamente todos sus modelos con pesos abiertos. No es filantropía — es estrategia geopolítica e industrial.

Modelo Lab Tamaño Costo Input (por M tokens) Benchmark Clave
DeepSeek V4 Flash DeepSeek 236B MoE $0.14 SWE-bench: 80.6%
DeepSeek V4 Pro DeepSeek ~600B $0.43 SWE-bench: 80.6%
Qwen 3.5 (legado) Alibaba 235B MoE $0.18 Multilingual #1
Qwen 3.6 Alibaba ~240B $0.20 Visión + lenguaje
Kimi K2.6 Moonshot AI ~200B MoE $0.35 Razonamiento largo contexto
GLM-5.2 Zhipu AI ~150B $0.25 Código + chino
MiniMax M3 MiniMax ~120B $0.22 Text-to-speech + video

📊 El dato que lo cambia todo

DeepSeek V4 Flash cuesta $0.14 por millón de tokens de entrada. GPT-5.5 cuesta $3.00. La diferencia es de 21x. Y en benchmarks como MMLU, GSM8K y HumanEval, el rendimiento está dentro de 5 puntos porcentuales. Para tareas estándar, la pregunta "¿cerrado o abierto?" ya no es técnica — es económica.

El dominio chino tiene una excepción importante: los benchmarks de razonamiento complejo (ARC-AGI-2, FrontierMath, Humanity's Last Exam) siguen mostrando una brecha de 15-25 puntos a favor de GPT-5.5 y Claude 4.7 Opus. Para agentes autónomos, planificación multi-paso y razonamiento matemático profundo, los modelos cerrados occidentales siguen siendo superiores.

4. Mistral y Europa: El Tercer Polo

En medio del cisma Meta-Nvidia y el avance chino, Mistral AI emerge como el tercer polo del open-weight occidental. 23 de sus 32 modelos lanzados son open-weight (Apache 2.0). En julio de 2026, la compañía francesa lanzó acceso temprano a un nuevo modelo frontier open-weight, apuntando directamente al gap que dejó Meta.

🇪🇺 Europa apuesta por el open-weight

Mistral no solo libera pesos; también se unió a la Nemotron Coalition de Nvidia y está construyendo el ecosistema europeo de IA soberana. Su modelo más reciente compite directamente con Claude Haiku 4.5 y GPT-5.5 mini, completamente open-weight bajo licencia Apache 2.0.

5. El Panorama de Precios (Datos Q2 2026)

La decisión entre open-weight y cerrado ya no es técnica — es económica. Aquí están los precios reales de mercado (julio 2026):

Modelo Tipo Input (por M tokens) Output (por M tokens) Costo relativo
GPT-5.6 Sol Cerrado $3.00 $15.00 21x
GPT-5.6 Terra Cerrado $1.50 $6.00 10x
GPT-5.6 Luna Cerrado $0.35 $1.40 2.5x
GPT-5.5 (legado) Cerrado $3.00 $15.00 21x
Claude 4.7 Opus Cerrado $3.00 $15.00 21x
Gemini 3.1 Pro Cerrado $1.25 - $2.50 $5.00 - $10.00 9-18x
GPT-5.5 mini Cerrado $0.15 $0.60 1.1x
Claude Haiku 4.5 Cerrado $0.20 $0.80 1.4x
DeepSeek V4 Flash Open-weight $0.14 $0.28 (off-peak) 1x
Qwen 3.6 Open-weight $0.18 $0.36 1.3x
Nemotron 3 Ultra Open-weight ~$0.40 (auto-host) ~$0.80 ~3x (depende HW)
Muse Spark (Meta) Cerrado $2.50 $10.00 18x

6. Market Share: El Open-Weight Crece, Pero Sigue Siendo Nicho

Según datos de Presenc AI (mayo 2026), el market share de inferencia se distribuye así:

Proveedor Share ener 2025 Share ener 2026 Tendencia
OpenAI (GPT-4o, GPT-5, GPT-5.5) ~45% ~33% ⬇ -12pp
Anthropic (Claude 3.5, 4.x) ~14% ~22% ⬆ +8pp
Google (Gemini) ~13% ~17% ⬆ +4pp
Total Open-Weight ~1% ~15% ⬆ +14pp
DeepSeek (V3, V4) ~0.5% ~6% 🚀 12x
Qwen (3, 3.5) ~0.4% ~5% 🚀 12.5x
Llama (3.x, 4.x) ~1% ~3% ⬆ 3x
Otros (xAI, Mistral, etc.) ~26% ~13%

📈 89% de las empresas ya usa open-source en producción

La adopción enterprise pasó de 32% en 2024 a 89% en 2026. Pero ojo: la mayoría usa modelos open-weight junto con modelos cerrados, no como reemplazo. La estrategia dominante es híbrida: tareas estándar con open-weight (DeepSeek, Qwen), tareas complejas con cerrados (GPT-5.5, Claude 4.7).

7. ¿Qué Significa Esto Para Tu Empresa? (Guía de Decisión)

Con este panorama, la decisión ya no es binaria. Aquí te damos un framework práctico:

Si tu caso de uso es... Usa Por qué
Chatbot de atención al cliente DeepSeek V4 Flash $0.14/M tokens. Calidad suficiente. Auto-hosteas y controlas datos.
Agente autónomo complejo (planificación multi-paso) Claude 4.7 Opus o Nemotron 3 Ultra Razonamiento profundo. Claude gana en precisión, Nemotron si necesitas auto-hosting.
Generación de código en producción DeepSeek V4 Pro 80.6% en SWE-bench. Mejor que GPT-5.5 en coding. Open-weight.
Análisis de documentos largos (+100K tokens) Kimi K2.6 o GLM-5.2 Contextos de 1M+ tokens a costo razonable.
Multimodal (video, audio, imágenes) Nemotron 3 Nano Omni 30B con visión+audio+texto nativo. Open-weight.
Fine-tuning propietario con datos sensibles Cualquier open-weight Control total de datos. El fine-tuning sigue siendo el mayor diferenciador.
Razonamiento matemático/investigación GPT-5.5 o Claude 4.7 Brecha de 15-25 puntos en FrontierMath, ARC-AGI-2. Aquí los cerrados siguen ganando.
Infraestructura soberana / cumplimiento regulatorio Nemotron, DeepSeek, Mistral Auto-hosting. Sin fuga de datos a APIs externas. Cumplimiento Ley 21.719.

8. Lo Que Nadie Te Está Diciendo: El Verdadero Salto No Será un Modelo

OpenAI acaba de lanzar GPT-5.6 Sol, Terra y Luna el 9 de julio de 2026 — hace apenas 3 días. Sol marca un nuevo SOTA en Terminal-Bench 2.1 y Agents' Last Exam (53.6, superando por 13.1 puntos a Claude Fable 5). Pero aquí viene lo que realmente importa y que casi nadie está cubriendo.

Mientras Dario Amodei (CEO de Anthropic) declara en Davos que la AGI llegará en early 2027 y que para entonces tendremos "IA con capacidad de Nobel", en Wagner Solutions AI tenemos una lectura distinta. El consenso está empezando a virar, y por buenas razones.

🔥 GPT-5.6 Sol, Terra, Luna: Lo Que Llegó (y Lo Que No)

Modelo Rol Lo Nuevo Costo Relativo
Sol ☀️ Flagship frontier Ultra mode (multi-agente coordinado). SOTA en Terminal-Bench 2.1, Agents' Last Exam 53.6. Computer use mejorado. Más caro, pero +eficiente por token
Terra 🌍 Balanceado diario Rendimiento de GPT-5.5 a 2x menor costo. Ideal para el 80% de tareas empresariales. 2x más barato que GPT-5.5
Luna 🌙 Económico rápido El más rápido y barato de la familia. Supera a Fable 5 a 1/16 del costo. ~1/16 de Fable 5

🎯 El movimiento que pasó desapercibido

GPT-5.6 Sol introduce ultra mode: no es un modelo más grande, es un orquestador de sub-agentes que coordina múltiples workstreams en paralelo. OpenAI está apostando a que el próximo salto no viene de escalar parámetros — viene de escalar el harness (el sistema de orquestación alrededor del modelo). Y en eso, coincidimos totalmente.

🧠 Nuestra Tesis: Harness Scaling > Model Scaling

Hay un paper de mayo 2026 que debería estar en boca de todos: "From Model Scaling to System Scaling: Scaling the Harness in Agentic AI" (arXiv:2605.26112). Su tesis es simple pero profunda: el próximo bottleneck en IA agentica no va a ser tener modelos más inteligentes, sino diseñar mejores sistemas — lo que llaman scaling the harness.

El harness es la capa de orquestación alrededor del modelo: memoria persistente, enrutamiento de skills, gestión de contexto, loops de verificación, gobernanza. Y los datos son contundentes:

⚡ Nuestra posición (Wagner Solutions AI)

Llevamos meses construyendo sobre esta premisa en SHIVA y nuestros proyectos: el modelo importa, pero el harness importa más. Hemos visto mejoras de 3x-5x en rendimiento de agentes optimizando el harness — sin cambiar el modelo base. Mientras la industria corre tras el próximo GPT, nosotros estamos construyendo la capa que hace que cualquier modelo sea 10x más efectivo.

🚫 Dario Amodei Está Equivocado (Y te Explicamos Por Qué)

En enero 2026, en Davos, Amodei declaró que la AGI llegaría en early 2027 y que para entonces tendríamos "IA con capacidad de Nobel". En junio 2026 lo reafirmó: Anthropic es la única compañía que ha publicado timelines oficiales de SAI (Superinteligencia Artificial) para 2027.

Nosotros disentimos respetuosamente. Y no somos los únicos.

🔴 Por qué la SAI no llegará en 2027

1. El harness es el cuello de botella, no el modelo. Como demostró el paper de arXiv 2605.26112, la performance de los agentes emerge de la interacción modelo + harness. Mejorar solo el modelo sin escalar el sistema de orquestación produce rendimientos decrecientes. Estamos en la fase de system scaling, y eso toma años, no meses.

2. Los benchmarks de razonamiento complejo no se mueven. ARC-AGI-2, FrontierMath y Humanity's Last Exam siguen mostrando una brecha de 15-25 puntos entre modelos frontier y rendimiento superhumano consistente. No hay evidencia de que escalar parámetros por sí solo cierre esa brecha.

3. El propio GPT-5.6 Sol lo confirma. OpenAI tuvo que introducir ultra mode (orquestación multi-agente) para ganar rendimiento — no un modelo más grande. La mejora vino del sistema, no del escalamiento.

4. Demis Hassabis (DeepMind) lo dijo en Davos: frente a Amodei, Hassabis argumentó que faltan "ingredientes clave" como creatividad científica de alto nivel e interacción con el mundo físico que retrasarán la AGI más allá de 2027.

No estamos diciendo que la SAI no llegará. Estamos diciendo que llegará por una vía distinta: no por un modelo milagroso, sino por la integración sistemática de modelos cada vez más capaces con harnesses cada vez más sofisticados. Y ese proceso ya empezó — solo que no se llama "AGI", se llama "ingeniería de sistemas".

📅 Proyección Q3-Q4 2026

Julio 2026

✅ GPT-5.6 Sol, Terra, Luna — en producción

OpenAI mueve la frontera cerrada con ultra mode (orquestación multi-agente) y precios más agresivos. Terra a 2x menos costo que GPT-5.5 presiona a todo el mercado.

Agosto 2026

Nemotron 3 Ultra v2 + respuesta de Mistral

Nvidia promete actualización del Ultra con mejor rendimiento en razonamiento. Mistral prepara su modelo frontier open-weight más grande — posiblemente el primero en superar a GPT-5.5 en benchstests estándar.

Septiembre 2026

DeepSeek V5: el trueque del mercado

Si DeepSeek logra cerrar el gap de razonamiento complejo (ARC-AGI-2, FrontierMath), el modelo de negocio de los modelos cerrados se desploma. DeepSeek V4 Flash ya cuesta 1/21 de GPT-5.5.

Octubre 2026

¿Anthropic se resquebraja? Presión por abrir

Con Meta cerrando y Nvidia abriendo, Anthropic queda en una posición incómoda: es el único lab occidental sin estrategia open-weight. La presión de la Nemotron Coalition y los avances chinos podría forzarlos a liberar un modelo pequeño.

Noviembre 2026

Maduración de harnesses open-source

CheetahClaws, OpenClaw y los harnesses modulares empiezan a cerrar el gap con Claude Code y Codex. El "voto de castigo" a los modelos cerrados se acelera cuando los harnesses open-weight alcanzan paridad en experiencia de desarrollo.

Diciembre 2026 / Q1 2027

¿La SAI? No. ¿Agentes realmente útiles? Sí.

Nuestra predicción: para fin de año veremos agentes autónomos mucho más confiables, no porque los modelos sean SAI, sino porque los harnesses habrán madurado lo suficiente como para que los modelos actuales rindan al 100% de su potencial. La SAI no llegará en 2027 — pero los sistemas agenticos que parecen SAI, sí.

📡 Señal vs Ruido: Nuestro Radar para Q4 2026

Lo que vamos a estar mirando: (1) La evolución de ultra mode en GPT-5.6 — si otros labs copian la orquestación multi-agente como estándar. (2) Los harnesses open-source que alcancen paridad con los propietarios. (3) DeepSeek V5 y si finalmente cierra el gap de razonamiento. (4) El primer modelo de Mistral que supere a GPT-5.5 en benchmarks estándar. Cualquiera de estos eventos es más transformador que el próximo keynote de Amodei anunciando SAI.

Conclusión: Bienvenidos al Mercado Bipolar del Open-Weight

El Q3 2026 marca un punto de inflexión. El open-weight ya no es un movimiento unificado liderado por Meta. Se fragmentó en tres polos:

Y enfrente, los cerrados (OpenAI, Anthropic, Google, Meta/Muse Spark) mantienen su ventaja en razonamiento complejo — pero pierden market share cada mes.

🎯 El veredicto para empresas LATAM

Para la mayoría de las empresas en LATAM, la respuesta hoy es clara: estrategia híbrida con sesgo open-weight. Usa DeepSeek V4 Flash o Qwen 3.6 para el 80% de tus tareas (costo 21x menor que GPT-5.6 Sol). Para tareas que antes requerían GPT-5.5, hoy GPT-5.6 Terra ofrece el mismo rendimiento a la mitad de costo. Y si necesitas frontier cerrado, Sol con ultra mode es la herramienta correcta — pero solo para el 10% de los casos que realmente lo requieren.

Nuestra recomendación: construye tu stack con DeepSeek V4 + Qwen 3.6 + Nemotron 3 para el día a día. Reserva GPT-5.6 Sol y Claude 4.7 para razonamiento complejo. Y pon atención a los harnesses (CheetahClaws, OpenClaw) — ahí es donde se está moviendo la aguja más rápido que en cualquier modelo nuevo. Si solo sigues los lanzamientos de modelos, te vas a perder la verdadera revolución.

El open-weight no murió con Meta. Se mudó a China, encontró un nuevo hogar en Nvidia, y encontró un aliado en Europa. El cisma de Occidente fue, paradójicamente, la mejor noticia para la democratización de la IA.

🚀 ¿No sabes por dónde empezar?

En Wagner Solutions AI te ayudamos a diseñar tu estrategia híbrida de modelos: qué tareas delegar a open-weight, cuáles requieren closed-source, y cómo auto-hostear sin morir en el intento. Trabajamos con DeepSeek, Nemotron, Qwen, Mistral y los principales modelos cerrados.

Agenda una asesoría gratuita →