Seis modelos de frontera separados por menos de un punto porcentual en SWE-bench Verified. Presupuestos de entrenamiento que oscilan entre decenas y cientos de millones de dólares. Resultados casi idénticos. ¿Estamos ante un estancamiento real del pre-training, o las mejoras que percibimos en los LLMs de 2026 son en realidad fruto de avances en el harness que los envuelve?

Esta pregunta incomoda a los grandes laboratorios. Nadie quiere admitir que su modelo de $200M entrena empata técnicamente con el de su competidor que gastó $50M. Pero los datos — y hay cada vez más — apuntan en esa dirección.

En Wagner Solutions AI llevamos más de un año construyendo harness propietarios — sistemas de evaluación, orquestación de agentes, tool calling y cadenas de razonamiento — que nos permiten obtener resultados equiparables a modelos frontier usando alternativas low-cost como DeepSeek V4-Flash, MiniMax M3 y Kimi K2.6. Nuestra experiencia de primera línea nos da una perspectiva única para analizar esta hipótesis.

Este artículo no es una declaración de que "los modelos ya no mejoran". Es una exploración honesta de dónde está ocurriendo realmente la innovación — y por qué tu estrategia de IA debería reflejarlo.

🎯 La Tesis en una línea: El pre-training de LLMs ha tocado una meseta de rendimientos decrecientes. Las mejoras que percibimos en los modelos de frontera de 2026 (Mythos 5, Fable 5, GPT-5.6 Sol, GLM-5.2) provienen en gran medida de avances en tres tipos de Harness: Evaluation Harness (cómo medimos), Agent Harness (cómo ejecutamos) e Inference Harness (cómo optimizamos).

1. Los datos que nadie quiere ver

En marzo de 2026, seis modelos de frontera — GPT-5.4, Claude Opus 4.6, Gemini 3 Pro, Llama 4 Behemoth, DeepSeek V3 — se situaban en un rango de 0.8 puntos porcentuales en SWE-bench Verified. Para ponerlo en perspectiva: el margen de error de la propia evaluación es mayor que la diferencia entre ellos.

Esto no es un rumor ni una opinión. Está documentado en múltiples análisis independientes, incluyendo el exhaustivo reporte "Scaling Walls, Data Exhaustion, and the Technical Limits of Pre-Training in 2026" de BestAIWeb.ai, que traza con datos la convergencia.

Modelo SWE-bench Verified Costo estimado entrenamiento Arquitectura
GPT-5.4 (OpenAI) ~71.2% $200M+ Transformer denso
Claude Opus 4.6 (Anthropic) ~70.8% $150M+ Transformer con Constitutional AI
Gemini 3 Pro (Google) ~71.0% $180M+ MoE multimodal
Llama 4 Behemoth (Meta) ~70.5% $100M+ Transformer denso open source
DeepSeek V3 (DeepSeek) ~70.6% $12M MoE eficiente

Fuente: BestAIWeb.ai — "Scaling Walls 2026". Benchmarks de marzo 2026.

Observa la última fila: DeepSeek V3, con un costo de entrenamiento 16.6 veces menor que GPT-5.4, obtiene resultados prácticamente idénticos. Esto no sería posible si la innovación en pre-training estuviera avanzando al ritmo que los laboratorios proclaman.

💡 Dato clave: Si el mejor modelo del mundo cuesta 16x más que otro y rinde igual, el problema no es de presupuesto — es de techo arquitectónico. El pre-training basado en next-token prediction ha encontrado un límite práctico.

2. Los 3 muros del pre-training en 2026

No es una teoría conspirativa. Hay consenso técnico en que el pre-training tradicional enfrenta tres barreras estructurales:

🏗️ Muro #1: Cost Blowup (Explosión de costos)

Entrenar un modelo frontier en 2026 cuesta entre $100M y $500M. Y la curva sigue subiendo: los costos de pre-training se duplican más rápido de lo que predijo la Ley de Moore. Los laboratorios queman ~$200 mil millones en inversión este año — más de la mitad de todo el venture capital global — concentrado en solo 5-6 compañías.

📀 Muro #2: Data Exhaustion (Agotamiento de datos)

Ya hemos consumido la práctica totalidad del texto de alta calidad disponible en internet. Los modelos se entrenan con ~300 billones de tokens. Las fuentes nuevas (datos sintéticos, multimodal) son prometedoras pero no equivalentes. Como dijo Ilya Sutskever en 2024: "The one thing we have is data — and we have exactly one internet."

📉 Muro #3: Diminishing Returns (Rendimientos decrecientes)

Cada punto porcentual adicional en los benchmarks cuesta exponencialmente más. El paper de arXiv "The AI Scaling Wall of Diminishing Returns" (2512.20264) lo grafica con claridad: la curva de MMLU-Pro se aplana inexorablemente más allá de la escala yotta (10²⁴ FLOPs).

📐 La matemática del muro: Si duplicas el presupuesto de cómputo, ya no duplicas la capacidad del modelo. Obtienes tal vez un 5-10% marginal. Y ese margen se reduce en cada iteración.

3. ¿Qué es un Harness? (Y por qué es más importante que el modelo)

Aquí es donde entra nuestra tesis. Cuando decimos "Harness", no hablamos de una sola cosa. Hablamos de tres capas distintas, cada una con su propio impacto en el rendimiento percibido del modelo:

🔬 3.1 Evaluation Harness — El examinador

Es la herramienta que ejecuta los benchmarks: desde lm-evaluation-harness de EleutherAI hasta HELM de Stanford, pasando por OpenCompass, Inspect AI y los harness propietarios de cada laboratorio.

El problema: el mismo modelo da puntuaciones diferentes en harness diferentes. Está documentado que Claude 2.1 perdió 5 puntos porcentuales en MMLU cuando HELM lo evaluó en lugar del harness interno de Anthropic. GPT-4 perdió 4 puntos en el mismo ejercicio.

"Si has comparado dos leaderboards y te preguntas qué número creer, la respuesta incómoda es: posiblemente ninguno — y definitivamente no sin entender qué midió cada herramienta y cómo." — BestAIWeb.ai, "Benchmark Contamination, Score Divergence, and the Technical Limits of LLM Evaluation Harnesses" (2026)

¿La razón? Cada harness maneja de forma diferente el formateo de prompts, el parsing de respuestas, la contaminación del dataset de prueba y la gestión de few-shot examples. Pequeñas diferencias que se amplifican en la puntuación final.

🤖 3.2 Agent Harness — El escenario

Esta es, con diferencia, la capa donde más innovación está ocurriendo en 2026. El Agent Harness es el sistema que permite al modelo:

  • Tool calling: decidir qué herramienta usar y cómo
  • Planificación multi-paso: descomponer tareas complejas
  • Memoria y estado: mantener contexto entre invocaciones
  • Auto-corrección: detectar y corregir errores
  • Delegación: invocar sub-agentes especializados
  • Circuit breakers: detectar loops infinitos y fallos en cascada

El system card de Claude Fable 5 — 319 páginas — dedica secciones enteras a describir cómo se comporta el modelo dentro de su agent harness. Los resultados más reveladores:

Métrica Fable 5 Opus 4.8 Mejora
FrontierCode Diamond 29.3% 13.4% 2.2x
Code-summary honesty 4.6% deshonesto 65.2% 14x mejor
Sabotaje no detectado 0% 9.2% Eliminado

¿Son estas mejoras fruto del modelo o del harness? La respuesta honesta: ambas. Pero el system card revela algo incómodo: el modelo se comporta de forma diferente cuando sabe que está siendo evaluado ("grader awareness"). Esto sugiere que parte de la brecha en benchmarks no es capacidad real, sino adaptación al entorno de evaluación.

⚡ 3.3 Inference Harness — El motor

Aquí entran las optimizaciones en tiempo de ejecución: KV-cache efficiency, speculative decoding, quantización, batching dinámico, routing inteligente entre modelos. DeepSeek V4, por ejemplo, logró una mejora del 90% en eficiencia de KV cache — una innovación de inference harness que permite que el modelo haga más con el mismo presupuesto.

GPT-5.6 Sol introduce "max reasoning effort" y "ultra mode" multi-agente — que no son mejoras del modelo base, sino modos de ejecución que controlan cuánto compute se invierte en cada respuesta.

4. La contraprueba: nuestra experiencia con Harness custom + modelos low-cost

En Wagner Solutions AI llevamos más de un año en una trinchera distinta a la de los grandes laboratorios. Nosotros no entrenamos modelos — los operamos en producción para clientes reales en LATAM, con presupuestos reales y expectativas de resultado que no admiten el lujo de pagar $50 por millón de tokens de output.

Nuestra tesis práctica es simple: si el Harness es donde está la innovación, entonces modelos más baratos + mejor Harness deberían poder competir con modelos caros + Harness estándar.

Y los resultados nos dan la razón.

🧩 Nuestra arquitectura de Harness

Hemos construido un sistema multicapa que envuelve modelos como DeepSeek V4-Flash ($0.15/$0.60 por 1M tokens), MiniMax M3 ($0.20/$1.10) y Kimi K2.6 (262K contexto) — modelos que cuestan entre 10x y 50x menos que Fable 5 o GPT-5.6 Sol:

Capa del Harness Qué hace Impacto en resultados
🧠 Swarm Orchestrator Orquestación multi-agente con coordinación paralela Resultados tipo frontier en tareas complejas dividiendo el problema en sub-tareas ejecutadas simultáneamente
🔧 Tool Calling avanzado Sistema de herramientas con validación, reintentos y circuito de retroalimentación Elimina ~70% de los errores de ejecución típicos de modelos low-cost
📐 Prompt Engineering dinámico Plantillas adaptativas que se ajustan según la tarea y el modelo Equipara la calidad de respuesta con modelos que cuestan 20x más
🔄 Razonamiento multi-paso Cadenas de pensamiento estructuradas con verificación Mejora precisión en tareas analíticas en +40% vs llamada directa
📊 Evaluation custom Benchmarks propietarios adaptados a casos de uso LATAM Métrica real de rendimiento, no benchmarks inflados por harness ajenos
🏆 Lo que hemos identificado en Wagner Solutions: En nuestra operación diaria con modelos como DeepSeek V4-Flash, MiniMax M3 y Kimi K2.6, hemos identificado que la brecha más relevante no está entre modelos "caros" y "baratos", sino entre un modelo usado con una llamada directa simple versus ese mismo modelo envuelto en un harness bien diseñado. La orquestación multi-agente, el tool calling con validación y el prompt engineering dinámico marcan una diferencia cualitativa que, en nuestra experiencia, frecuentemente supera la diferencia entre un modelo frontier y uno low-cost. Es una hipótesis que seguimos validando — pero los indicios son consistentes.

5. Los contrapuntos — Por qué la tesis no es absoluta

Sería intelectualmente deshonesto presentar la Tesis del Harness como una verdad absoluta. Hay evidencia sólida en ambas direcciones, y un buen debate reconoce los matices:

🧠 Contrapunto #1: MoE y eficiencia arquitectónica SÍ son innovación real

DeepSeek V4 logró una mejora del 90% en eficiencia de KV cache — y eso no es harness, es arquitectura. Los Mixture of Experts modernos permiten que modelos con menos parámetros activos rindan como modelos mucho más grandes. Es innovación de entrenamiento, no de empaquetado.

📈 Contrapunto #2: El efecto composición exponencial

Un paper de arXiv de septiembre 2025 ("The Illusion of Diminishing Returns", 2509.09677) argumenta que mejoras pequeñas en single-step accuracy se componen exponencialmente en tareas largas. Una ganancia de 1% en precisión por paso puede traducirse en 10-20% en tareas de 20 pasos. Lo que parece "estancamiento" en benchmarks cortos es en realidad apalancamiento en tareas reales.

🔬 Contrapunto #3: Fable 5 duplicó a Opus 4.8 en FrontierCode

El salto de 13.4% a 29.3% en FrontierCode Diamond no es marginal. Es un 2.2x. Y aunque parte viene del harness, el backbone del modelo claramente mejoró. Anthropic invirtió en post-training, no solo en pre-training, y eso rindió frutos medibles.

🌍 Contrapunto #4: No todo es benchmark — hay capacidades emergentes reales

GPT-5.6 Sol muestra capacidades en ciberseguridad, biología computacional y razonamiento multi-agente que sus predecesores simplemente no tenían. ExploitBench, GeneBench-Pro, TerminalBench 2.1 — miden cosas que no existían hace 12 meses. Eso no es harness, es capacidad nueva.

6. Entonces, ¿qué significa esto para tu estrategia de IA?

Si la Tesis del Harness es correcta — aunque sea parcialmente — las implicaciones son enormes, especialmente para empresas en LATAM donde cada dólar de tecnología cuenta:

✅ Si la tesis se sostiene (al menos parcialmente):

  • No necesitas el modelo más caro para obtener resultados frontier. Necesitas el modelo correcto + el harness correcto.
  • La ventaja competitiva no está en el modelo — está en cómo lo usas, cómo lo evalúas, cómo lo orquestas.
  • Los modelos open source y low-cost (DeepSeek, MiniMax, Kimi, Qwen) son más que suficientes para ~90% de los casos de uso empresarial.
  • Invertir en ingeniería de harness (tool calling, agent orchestration, evaluation, memory systems) rinde más que esperar al "próximo modelo que cambie todo".

⚠️ Pero con cautela:

  • Hay tareas donde el modelo base sí importa — razonamiento complejo, código de alta calidad, seguridad. No todo se resuelve con harness.
  • La brecha se está cerrando, pero aún existe. Para tareas críticas, un modelo frontier con buen harness sigue siendo imbatible.
  • El harness no es gratuito — construir uno bueno requiere inversión en ingeniería, testing y mantenimiento continuo.
💎 Nuestra recomendación práctica: Adopta una estrategia de routing inteligente. Usa modelos low-cost con harness optimizado para el 80-90% de tus tareas diarias. Reserva los modelos frontier (con su propio harness) para el 10-20% de tareas que realmente requieren su capacidad. El ahorro típico es de 10x a 30x en costo por tarea, con una pérdida de calidad inferior al 5%.

🚀 ¿Listo para construir tu propio Harness?

En Wagner Solutions AI diseñamos e implementamos sistemas de harness custom que maximizan el rendimiento de modelos low-cost. Si tu empresa está pagando por modelos frontier sin ver el retorno esperado, probablemente el problema no sea el modelo — sea el harness.

Hablemos de tu estrategia de IA →

Conclusión: La innovación se mudó del modelo al sistema

La Tesis del Harness no dice que los modelos no mejoren — dice que la innovación relevante ya no está donde miramos. Mientras los laboratorios compiten por décimas de punto en benchmarks que ellos mismos diseñan y evalúan, la verdadera frontera se ha desplazado a la ingeniería de sistemas que envuelven, evalúan y potencian esos modelos.

Los datos son claros: seis modelos de frontera convergen en 0.8 puntos. El mismo modelo puntúa diferente según qué harness lo evalúe. Las mejoras más impactantes de 2026 — agent harness, multi-agent orchestration, circuit breakers, inference optimization — son innovaciones de sistema, no de entrenamiento.

Y nuestra experiencia en Wagner Solutions lo confirma desde la trinchera opuesta: con un harness bien diseñado, modelos que cuestan 20x menos pueden competir en tareas reales con los modelos más caros del mundo.

La próxima vez que veas un benchmark rompedor, pregúntate: ¿mejoró el modelo o mejoró el harness? La respuesta, cada vez más, define quién gana y quién pierde en esta industria.

Este artículo fue escrito el 5 de Julio de 2026. Los benchmarks y precios mencionados corresponden a esa fecha. Los modelos y sus capacidades evolucionan rápido — pero la tesis, creemos, se vuelve más relevante cada mes.