TIC's en la Web

Qwen3.8-Max promete programar 16 días solo: lo que no te cuentan sobre los pesos abiertos

# Qwen3.8-Max promete programar 16 días solo: lo que no te cuentan sobre los pesos abiertos

**Categoría:** Inteligencia Artificial
**Estilo:** crítico
**Fecha:** 2026-08-04

Alibaba ha presentado Qwen3.8-Max y en menos de 24 horas ya lo tienes en todos los titulares: 2,4 billones de parámetros, 16 días programando sin parar, supera a Claude y ChatGPT, y además será open source la semana que viene. Suena a revolución. Lo que me suena a mí es al mismo guion de julio, pero con otra cifra más grande y otro benchmark elegido a dedo.

He leído el comunicado de Alibaba, la tabla de benchmarks que publicaron el 3 de agosto y lo que están comentando en foros técnicos en inglés — donde suelen ir un paso por delante de los medios en español. La conclusión no es que el modelo sea una chapuza. Es que estamos otra vez confundiendo pesos abiertos con IA usable para una pyme, y demos espectaculares con ingeniería de software real.

Dieciséis días solo: una demo, no tu backlog de tickets

El ejemplo estrella es oh-my-cli: Qwen3.8-Max supuestamente trabajó 16 días seguidos, hizo 265 cambios de código y cerró 151 incidencias sin intervención humana. Impresionante como historia. Pero fíjate en lo que no te dicen en el titular: es un proyecto acotado, con un bucle de generación-prueba-preview que Alibaba controla de punta a punta. No es mantener el WordPress de un cliente con plugins legacy, ni depurar un checkout de WooCommerce que falla solo en Safari con cierta pasarela de pago.

En mi experiencia, cuando un proveedor enseña una demo de agente autónomo, siempre hay tres capas de truco: entorno controlado, métricas internas y cero responsabilidad legal si el código que suelta rompe producción. Qwen3.8-Max puede ser buenísimo en tareas largas dentro de su sandbox. Eso no significa que mañana puedas soltarlo sobre el repositorio de una tienda online y irte de vacaciones.

La tabla de benchmarks: ganas en una fila, pierdes en otra

Aquí es donde se nota el marketing. Alibaba publicó una tabla completa — cosa que agradezco, aunque sea autopromocional — y los números cuentan dos historias distintas según qué columna mires.

En Terminal Bench 2.1 saca 86,6, por delante de Claude Fable 5 (84,6) y por debajo de GPT-5.6 Sol (88,8). Perfecto para titular que «supera a Claude». Pero en SWE-bench Pro, el benchmark más duro de ingeniería de software real, Qwen3.8-Max se queda en 67,7 frente a los 80,0 de Fable 5. Doce puntos de diferencia. En FrontierSWE la brecha es similar. Es decir: ganas en la prueba que conviene para la rueda de prensa y pierdes en la que importa si quieres que el modelo toque código de producción serio.

Como señala el análisis de Apidog sobre esos benchmarks, ambas afirmaciones son ciertas a la vez. Solo que la segunda aparece en muchos menos titulares en español. Y hasta el 3 de agosto no había evaluaciones independientes: todo eran cifras del propio fabricante. Eso no es mentira pero tampoco es evidencia reproducible.

«Open source» con 2,4 billones de parámetros: ¿para quién?

El movimiento estratégico más interesante — y el más engañoso para una pyme — es abrir los pesos la semana que viene en Hugging Face y ModelScope. Suena a democratización. Suena a «adiós a las APIs caras».

Pero un modelo MoE de 2,4 billones de parámetros totales, aunque active «solo» 95 mil millones por consulta según The Decoder, no es un checkpoint que montes en el VPS de 40 euros al mes donde tienes tres WordPress y un PrestaShop. Es infraestructura de datacenter. MarkTechPost lo dice sin rodeos: a esa escala, el checkpoint es un artefacto multi-nodo; el coste de servirlo ni siquiera se puede modelar todavía porque Alibaba no ha publicado todos los detalles operativos.

Lo que sí puede ser realista para empresas medianas es Qwen3.8-27B, la variante pequeña que también prometen abrir. Ahí sí hablamos de algo que un equipo técnico podría probar on-premise o en un cloud serio. Pero ojo: el titular dice «Qwen3.8-Max open source», y lo que muchos desarrolladores podrán usar de verdad es otra cosa.

Tampoco conocemos aún la licencia exacta. Hasta que no sea Apache 2.0 o equivalente, «open weights» puede significar «puedes mirar, pero no integrar en productos propios sin condiciones». Hemos visto esta película con otros modelos chinos: abierto con asteriscos.

El precio de la API tampoco es tan barato como parece

La API en QwenCloud cuesta 2 dólares por millón de tokens de entrada y 6 de salida, con caché a 0,25. Competitivo frente a los flagships occidentales, sí. Pero el modelo usa razonamiento en modo «xhigh» por defecto, y esos tokens de pensamiento se facturan como salida. En la práctica, una tarea de agente larga — precisamente la que Alibaba vende como diferencial — puede inflar la factura más de lo que calculaste en la hoja de Excel.

Si gestionas webs para clientes y estás tentado de sustituir parte del desarrollo por agentes Qwen, haz números con escenarios pesimistas: iteraciones fallidas, contextos de un millón de tokens que se rellenan con logs, reprocesos. El coste por token bajo no te salva si el agente da vueltas.

Qué significa esto si tienes una web o una agencia

Para el sector en el que movemos la mayoría — pymes, tiendas online, WordPress, integraciones — Qwen3.8-Max no cambia el panorama mañana. Cambia el discurso comercial: más presión para vender «webs con IA integrada», más clientes preguntando si pueden usar «el modelo chino gratis» y más riesgo de que alguien del equipo conecte una API sin revisar dónde van los datos.

Lo sensato, como recomiendan varios desarrolladores en la conversación anglosajona, es esperar a que los pesos estén publicados, probar el checkpoint pequeño si encaja en tu stack y medir contra tu código, no contra la tabla de Alibaba. Si una herramienta no enseña metodología reproducible, es marketing hasta que demuestre lo contrario.

Yo no descarto que Qwen3.8-Max sea un salto real en agentes multimodales y tareas largas. Descarto que una pyme española deba reorganizar su estrategia digital porque un comunicado de Hangzhou dice que un modelo programó solo durante 16 días. Eso no es open source para todos; es un anuncio dirigido a equipos con GPUs de sobra y presupuesto de experimentación.

Si mañana tu proveedor de hosting te ofreciera instalar Qwen3.8-Max «gratis» en tu plan compartido de 15 euros a cambio de compartir los datos de tus clientes para entrenar el siguiente modelo, ¿firmarías el contrato sin leer la letra pequeña?

Fuentes

Salir de la versión móvil