El 13 de agosto de 2026, los checkpoints de Qwen3.8-Max aparecieron en Hugging Face. No es un modelo más: con 2.4 billones de parámetros y arquitectura MoE (mezcla de expertos), es el primer modelo Max-class que Alibaba hace open-weight. Había llegado como API el 3 de agosto con benchmarks que superan a Claude Fable 5 y a GPT-5.6 Sol Max en OSWorld-Verified — el benchmark de referencia para agentes que operan computadoras de forma autónoma. Para los que construyen agentes de IA, esto tiene implicaciones concretas.
Qué hay adentro: 2.4T parámetros, 95B activos, 1M de contexto
El modelo tiene 2.4 billones de parámetros totales, pero en cada inferencia solo actúan 95 mil millones — el resto duerme, gracias a MoE. Para ponerlo en perspectiva: un modelo "grande" de hace dos años tenía 70B activos en total. En la versión API, el contexto llega a 1 millón de tokens, útil para repositorios enteros o documentos muy largos. Los pesos open-weight liberados son solo texto (sin visión y sin el contexto de 1M), pero eso ya es más que suficiente para la mayoría de los casos de uso de agentes. El 15 de agosto salió el companion Qwen3.8-27B: más liviano, pensado para hardware más accesible.
86.1 en OSWorld: lo que dicen los benchmarks
Alibaba posicionó Qwen3.8-Max para trabajo agentico de largo horizonte: coding en repositorios completos, knowledge bases con documentos extensos, extracción de datos estructurados y research multi-paso. Los números que publicaron en OSWorld-Verified muestran 86.1 puntos contra 83.2 de GPT-5.6 Sol Max, 85.0 de Claude Fable 5 y 76.2 de Gemini 3.1 Pro. Que un modelo con pesos abiertos esté en esa discusión es algo nuevo.
Caveat que vale la pena decir: Alibaba elige qué benchmarks reportar. No tengo datos independientes de cómo rinde en tareas específicas de LATAM o en pipelines reales con latencia y costos variables. Los números son prometedores, pero prueba con tu caso de uso antes de comprometerte con una migración.
Qué puedes hacer con los pesos y qué no
Los checkpoints FP8 están en Hugging Face bajo Qwen/Qwen3.8-Max. Puedes descargarlos, correr inferencia en tu propia infraestructura, modificar el modelo y usarlo comercialmente — con una restricción: si tu negocio supera $50M de ingresos anuales por MaaS o asistente de IA, necesitas licencia separada. Para proyectos en LATAM, esa restricción no aplica casi en ningún caso.
El hardware es la barrera real. Un modelo de 95B activos no cabe en una RTX 4090 ni en dos A100 pequeñas. Para correrlo localmente necesitas multi-GPU A100/H100 o una instancia cloud equivalente. La alternativa práctica de entrada es la API externa: Together AI y Fireworks ya lo tienen con formato compatible con OpenAI, lo que significa que si tienes agentes apuntando a GPT o Claude, el switch es casi drop-in. Y si quieres experimentar localmente, el Qwen3.8-27B del 15 de agosto es la opción más razonable.
Por qué esto cambia la ecuación para quienes construyen agentes
Hasta ahora la ecuación era simple: rendimiento frontier = API propietaria cara. Claude para razonamiento complejo, GPT para escala, Gemini para integración con Google. Si tenías datos sensibles que no querías mandar a APIs externas, o si tu proyecto escala a millones de llamadas y el costo de API era un problema, las opciones open-weight quedaban cortas en razonamiento complejo. Qwen3.8-Max rompe eso. Por primera vez hay un modelo con benchmark de frontier — incluso sobre los competidores de pago — que puedes desplegar en tu propia infraestructura.
Lo que no cambia: el modelo no es el agente. La diferencia entre un demo de 20 minutos y un sistema que corre en producción está en la orquestación — cómo pasas contexto entre pasos, qué pasa cuando el agente falla en el paso 7 de 10, cómo depuras un flujo de 8 herramientas. Eso no lo resuelve el modelo; lo resuelves tú con una arquitectura de agentes bien diseñada.
Cómo usarlo hoy en tu stack de agentes
Para empezar rápido:
- ▸API directa: qwen.ai tiene un tier gratuito de entrada. También en Together AI o Fireworks con tu key.
- ▸Open-weight: descarga los checkpoints desde Hugging Face (Qwen/Qwen3.8-Max). Para una primera prueba más accesible, Qwen3.8-27B es más manejable.
- ▸Integración con tu stack: cualquier provider de inferencia expone el formato OpenAI-compatible. En LangChain o LangGraph cambias el endpoint y el modelo — el resto de tu código no cambia.
Qué necesitas para aprovechar modelos como este
Los que están sacando más provecho de Qwen3.8-Max ya dominan la orquestación: flujos multi-agente con memoria persistente, herramientas externas y manejo de errores en producción. Si estás construyendo en esa dirección, la ruta AI Agentic Engineer de DataPath cubre exactamente eso: LangGraph, CrewAI, sistemas multi-agente con MCP y despliegue real. Si quieres empezar por la parte de orquestación primero, el curso de LangGraph te da la base para construir agentes con estado y flujos complejos.
Si vas desde cero en IA, la ruta AI Engineer tiene el punto de entrada correcto: fundamentos sólidos de Python, LLMs y APIs antes de llegar a agentes complejos.
Si quieres practicar esto con otros que están construyendo agentes con los modelos más nuevos, cada semana hay un taller en vivo en la Comunidad AI Builders — desde $19 USD al mes. Es el espacio donde se prueban estas cosas antes de que lleguen a los cursos formales.



