El 21 de agosto, OpenAI recortó el precio de GPT-5.6 Sol un 20%: el token de entrada pasó de $5 a $4 por millón, y el de salida de $30 a $20. La rebaja tiene vigencia mínima hasta el 21 de noviembre. Al mismo tiempo, Luna —el modelo más ligero de la familia— reemplazó al por defecto para usuarios Free y Go, que ahora tienen chats de texto ilimitados y un nuevo botón de razonamiento para preguntas complejas. Si construyes agentes en producción, este es el tipo de noticia que vale revisar antes de que llegue tu próxima factura.
Los números del recorte
- ▸Sol input: $5 → $4 por millón de tokens (−20%)
- ▸Sol output: $30 → $20 por millón de tokens (−33%)
- ▸Vigencia garantizada: 21 de agosto al 21 de noviembre de 2026
- ▸Luna: nuevo default para Free y Go, con texto ilimitado y botón Think para razonamiento
- ▸OpenAI atribuyó el corte a una baja del 20% en costos operativos y 15% de mejora en eficiencia de tokens
Segunda ronda de recortes en dos meses
El 23 de julio, OpenAI ya había recortado precios en la familia GPT-5.6: Luna bajó 80%, Terra 20%. Sol se mantuvo sin cambios hasta este mes. El patrón empieza a parecerse al de los chips de GPU: cada trimestre, lo que antes solo cabía en presupuestos corporativos grandes llega a equipos de tres personas. GPT-5.6 Sol puntúa 53.6 en el benchmark Agents' Last Exam, 13 puntos más que Claude Fable 5 (40.5). A precio de julio esa ventaja no compensaba el sobrecosto para muchos proyectos. Con el recorte de agosto, la ecuación empieza a cambiar.
También se integró GPT-5.6 Sol, Terra y Luna a Kiro, el entorno de desarrollo nativo con IA de OpenAI. Desde ahora puedes elegir el modelo dentro del IDE según el tipo de tarea: Sol para refactors complejos, Luna para autocompletado de alta frecuencia. Es el mismo principio de model routing que deberías aplicar en tus propios grafos de agente.
Dicho eso: los benchmarks miden razonamiento en condiciones controladas. En producción —con latencia variable, context pollution y errores de tool-calling— la diferencia práctica entre los modelos del top 3 suele ser bastante menor de lo que los leaderboards sugieren. Antes de migrar toda tu arquitectura a Sol, corre un batch de evaluación con tu caso de uso real.
Sol vs Luna: cómo repartirlos en tu grafo de agentes
Cuándo usar Sol
El nodo de planificación de un agente multi-paso, síntesis de documentos donde el costo del error es alto, análisis de código extenso o razonamiento sobre reglas de negocio complejas. Son los pasos donde pagar cuatro veces más que Luna tiene sentido real: una mala decisión en planeación puede hacer fallar todo el workflow aguas abajo. Sol con razonamiento a medio nivel ya supera a Fable 5 en benchmarks de agentes, y a un cuarto del costo estimado.
Cuándo usar Luna
Clasificación, extracción de entidades, respuestas cortas de alta frecuencia, ruteo de intención. Si tu agente hace miles de llamadas al día en un paso de filtrado, Luna es la opción lógica. Combinar Sol para planeación y Luna para ejecución en el mismo grafo ya es un patrón estándar entre los equipos que tienen control real de sus costos de inferencia.
¿Vale compararlo con Claude Sonnet 5?
Anthropic congeló el precio de Claude Sonnet 5 en $2/$10 por millón de tokens (la subida programada para septiembre no va a ocurrir). Comparado con Sol ($4/$20), Sonnet 5 es exactamente la mitad de precio por token. La pregunta es si los ~12 puntos de ventaja de Sol en benchmarks de agentes justifican ese costo extra. Para la mayoría de casos en producción —clasificación, soporte, RAG estructurado— Sonnet 5 gana la ecuación. Para razonamiento profundo en planeación de agentes complejos, Sol empieza a tener sentido. Lo más inteligente no es elegir uno: es usarlos en nodos distintos del mismo grafo.
Lo que cambia para los AI Engineers en LATAM
Tres consecuencias prácticas. Si ya tienes Sol corriendo en producción: tu factura de agosto baja entre 20% y 33% sin tocar una línea de código. Si lo habías descartado por precio: vale reevaluar para los nodos de razonamiento pesado de tus agentes. Si todavía estás eligiendo plataforma: el recorte pone a Sol en un rango donde ya no es solo para proyectos bien financiados.
Diseñar agentes que asignan modelos distintos según el tipo de tarea —lo que se llama model routing— es exactamente la clase de decisión que diferencia un agente costoso de uno rentable. Los frameworks como LangGraph o CrewAI te permiten asignar un modelo diferente a cada nodo del grafo, y ese diseño es donde están los ahorros reales de optimización en producción.
Cómo aprender a construir agentes que aprovechen esto
Saber que Sol bajó de precio es un punto de partida. Diseñar un grafo donde Sol trabaja en planeación y Luna en ejecución —y medir cuánto cuesta cada workflow— es lo que convierte ese dato en resultados concretos. En la ruta de AI Agentic Engineer aprendes exactamente eso: arquitectura de agentes multi-nodo, selección de modelos por tarea, evaluación en producción y despliegue en contextos reales de LATAM. Si ya tienes base en agentes y quieres profundizar en grafos de estado, el taller de LangGraph es el camino más directo.
Si prefieres experimentar en grupo —comparar arquitecturas de agentes, ver cómo otros equipos de LATAM manejan el model routing, hacer pruebas con presupuesto real— cada semana hay un taller en vivo en la Comunidad AI Builders. Desde 19 USD al mes, sin permanencia mínima.
El piso de precios sigue bajando
Este recorte no es un evento aislado. Es parte de una compresión que lleva 18 meses sin pausa: cada trimestre, lo que costaba $30 por millón de tokens ahora cuesta $20. Los equipos que aprendan hoy a construir agentes que optimizan el uso del contexto y el costo por nodo serán los que tengan ventaja cuando llegue el siguiente recorte —y llegará. Para arrancar o revisar lo que ya tienes, los cursos de agentes de IA en DataPath están diseñados para producción, no para demos.


