El 21 de julio de 2026, Google liberó tres modelos nuevos: Gemini 3.6 Flash, 3.5 Flash-Lite y 3.5 Flash Cyber. Sin el prometido Gemini 3.5 Pro, que ya acumula cuatro ventanas de lanzamiento fallidas. El número que más importa si construyes agentes de IA: en tareas multi-paso con herramientas, Gemini 3.6 Flash consume hasta 65% menos tokens de salida que su predecesor. Costos más bajos, sin sacrificar calidad.
Antes de los números, contexto rápido. Google necesitaba dar una respuesta mientras termina 3.5 Pro. Pero 3.6 Flash no es un parche de emergencia: tiene mejoras reales en coding, razonamiento y tareas multimodales, no solo una reducción de precio. Según el blog oficial de Google, el modelo "completa las mismas tareas en menos pasos de razonamiento y con menos llamadas a herramientas". Eso es lo que mueve el número.
Qué cambió de verdad en Gemini 3.6 Flash
El modelo produce 17% menos tokens de salida en promedio frente a 3.5 Flash. Ese número sube a 65% en workflows agénticos largos con múltiples herramientas. La diferencia: el modelo llega al mismo resultado en menos rondas de razonamiento y con menos tool calls intermedios. Menos loops innecesarios.
En términos de precio, la comparación con 3.5 Flash es directa:
- ▸Precio entrada: $1.50 por millón de tokens (igual que 3.5 Flash)
- ▸Precio salida: $7.50 por millón (vs. $9.00 de 3.5 Flash — 17% más barato en cada llamada)
- ▸Contexto: 1 millón de tokens
- ▸Disponible desde el 21 de julio en Gemini API, Google AI Studio, Android Studio y la app de Gemini para todos los usuarios
En coding específicamente, Google reporta "mayor precisión con menos ediciones de código innecesarias y menos loops de ejecución" frente a 3.5 Flash. Si usas el modelo para revisión o generación de código, eso se traduce en respuestas más directas y menos rondas de corrección.
Por qué esto importa si construyes agentes de IA
Un agente de análisis de documentos construido con LangGraph puede hacer entre 20 y 40 llamadas al modelo antes de entregar el resultado final. Cada llamada genera tokens de salida: razonamiento, respuestas intermedias, tool calls. Con 3.5 Flash, ese flujo costaba entre $0.15 y $0.25 por ejecución. Con 3.6 Flash, en tareas similares, baja a $0.05–$0.09.
Multiplícalo por 5.000 ejecuciones diarias en producción. La diferencia mensual ya no es trivial — estamos hablando de entre $3.000 y $6.000 menos al mes solo en tokens de salida.
He visto equipos que no escalan de dev a producción porque los costos de inferencia no cierran la ecuación. Los agentes de IA son caros exactamente porque hacen muchas llamadas al modelo. Ahí es donde 3.6 Flash mueve algo real para los que ya tienen volumen.
¿Qué tipos de workflows se benefician más? Según los datos de Google en benchmarks internos:
- ▸Pipelines de research con múltiples búsquedas y síntesis de información
- ▸Análisis de documentos largos con extracción de datos estructurados
- ▸Agentes de código que revisan y corrigen de forma iterativa
- ▸Sistemas multi-agente con validaciones cruzadas entre agentes
Flash-Lite y Flash Cyber: para qué sirve cada uno
Google no lanzó uno sino tres modelos el 21 de julio. Los otros dos tienen nichos distintos y vale entenderlos antes de elegir cuál usar.
3.5 Flash-Lite es el modelo de menor costo para tareas simples: clasificación de texto, extracción de campos, traducción, resúmenes cortos. Si hoy usas 3.5 Flash para ese tipo de trabajo, Flash-Lite puede reducir el gasto aún más. No está diseñado para razonamiento complejo ni flujos multi-paso.
3.5 Flash Cyber es un modelo especializado en ciberseguridad: análisis de vulnerabilidades, pen testing, revisión de código con foco en seguridad, detección de patrones de ataque. No es un modelo general con un nuevo nombre — el entrenamiento está específicamente orientado a ese dominio. Si tu trabajo está en seguridad ofensiva o defensiva, es el primero que hay que probar.
Lo que nadie te dice de este lanzamiento
Los benchmarks de Google muestran mejoras en MMLU, coding y tareas multimodales. Lo que no aparece en el post oficial: en conversaciones cortas o documentos simples de una sola ronda, la diferencia de costo frente a 3.5 Flash va a ser pequeña. El 65% de ahorro aplica cuando tienes flujos largos con múltiples herramientas y muchos pasos. Un chatbot de ida y vuelta normal no va a notar casi nada.
Sobre Gemini 3.5 Pro: Google indicó que sigue en desarrollo y que 3.6 Flash es un puente. No hay fecha confirmada. Si tu proyecto depende de un modelo de mayor capacidad de razonamiento, sigue monitoreando — 3.5 Pro eventualmente llegará, pero sin un calendario claro.
Aun así, el cambio de 3.5 Flash a 3.6 Flash es una línea de código. Vale probarlo con tus flujos reales antes de sacar conclusiones sobre el impacto real en tu caso.
Cómo empezar a usarlo hoy
Si ya usas Gemini en tus proyectos, la migración es mínima. En la Gemini API de Python, basta con cambiar el nombre del modelo:
model = GenerativeModel("gemini-3.6-flash")
En Google AI Studio ya aparece como opción desde el día del lanzamiento. Si builds apps móviles, también está disponible en Android Studio. Para usar el modelo vía API necesitas una API key de Google AI Studio — gratuita para empezar, con cuotas generosas en el plan free.
Si usas LangChain o LangGraph, el cambio también es trivial: ajusta el parámetro del modelo en el ChatGoogleGenerativeAI wrapper y listo.
Cómo aprender IA con Google y agentes en DataPath
Si quieres construir sistemas reales con Google AI —pipelines en Vertex AI, agentes con tus propios datos, integración con BigQuery y Cloud Storage— tenemos la Especialización en IA Generativa en Google Cloud, que cubre ese stack desde cero hasta producción. Si prefieres ir directo a la parte de agentes, el Taller de Agentes Inteligentes con Google Cloud está diseñado para que construyas tu primer agente funcional en pocas horas.
Si el tema de agentes te interesa más allá de Google —LangGraph, CrewAI, sistemas multi-agente, despliegue en producción—, la ruta AI Agentic Engineer cubre el stack completo. Los instructores de DataPath trabajan con estos modelos en proyectos reales, no en demos de laboratorio.
El ahorro de tokens que ofrece 3.6 Flash se vuelve real cuando diseñas bien los flujos agénticos. No alcanza con cambiar el modelo — hay que pensar en cuántas llamadas hace tu agente y cómo estructurar el razonamiento para reducirlas. Para eso hace falta entender la arquitectura, no solo la API. Empieza por la ruta AI Agentic Engineer o arranca directo con la Especialización en IA con Google Cloud según cuál sea tu stack.



