Todos los artículos
Por Carlos García Actualizado 6 min de lectura

Gemini 3.6 Flash y 3.5 Flash-Lite: precios, velocidad y benchmarks

Gemini 3.6 Flash y 3.5 Flash-Lite: precios, velocidad y benchmarks

En 60 segundos: Google lanzó tres modelos Flash el 21 de julio de 2026. Gemini 3.6 Flash cuesta USD 1.50/1M input tokens y USD 7.50/1M output tokens, usa 17% menos tokens que 3.5 y mejora la calidad. Gemini 3.5 Flash-Lite cuesta USD 0.30/1M input y USD 2.50/1M output, con un throughput de 350 tokens/s. Gemini 3.5 Flash Cyber sigue limitado a gobiernos y pilotos de CodeMender. Elegí 3.6 Flash para workloads de coding, agentes o multimodalidad con computer use integrado. Elegí Flash-Lite cuando mandan el volumen y la latencia. Gemini 3.5 Pro continúa en pruebas con partners.

El 21 de julio de 2026, Google DeepMind lanzó tres modelos Flash orientados a agentes de IA en producción. Cada uno resuelve de forma distinta el equilibrio entre precio, latencia y calidad. La comparación depende del workload: 3.6 Flash ofrece más capacidad, Flash-Lite prioriza volumen y 3.5 Flash sigue teniendo sentido cuando migrar cuesta más de lo que ahorra.

Lo que cambió en 3.6 Flash

La métrica más útil del Artificial Analysis Index es el uso de output tokens. Gemini 3.6 Flash consume 17% menos tokens que 3.5 Flash para la misma tarea. En algunas configuraciones de DeepSWE, la reducción llega al 65%. Eso impacta tanto la factura de API como el tiempo de respuesta.

Pricing de 3.6 Flash:

TipoUSD / 1M tokens
Input1.50
Output7.50

Frente a 3.5 Flash antes de este lanzamiento, 3.6 Flash cuesta menos y obtiene mejores resultados. Aun así, conviene probarlo con prompts propios antes de mover tráfico de producción.

Benchmarks donde 3.6 Flash mejora:

Benchmark3.5 Flash3.6 FlashMejora
DeepSWE (Datacurve)37%49%+12 pts
MLE Bench49.7%63.9%+14.2 pts
OSWorld-Verified (computer use)78.4%83.0%+4.6 pts
GDPval-AA v213491421+72

La mejora de 12 puntos en DeepSWE importa para coding agentic: menos edits no deseados, menos loops de ejecución y menos tokens totales para resolver la misma tarea.

Computer use como built-in

Gemini 3.6 Flash incluye computer use como herramienta integrada de la Gemini API. Podés pasarle screenshots y pedir acciones sobre interfaces gráficas sin armar un wrapper aparte.

Para casos como “testear este flujo de UI” o “completar este form con datos del usuario”, ya no necesitás una integración separada con un modelo de visión + un action parser. El mismo modelo decide qué hacer.

3.5 Flash-Lite para alto throughput

Si tu workload es alto volumen + latencia crítica, 3.5 Flash-Lite es el modelo de la release. Las specs:

SpecValor
Output throughput350 tokens/s
Input priceUSD 0.30 / 1M tokens
Output priceUSD 2.50 / 1M tokens
Reasoning levelsminimal / low / high (configurable)

Dónde gana Flash-Lite:

  • Agentic search a escala: búsquedas masivas donde la latencia de respuesta impacta la UX
  • Document processing batch: clasificación, extracción de datos y validación
  • Customer support tier 1: clasificación y primera respuesta cuando el SLA de latencia es crítico
  • High-volume classification: moderación, routing y tagging

En los benchmarks publicados, 3.5 Flash-Lite también supera a 3 Flash en coding y tareas agentic:

Benchmark3 Flash3.5 Flash-Lite
SWE-Bench Pro49.6%54.2%
OSWorld-Verified65.1%74.0%
Terminal-Bench 2.131%54%
GDPval-AA v26421140

Si tenés workloads en Flash clásico, probá Flash-Lite contra ellos. Cuesta menos y rinde mejor en varios de estos benchmarks.

3.5 Flash Cyber: piloto cerrado

Google también liberó Gemini 3.5 Flash Cyber, fine-tuned para encontrar y arreglar vulnerabilidades de código, usado como base del agente CodeMender. La twist: no es accesible públicamente. Solo gobiernos y partners trusted vía CodeMender como parte de un programa piloto de acceso limitado.

Razón declarada: la dual-use nature del modelo (lo que sirve para defenders también sirve para attackers) requiere distribución controlada. Si trabajás en seguridad y querés acceso, el camino es contactar al equipo de CodeMender directamente.

3.5 Pro: todavía en testing

Google confirma que 3.5 Pro está en testing con partners y planean hacerlo disponible broadly cuando esté listo. Mientras tanto, si tu workload necesita el tier más capaz de Gemini, hoy la opción es Gemini 3 Pro (la versión previa) o mirar fuera del ecosistema Google.

Cuándo elegir cada uno

Elegí 3.6 Flash si:

  • Tu workload es coding agentic con tool calling sostenido
  • Necesitás multimodal (computer use, screenshots, charts) en producción
  • Querés el mejor balance costo/calidad para knowledge work
  • Tu producto es un agente AI donde cada token cuenta

Elegí 3.5 Flash-Lite si:

  • Volumen alto donde el costo por call es el driver principal
  • Latencia crítica (UX donde el usuario espera menos de 2 segundos para respuestas simples)
  • Tareas simples a escala (classification, extraction, routing)
  • Workloads donde el SLA de uptime es prioritario

Quedate con 3.5 Flash si:

  • Ya tenés integración profunda en 3.5 Flash y el upgrade no está justificado por ahorro
  • Workloads donde la estabilidad probada importa más que el cutting edge

Elegí Claude Haiku si:

  • Tu ecosistema ya está en Anthropic y el costo de switching es alto
  • Necesitás compliance maduro (HIPAA, SOC2) que Anthropic ya certificó

Elegí GPT-5.6 mini si:

  • Tu ecosistema ya está en OpenAI
  • Necesitás function calling con features específicas de OpenAI

Disponibilidad y pricing detallado

3.6 Flash está disponible desde el 21 de julio en:

  • Gemini API via Google AI Studio y Android Studio
  • Google Antigravity
  • Gemini Enterprise Agent Platform
  • Gemini Enterprise app

3.5 Flash-Lite está disponible en los mismos canales + Google Search (rolling out).

Pricing final por modelo:

ModeloInput USD/1MOutput USD/1MThroughput
Gemini 3.6 Flash1.507.50medio
Gemini 3.5 Flash-Lite0.302.50350 tok/s
Gemini 3.5 Flash (anterior)más caromás caromedio

Qué cambia para equipos de LATAM

  1. Pricing en USD sin variación regional. Google no cobra distinto por región para Gemini API, así que el costo es el mismo en Buenos Aires que en San Francisco. Esto nivelá el playing field contra proveedores que sí tienen regional pricing diferenciado.

  2. Computer use para productos B2B. Si tu SaaS necesita automatizar flujos de UI (formularios web, dashboards, ERPs), 3.6 Flash con computer use built-in baja la barrera de entrada significativamente.

  3. Throughput de Flash-Lite para support bots. Si tenés un chatbot de soporte con miles de conversaciones simultáneas, Flash-Lite a 350 tokens/s cambia las matemáticas de cuántos agentes podés tener activos.

La migración se puede probar en pequeño: repetí un conjunto representativo de requests de producción con 3.6 Flash y Flash-Lite, y compará calidad, latencia y output tokens totales. El modelo más barato solo conviene si mantiene el nivel de calidad que necesitás.

Preguntas frecuentes

¿Qué es Gemini 3.6 Flash en una frase?

Es el modelo general de Google para producción de agentes de IA: 17% menos output tokens que 3.5 Flash en el Artificial Analysis Index, mejor calidad en coding (DeepSWE 49% vs 37%) y multimodal más eficiente. Precio: USD 1.50/1M input, USD 7.50/1M output. Es una opción equilibrada para agentic workflows donde importan el costo, la latencia y la calidad.

¿En qué se diferencia de Gemini 3.5 Flash?

3.6 Flash entrega más calidad con menos tokens: en el Artificial Analysis Index consume 17% menos output tokens, en DeepSWE pasa de 37% a 49%, en MLE Bench de 49.7% a 63.9%, en OSWorld-Verified de 78.4% a 83.0%. Computer use ahora es una tool built-in del Gemini API. Y sale más barato: USD 1.50/1M input vs USD más caro de 3.5 Flash en el tier equivalente.

¿Qué es Gemini 3.5 Flash-Lite y cuándo usarlo?

Es el modelo más rápido y económico de la serie 3.5: 350 output tokens/s, USD 0.30/1M input y USD 2.50/1M output. Pensado para high-volume agentic search, document processing, y tareas donde la latencia mínima es el requirement. Supera a 3 Flash en coding (SWE-Bench Pro 54.2% vs 49.6%) y agentic (OSWorld 74.0% vs 65.1%).

¿Cuándo conviene 3.6 Flash vs 3.5 Flash-Lite vs 3.5 Pro?

3.6 Flash para workloads generales (coding, knowledge work, multimodal con tool use sostenido). 3.5 Flash-Lite para volumen alto con latencia crítica (search agents, document processing batch, classification a escala). 3.5 Pro todavía está en testing con partners, así que esperá unas semanas si podés.

¿Cómo se compara con Claude Haiku o GPT-5.6 mini?

3.6 Flash compite en el mismo segmento que Claude Haiku y GPT mini pero con pricing más agresivo en output (USD 7.50/1M vs más caro de Haiku) y computer use como built-in. 3.5 Flash-Lite es especialmente fuerte en throughput; 350 tokens/s es difícil de igualar con Haiku. Para coding agentic, la decisión suele ser Gemini 3.6 vs Claude Sonnet, no vs Haiku.

¿Tiene mejoras de seguridad?

Sí. 3.6 Flash sale con safeguards de Frontier Safety reforzadas en dominios CBRN (Chemical, Biological, Radiological, Nuclear) y cyber offense misuses. El modelo es más resistente a jailbreaks pero está entrenado para minimizar refusals en usos beneficiosos. Verificá el model card para casos límite.

De la idea a la acción

¿Quieres convertir esto en un agente que trabaje para tu equipo?

Cuéntanos qué proceso quieres mejorar. En una llamada gratuita identificaremos el primer flujo que vale la pena construir.

Agenda una llamada gratuita