Gemini ofrece una de las mejores relaciones calidad-precio de la IA de vanguardia, y Kunavo lo ofrece aproximadamente un 70 % por debajo del precio oficial de Google mediante una única API compatible con OpenAI. Esta guía de precios de la API de Gemini presenta las tarifas actuales por modelo, ejemplos de costes que puedes recalcular y la forma más barata de llamar a Gemini en producción.
Los precios de Gemini de un vistazo
Las tarifas están expresadas en USD por millón de tokens, según lo que cobra Kunavo. La columna «precio de Google» muestra la tarifa publicada por Google para el mismo modelo, para compararlos directamente.
| Modelo | Entrada / 1M | Salida / 1M | Precio de Google (entrada / salida) | Ahorro |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70 % |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65 % |
Flash es el modelo de trabajo para grandes volúmenes; Pro está pensado para razonamiento más difícil, visión y contexto largo. Las tarifas en tiempo real aparecen siempre en la página de precios y en cada página de modelo (gemini-2-5-flash, gemini-3-1-pro).
Cómo funciona la tarificación por tokens de Gemini
Pagas los tokens de entrada —todo lo que envías: prompt del sistema, contexto recuperado y mensaje del usuario— y los tokens de salida, es decir, lo que genera el modelo. La salida es la parte cara; por tanto, la mayor palanca sobre una factura de Gemini es la cantidad de texto que permites que escriba el modelo. Las imágenes y el audio se convierten en equivalentes de tokens y se facturan en el mismo contador.
Ejemplos detallados de costes
Cifras reales con la tarifa de Gemini 2.5 Flash de Kunavo, salvo la última fila, que usa Gemini 3.1 Pro:
| Carga de trabajo | Tokens (entrada / salida) | Modelo | Coste |
|---|---|---|---|
| Turno de chatbot | 1 000 / 300 | Flash | $0.0003 |
| Respuesta RAG | 8 000 / 500 | Flash | $0.0011 |
| Clasificación por lotes (por documento) | 500 / 20 | Flash | $0.00006 |
| Análisis de contexto largo | 20 000 / 2 000 | Pro | $0.0224 |
Con estas tarifas, clasificar por lotes 100.000 documentos en Flash cuesta aproximadamente $6, y un millón de turnos de chatbot, aproximadamente $315. El cálculo ejecutable es:
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def cout(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cout(1_000, 300)) # un tour de chatbot -> $0.000315
print(cout(8_000, 500)) # une réponse RAG -> $0.001095
print(cout(500, 20) * 100_000) # lot de 100k documents -> ~$6.00Precios de Kunavo y facturación mediante Stripe
Sin suscripción ni proyecto de Google Cloud. Recargas un saldo (tarjeta, Apple Pay, Google Pay o Link) y las llamadas se descuentan según las tarifas por token anteriores. Pago por uso desde una recarga mínima de $10; el saldo nunca caduca y las recargas mayores generan crédito de bonificación. Los precios están en USD y Stripe los convierte a EUR durante el checkout (el tipo de cambio incluye una comisión de conversión del 2 al 4 % a tu cargo; pagar en USD evita esa comisión); en B2B se aplica la inversión del sujeto pasivo con un número de IVA intracomunitario. Un único saldo cubre Gemini y todos los demás modelos —Claude, GPT, imagen, vídeo y audio— sin necesidad de conciliar facturas de cada proveedor.
¿Qué modelo de Gemini elegir?
- gemini-2-5-flash: la opción predeterminada para chat, extracción, clasificación, resumen y la mayoría de los casos de RAG. Es rápido y la opción capaz más barata.
- gemini-3-1-pro: cuando Flash no es suficientemente preciso: razonamiento en varios pasos, código, visión y contexto muy largo.
Un buen patrón es enrutar según la dificultad: Flash de forma predeterminada y escalar a Pro solo cuando falle una comprobación. El enfoque en código está en la guía de optimización de costes de IA.
Cómo reducir tu factura de Gemini
- Baja de gama. Envía el 80 % de las tareas sencillas a Flash y reserva Pro para el 20 % difícil.
- Limita la salida. Define
max_tokensy secuencias de parada: la salida es la parte cara del contador. - Aligera la entrada. Recupera menos fragmentos RAG y más pertinentes en lugar de introducir toda la base de conocimiento en el contexto.
- Agrupa. Procesa las llamadas independientes por lotes para mantener baja la latencia y evitar tormentas de reintentos.
La misma clave también permite llamar a los modelos de vídeo de Google; el precio por clip se detalla en el precio de Veo 3.
Preguntas frecuentes
¿La API de Gemini es gratuita?
Google AI Studio ofrece un nivel gratuito con límites de velocidad para crear prototipos. En producción, pagas por token. Kunavo funciona según el uso desde una recarga mínima de $10: pagas por token con las tarifas siguientes, el saldo nunca caduca y no necesitas ninguna cuenta de facturación de Google Cloud.
¿Cuánto cuesta Gemini 2.5 Flash?
En Kunavo, Gemini 2.5 Flash cuesta $0.09 por cada 1M de tokens de entrada y $0.75 por cada 1M de tokens de salida, aproximadamente un 70 % por debajo del precio oficial de Google ($0.30 / $2.50). Un turno típico de chatbot (1K de entrada y 300 de salida) cuesta aproximadamente $0.0003.
¿Gemini es más barato que Claude o GPT?
Gemini 2.5 Flash es uno de los modelos capaces más baratos del mercado: cuesta menos que Claude Haiku y que la mayoría de los niveles GPT para grandes volúmenes. Compara la tabla completa en la página de precios y las tarifas de Claude en la guía de precios de la API de Claude.
¿Cómo reducir el coste de la API de Gemini?
Bajar a Flash, limitar la salida, usar un contexto recuperado más ligero y procesar por lotes. Los detalles están en la guía de optimización de costes. Para empezar a llamar a Gemini, consulta cómo obtener una clave de la API de Gemini.