Gemini se encuentra entre las mejores opciones en relación calidad-precio de la IA de primer nivel, y Kunavo lo ofrece aproximadamente un 70% por debajo del precio de lista de Google mediante una única API compatible con OpenAI. Esta guía incluye las tarifas actuales por modelo, ejemplos de costes que puedes comprobar por tu cuenta y la forma más económica de llamar a Gemini en producción.
Precios de la API de Gemini de un vistazo
Las tarifas se calculan por 1M de tokens, en USD, tal como se facturan en Kunavo. La columna “Precio de lista de Google” muestra la tarifa oficial publicada por Google para el mismo modelo, para que puedas ver la diferencia.
| Modelo | Entrada / 1M | Salida / 1M | Precio de lista de Google (entrada / salida) | Ahorro |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash es el caballo de batalla para grandes volúmenes; Pro es para razonamientos más exigentes, visión y tareas con contexto largo. Las tarifas actuales aparecen siempre en la página de precios y en la página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Cómo funciona el precio por token de Gemini
Pagas por los tokens de entrada (todo lo que envías: la instrucción del sistema, el contexto recuperado y el mensaje del usuario) y por los tokens de salida (lo que genera el modelo). La salida es la parte más cara, por lo que el factor que más influye en la factura de Gemini es cuánto texto permites que escriba el modelo. Las imágenes y el audio se convierten en equivalentes de tokens y se facturan con el mismo contador.
Ejemplos de cálculo de costes
Cifras reales con las tarifas de Gemini 2.5 Flash de Kunavo, excepto la última fila, que utiliza Gemini 3.1 Pro:
| Carga de trabajo | Tokens (entrada / salida) | Modelo | Coste |
|---|---|---|---|
| Interacción de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Respuesta RAG | 8.000 / 500 | Flash | $0.0011 |
| Clasificación por lotes (por documento) | 500 / 20 | Flash | $0.00006 |
| Análisis de contexto largo | 20.000 / 2.000 | Pro | $0.0224 |
Con esas tarifas, un lote de clasificación de 100.000 documentos en Flash cuesta aproximadamente $6, y un millón de interacciones de chatbot cuesta alrededor de $315. El cálculo, listo para ejecutar:
# Tarif Kunavo untuk Gemini 2.5 Flash (USD per 1J token)
IN_RATE, OUT_RATE = 0.09, 0.75
def biaya(token_masuk: int, token_keluar: int) -> float:
return token_masuk / 1_000_000 * IN_RATE + token_keluar / 1_000_000 * OUT_RATE
print(biaya(1_000, 300)) # satu putaran chatbot -> $0.000315
print(biaya(8_000, 500)) # satu jawaban RAG -> $0.001095
print(biaya(500, 20) * 100_000) # batch 100rb dokumen -> ~$6.00Precios de Kunavo y facturación mediante Stripe
No hay suscripciones ni proyectos de Google Cloud. Añades saldo a un monedero (Stripe o métodos de pago locales), y cada llamada descuenta de ese saldo según las tarifas por token anteriores. El pago por uso comienza con una recarga mínima de $10, el saldo nunca caduca y las recargas mayores reciben crédito adicional. Un solo monedero cubre Gemini y todos los demás modelos —Claude, GPT, imagen, vídeo y audio—, por lo que no necesitas conciliar facturas separadas de cada proveedor.
¿Qué modelo de Gemini debería elegir?
- gemini-2-5-flash: opción predeterminada para chat, extracción, clasificación, resumen y la mayoría de los casos de RAG. Es rápido y la opción capaz más económica.
- gemini-3-1-pro: úsalo cuando Flash no sea suficientemente preciso: razonamiento en varios pasos, código, visión y contextos muy largos.
Un buen patrón es enrutar según la dificultad: Flash para los casos habituales y Pro solo cuando falle una comprobación. Consulta la guía de optimización de costes de IA para ver el patrón de enrutamiento en el código.
Cómo reducir tu factura de Gemini
- Baja de nivel. Envía el 80% de los casos sencillos a Flash y reserva Pro para el 20% más difícil.
- Limita la salida. Configura
max_tokensy secuencias de parada; la salida es la parte cara del contador. - Reduce la entrada. Recupera menos fragmentos de RAG, pero mejores, en lugar de introducir toda la base de conocimientos en el contexto.
- Procesa por lotes. Agrupa llamadas independientes para mantener baja la latencia y evitar oleadas de reintentos.
Preguntas frecuentes
¿La API de Gemini es gratuita?
Google AI Studio tiene un nivel gratuito con límites de velocidad, ideal para prototipos. En producción pagas por token. Kunavo aplica un modelo de pago por uso desde una recarga mínima de $10: pagas por token según las tarifas siguientes, el saldo nunca caduca y no necesitas una cuenta de facturación de Google Cloud.
¿Cuánto cuesta Gemini 2.5 Flash?
En Kunavo, Gemini 2.5 Flash cuesta $0.09 por 1M de tokens de entrada y $0.75 por 1M de tokens de salida, aproximadamente un 70% por debajo del precio de lista oficial de Google de $0.30 / $2.50. Una interacción habitual de chatbot (1K de entrada, 300 de salida) cuesta alrededor de $0.0003.
¿Gemini es más barato que Claude o GPT?
Gemini 2.5 Flash es uno de los modelos capaces más baratos disponibles: cuesta menos que Claude Haiku y que la mayoría de los niveles de GPT para cargas de trabajo de gran volumen. Compara la tabla completa en la página de precios.
¿Cómo puedo reducir el coste de la API de Gemini?
Usa Flash, limita la salida, simplifica el contexto recuperado y procesa por lotes. Encontrarás los detalles en la guía de optimización de costes. Para empezar a llamar a Gemini, consulta cómo obtener una clave de API de Gemini.