Gemini es una de las mejores opciones de precio/rendimiento en IA de frontera, y Kunavo lo ofrece detrás de una única API compatible con OpenAI a un precio aproximadamente un %70 inferior al precio de lista de Google. Esta guía incluye las tarifas actuales por modelo, ejemplos de cálculos de costes que puedes verificar por tu cuenta y la forma más económica de llamar a Gemini en producción.
Precios de Gemini de un vistazo
Las tarifas se expresan por 1M de tokens y en USD, tal como se facturan en Kunavo. La columna «Precio de lista de Google» muestra la tarifa publicada por Google para el mismo modelo; se incluye para que puedas ver la diferencia.
| Modelo | Entrada / 1M | Salida / 1M | Precio de lista de Google (entrada / salida) | Ahorro |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~%70 |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~%65 |
Flash es el motor para cargas de gran volumen; Pro está pensado para razonamiento más difícil, tareas visuales y trabajos con contexto largo. Las tarifas actuales siempre aparecen en la página de precios y en la página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Cómo funciona el precio por token de Gemini
Pagas por los tokens de entrada (todo lo que envías: el prompt del sistema, el contexto recuperado y el mensaje del usuario) y los tokens de salida (lo que genera el modelo). La salida es la parte más cara; por eso, la mayor palanca individual en tu factura de Gemini es cuánto texto permites que escriba el modelo. Las imágenes y el audio se convierten en equivalentes de tokens y se facturan con el mismo contador.
Ejemplos de cálculo de costes
Cifras reales con la tarifa de Kunavo para Gemini 2.5 Flash, excepto la última fila, que usa Gemini 3.1 Pro:
| Carga de trabajo | Tokens (entrada / salida) | Modelo | Coste |
|---|---|---|---|
| Turno de chat | 1.000 / 300 | Flash | $0.0003 |
| Respuesta RAG | 8.000 / 500 | Flash | $0.0011 |
| Clasificación por lotes (por documento) | 500 / 20 | Flash | $0.00006 |
| Análisis de contexto largo | 20.000 / 2.000 | Pro | $0.0224 |
Con estas tarifas, un lote de clasificación de 100.000 documentos en Flash cuesta aproximadamente $6, y un millón de turnos de chat cuesta aproximadamente $315. Matemática ejecutable:
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # bir sohbet turu -> $0.000315
print(cost(8_000, 500)) # bir RAG yanıtı -> $0.001095
print(cost(500, 20) * 100_000) # 100k belge yığını -> ~$6.00Precios de Kunavo y facturación de Stripe
No hay suscripción ni proyecto de Google Cloud. Añades saldo (mediante Stripe o métodos de pago locales) y las llamadas se descuentan de ese saldo según las tarifas por token indicadas arriba. El modelo de pago por uso comienza con una recarga mínima de $10, el saldo nunca caduca y las recargas mayores incluyen crédito adicional. Un único saldo cubre Gemini y todos los demás modelos — Claude, GPT, imagen, vídeo y audio —, así que no tienes que conciliar una factura separada por proveedor.
¿Qué modelo de Gemini debería elegir?
- gemini-2-5-flash — la opción predeterminada para chat, extracción, clasificación, resumen y la mayoría de los casos de RAG. Es rápido y la opción capaz más económica.
- gemini-3-1-pro — elige esta opción cuando Flash no sea suficientemente preciso: razonamiento de varios pasos, código, tareas visuales y contexto muy largo.
Un buen patrón es enrutar según la dificultad: Flash para los casos comunes y Pro cuando falle una comprobación. Consulta la guía de optimización de costes de IA para ver el patrón de enrutamiento en el código.
Cómo reducir tu factura de Gemini
- Baja de nivel. Envía el 80 % sencillo a Flash y reserva Pro para el 20 % difícil.
- Limita la salida. Configura
max_tokensy las secuencias de parada: la salida es la parte cara del contador. - Recorta la entrada. Recupera menos fragmentos de RAG, pero de mayor calidad, en lugar de llenar el contexto con toda la base de conocimientos.
- Procesa en lotes. Agrupa las llamadas independientes para mantener baja la latencia y evitar oleadas de reintentos.
Preguntas frecuentes
¿La API de Gemini es gratuita?
Google AI Studio ofrece un nivel gratuito con límites de velocidad, adecuado para crear prototipos. En producción se paga por token. Kunavo funciona con pago por uso desde una recarga mínima de $10: paga por token según las tarifas siguientes, el saldo nunca caduca y no necesita una cuenta de facturación de Google Cloud.
¿Cuánto cuesta Gemini 2.5 Flash?
En Kunavo, Gemini 2.5 Flash cuesta $0.09 por 1M de tokens de entrada y $0.75 por 1M de tokens de salida, aproximadamente un 70% por debajo del precio de lista de Google de $0.30 / $2.50. Un turno de conversación típico (1K de entrada, 300 de salida) cuesta aproximadamente $0.0003.
¿Es Gemini más barato que Claude o GPT?
Gemini 2.5 Flash es uno de los modelos capaces más baratos disponibles — cuesta menos que Claude Haiku y la mayoría de los niveles de GPT para cargas de trabajo de gran volumen. Compáralos en la página de precios.
¿Cómo reduzco el coste de la API de Gemini?
Cambia a Flash, limita la salida, recorta el contexto recuperado y procesa en lotes. Consulta los detalles en la guía de optimización de costes. Para empezar a llamar a Gemini, consulta la guía Cómo obtener una clave de API de Gemini.