Gemini se encuentra entre las AI de vanguardia con mejor relación calidad-precio, y Kunavo lo ofrece detrás de una API compatible con OpenAI, aproximadamente un 70% por debajo del precio oficial de Google. Esta guía explica las tarifas actuales por modelo, ejemplos de cálculo de costes que puedes verificar directamente y cómo llamar a Gemini al menor coste en producción.
Precios de Gemini de un vistazo
Las tarifas se expresan en USD por 1M de tokens, según lo que cobra Kunavo. La columna «Precio oficial de Google» muestra las tarifas publicadas por Google para el mismo modelo, para que la diferencia pueda verse de un vistazo.
| Modelo | Entrada / 1M | Salida / 1M | Precio oficial de Google (entrada / salida) | Ahorro |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash es el modelo principal para procesamiento de gran volumen, mientras que Pro es adecuado para razonamiento más complejo, visión y tareas con contextos largos. Consulta siempre las tarifas actuales en la página de precios y en las páginas de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
¿Cómo funcionan los precios por token de Gemini?
Pagas por los tokens de entrada (todo lo que envías: el prompt del sistema, el contexto recuperado y el mensaje del usuario) y los tokens de salida (el contenido que genera el modelo). La salida es más cara, así que el factor que más determina la factura de Gemini es cuánto texto permites que escriba el modelo. Las imágenes y el audio se convierten a valores equivalentes en tokens y se cobran con el mismo medidor.
Ejemplos de cálculo de costes
Son cifras reales calculadas con las tarifas de Gemini 2.5 Flash de Kunavo; solo la última fila utilizaGemini 3.1 Pro:
| Tarea | Tokens (entrada / salida) | Modelo | coste |
|---|---|---|---|
| Un turno de chatbot | 1,000 / 300 | Flash | $0.0003 |
| Respuesta RAG | 8,000 / 500 | Flash | $0.0011 |
| Clasificación por lotes (por documento) | 500 / 20 | Flash | $0.00006 |
| Análisis de contexto largo | 20,000 / 2,000 | Pro | $0.0224 |
Con estas tarifas, un lote que clasifique 100.000 documentos con Flash cuesta aproximadamente $6, y 1 millón de turnos de chatbot cuesta aproximadamente $315. Fórmula que puedes ejecutar directamente:
# Kunavo Gemini 2.5 Flash 요율 (1M 토큰당 USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # 챗봇 한 턴 -> $0.000315
print(cost(8_000, 500)) # RAG 답변 한 건 -> $0.001095
print(cost(500, 20) * 100_000) # 10만 건 배치 -> ~$6.00Precios de Kunavo y pagos con Stripe
No hay suscripción ni proyecto de Google Cloud. Recarga el saldo (con Stripe o un método de pago local) y, al realizar llamadas, se descuenta del saldo según las tarifas por token indicadas arriba. Paga según consumo desde una recarga mínima de $10; el saldo no caduca y las recargas mayores reciben más créditos de bonificación. Un único saldo permite usar Gemini, Claude, GPT y modelos de imagen, vídeo y audio, entre otros, por lo que no necesitas conciliar facturas separadas de cada proveedor.
¿Qué modelo de Gemini debería elegir?
- Usa gemini-2-5-flash como opción predeterminada para chat, extracción, clasificación, resumen y la mayoría de los casos RAG. Es la opción de alto rendimiento más rápida y barata.
- gemini-3-1-pro: elígelo cuando Flash no ofrezca suficiente precisión: razonamiento de varios pasos, código, visión y contextos muy largos.
Un buen patrón es enrutar según la dificultad: procesa los casos habituales con Flash y asciende a Pro solo cuando falle la validación. Para consultar un patrón de enrutamiento implementado en código, ve a la guía de optimización de costes de AI.
Cómo reducir la factura de Gemini
- Baja de nivel. Envía el 80 % de los casos sencillos a Flash y reserva Pro para el 20 % más difícil.
- Limita la salida. Configura
max_tokensy secuencias de parada; la salida es la parte cara del medidor. - Reduce la entrada. No introduzcas toda la base de conocimientos en el contexto; recupera menos fragmentos RAG, pero de mayor calidad.
- Procesa por lotes. Agrupa llamadas independientes para reducir la latencia y evitar oleadas de reintentos.
Preguntas frecuentes
¿La API de Gemini es gratuita?
Google AI Studio ofrece un nivel gratuito para prototipos (con límites de solicitudes). En producción, se cobra por token. Kunavo funciona con pago según consumo desde una recarga mínima de $10: pagas por token según las tarifas siguientes, el saldo no caduca y no necesitas una cuenta de facturación de Google Cloud.
¿Cuánto cuesta Gemini 2.5 Flash?
En Kunavo, Gemini 2.5 Flash cuesta $0.09 por 1M de tokens de entrada y $0.75 por 1M de tokens de salida, aproximadamente un 70% menos que los precios oficiales de Google $0.30 / $2.50. Un turno habitual de chatbot (1K de entrada, 300 de salida) cuesta aproximadamente $0.0003.
¿Gemini es más barato que Claude o GPT?
Gemini 2.5 Flash es uno de los modelos de alto rendimiento más baratos disponibles y, para trabajos de gran volumen, cuesta menos que Claude Haiku y la mayoría de los niveles de GPT. Compara los precios y métodos de pago de Claude en Resumen de precios y pagos de Claude API y consulta la tabla completa en la página de precios.
¿Cómo puedo reducir el coste de la API de Gemini?
Baja de nivel a Flash, limita la salida, reduce el contexto de búsqueda y procesa por lotes. Encontrarás más detalles en la guía de optimización de costes. Para empezar a realizar llamadas a Gemini, consulta Cómo obtener una clave de API de Gemini.