Gemini se encuentra entre las mejores opciones de valor de la IA frontier, y Kunavo le pone un precio aproximadamente un 70% por debajo del precio oficial de Google mediante una única API compatible con OpenAI. Esta guía ofrece los precios actuales por modelo, ejemplos de costes que puede verificar por sí mismo y la forma más barata de llamar a Gemini en producción.
Precios de la API de Gemini de un vistazo
Precios por cada millón de tokens, en USD, tal como se calculan en Kunavo. La columna «Precio de lista de Google» muestra el precio publicado por Google para el mismo modelo, para que pueda ver la diferencia.
| Modelo | Entrada / millón | Salida / millón | Precio de lista de Google (entrada / salida) | Ahorro |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
Flash es el caballo de batalla para grandes volúmenes; Pro está pensado para razonamiento más difícil, visión y tareas de contexto largo. Los precios directos siempre aparecen en la página de precios y en la página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Cómo funciona el precio por token de Gemini
Paga por los tokens de entrada (todo lo que envía: prompt del sistema, contexto recuperado y mensajes del usuario) y los tokens de salida (lo que genera el modelo). La salida es la parte más cara, por lo que la mayor palanca sobre su factura de Gemini es cuánto texto deja escribir al modelo. Las imágenes y el audio se convierten en tokens equivalentes y se cobran con el mismo contador.
Ejemplos de costes precalculados
Cifras reales según los precios de Gemini 2.5 Flash de Kunavo; la última fila usa Gemini 3.1 Pro:
| Carga de trabajo | Tokens (entrada / salida) | Modelo | Coste |
|---|---|---|---|
| Interacción de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Respuesta RAG | 8.000 / 500 | Flash | $0.0011 |
| Clasificación por lotes (por documento) | 500 / 20 | Flash | $0.00006 |
| Análisis de contexto largo | 20.000 / 2.000 | Pro | $0.0224 |
Con esos precios, un lote de clasificación de 100.000 documentos en Flash cuesta aproximadamente $6, y un millón de interacciones de chatbot, aproximadamente $315. El cálculo, listo para ejecutar:
# Mức giá Kunavo cho Gemini 2.5 Flash (USD trên mỗi 1 triệu token)
IN_RATE, OUT_RATE = 0.09, 0.75
def chi_phi(token_vao: int, token_ra: int) -> float:
return token_vao / 1_000_000 * IN_RATE + token_ra / 1_000_000 * OUT_RATE
print(chi_phi(1_000, 300)) # một lượt chatbot -> $0.000315
print(chi_phi(8_000, 500)) # một câu trả lời RAG -> $0.001095
print(chi_phi(500, 20) * 100_000) # lô 100k tài liệu -> ~$6.00Precios de Kunavo y pagos mediante Stripe
No hay suscripciones ni proyectos de Google Cloud. Recarga el saldo de su cartera (Stripe o métodos de pago locales) y cada llamada lo descuenta según las tarifas por token anteriores. Paga por uso desde una recarga mínima de $10, el saldo nunca caduca y las recargas mayores reciben crédito adicional. Una sola cartera cubre Gemini y todos los demás modelos —Claude, GPT, imagen, vídeo y audio—, por lo que no tiene que conciliar una factura separada para cada proveedor.
¿Qué modelo de Gemini debería elegir?
- gemini-2-5-flash: la opción predeterminada para chat, extracción, clasificación, resúmenes y la mayoría de RAG. Es rápido y la opción suficientemente capaz más barata.
- gemini-3-1-pro: úselo cuando Flash no sea suficientemente preciso: razonamiento de varios pasos, programación, visión y contextos muy largos.
Un buen patrón es enrutar según la dificultad: Flash para los casos habituales y subir a Pro solo cuando falle una comprobación. Consulte la guía de optimización de costes de IA para ver el patrón de enrutamiento en código.
Cómo reducir su factura de Gemini
- Baje de nivel. Envíe el 80 % de los casos sencillos a Flash y reserve Pro para el 20 % difícil.
- Limite la salida. Configure
max_tokensy una secuencia de parada; la salida es la parte cara del contador. - Reduzca la entrada. Recupere menos fragmentos RAG, pero de mayor calidad, en vez de introducir toda la base de conocimientos en el contexto.
- Agrupe por lotes. Agrupe las llamadas independientes para mantener baja la latencia y evitar tormentas de reintentos.
Preguntas frecuentes
¿La API de Gemini es gratuita?
Google AI Studio ofrece un nivel gratuito con límites de velocidad, adecuado para crear prototipos. En producción se paga por token. Kunavo funciona con pago por uso desde una recarga mínima de $10: paga por token según las tarifas siguientes, el saldo nunca caduca y no necesita una cuenta de facturación de Google Cloud.
¿Cuánto cuesta Gemini 2.5 Flash?
En Kunavo, Gemini 2.5 Flash cuesta $0.09 por cada millón de tokens de entrada y $0.75 por cada millón de tokens de salida, aproximadamente un 70% menos que el precio oficial de Google de $0.30 / $2.50. Una interacción habitual de chatbot (1K de entrada, 300 de salida) cuesta aproximadamente $0.0003.
¿Gemini es más barato que Claude o GPT?
Gemini 2.5 Flash es uno de los modelos suficientemente capaces más baratos disponibles, por debajo de Claude Haiku y de la mayoría de los niveles de GPT para grandes volúmenes. Compare la tabla completa en la página de precios.
¿Cómo puedo reducir el coste de la API de Gemini?
Baje a Flash, limite la salida, reduzca el contexto recuperado y agrupe las solicitudes. Consulte los detalles en la guía de optimización de costes. Para empezar a llamar a Gemini, consulte cómo obtener una clave de API de Gemini.