Volver a las guías
Precios·18 de junio de 2026·Actualizado el 12 de septiembre de 2026·8 min de lectura

Precios de la API de Gemini 2026: tarifas por modelo, aproximadamente un 70% por debajo de la tarifa de Google

Precios actuales de la API de Gemini por modelo, ejemplos de costes calculados para que puedas verificarlos y la forma más económica de llamar a Gemini en producción: aproximadamente un 70% por debajo de la tarifa de Google mediante una API compatible con OpenAI.

Gemini ofrece una de las mejores relaciones calidad-precio de la IA avanzada, y Kunavo lo ofrece aproximadamente un 70% por debajo del precio de lista de Google mediante una única API compatible con OpenAI. Esta guía de precios de la API de Gemini indica las tarifas actuales por modelo, proporciona ejemplos de costes que puedes recalcular y muestra la forma más económica de invocar Gemini en producción.

Precios de Gemini de un vistazo

Las tarifas se aplican por 1M de tokens en USD, tal como los factura Kunavo. La columna «Lista de Google» muestra la tarifa publicada por Google para el mismo modelo, para que puedas ver la diferencia.

ModeloEntrada / 1MSalida / 1MLista de Google (entrada / salida)Ahorro
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

Flash es el caballo de batalla para grandes volúmenes; Pro está pensado para razonamiento más difícil, visión y tareas con contexto largo. Las tarifas actuales están siempre en la página de precios y en la página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).

Cómo funciona el precio por token de Gemini

Pagas por los tokens de entrada (todo lo que envías: prompt del sistema, contexto recuperado y mensaje del usuario) y por los tokens de salida (lo que genera el modelo). La salida es la parte más cara, por lo que el mayor factor de una factura de Gemini es cuánto texto permites que escriba el modelo. Las imágenes y el audio se convierten en equivalentes de tokens y se facturan mediante el mismo contador.

Ejemplos de costes calculados

Cifras reales basadas en la tarifa de Gemini 2.5 Flash de Kunavo, salvo la última línea, que utiliza Gemini 3.1 Pro:

Carga de trabajoTokens (entrada / salida)ModeloCoste
Turno de chatbot1.000 / 300Flash$0.0003
Respuesta RAG8.000 / 500Flash$0.0011
Clasificación por lotes (por documento)500 / 20Flash$0.00006
Análisis con contexto largo20.000 / 2.000Pro$0.0224

Con estas tarifas, un lote de clasificación de 100.000 documentos en Flash cuesta aproximadamente $6, y un millón de turnos de chatbot, aproximadamente $315. El cálculo, listo para ejecutar:

gemini_kosten.py
# Kunavo-Tarife für Gemini 2.5 Flash (USD pro 1M Tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def kosten(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(kosten(1_000, 300))            # ein Chatbot-Turn      -> $0.000315
print(kosten(8_000, 500))            # eine RAG-Antwort       -> $0.001095
print(kosten(500, 20) * 100_000)     # Batch mit 100k Docs    -> ~$6.00

Precios de Kunavo y facturación mediante Stripe

No hay suscripción ni proyecto de Google Cloud. Recargas saldo (mediante Stripe o métodos de pago locales) y las llamadas se descuentan de él según las tarifas por token anteriores. Pago por uso a partir de una recarga mínima de $10; el saldo nunca caduca y las recargas mayores incluyen saldo adicional. Un mismo saldo cubre Gemini y cualquier otro modelo —Claude, GPT, imagen, vídeo y audio—, así que no tienes que conciliar una factura separada por proveedor.

¿Qué modelo de Gemini debería elegir?

  • gemini-2-5-flash: opción predeterminada para chat, extracción, clasificación, resumen y la mayor parte de RAG. Es rápido y la opción potente más barata.
  • gemini-3-1-pro: elígelo cuando Flash no sea suficientemente preciso: razonamiento de varios pasos, código, visión y contexto muy largo.

Un buen patrón es enrutar según la dificultad: Flash para el caso normal y escalar a Pro solo cuando falle una comprobación. La guía de optimización de costes de IA muestra el enfoque de enrutamiento en código.

Cómo reducir tu factura de Gemini

  1. Cambia a un modelo inferior. Envía el 80 % sencillo a Flash y reserva Pro para el 20 % difícil.
  2. Limita la salida. Configura max_tokens y secuencias de parada: la salida es la parte cara del contador.
  3. Reduce la entrada. Recupera menos fragmentos RAG, pero de mayor calidad, en lugar de introducir toda la base de conocimiento en el contexto.
  4. Procesa por lotes. Agrupa llamadas independientes para mantener baja la latencia y evitar oleadas de reintentos.

La misma clave también invoca los modelos de vídeo de Google. Los costes por clip están en Costes de Veo 3 y la comparación con OpenAI, en Costes de la API de OpenAI.

Preguntas frecuentes

¿La API de Gemini es gratuita?

Google AI Studio ofrece un nivel gratuito con límites de frecuencia para crear prototipos. En producción pagas por token. Kunavo funciona con pago por uso a partir de una recarga mínima de $10: pagas por token según las tarifas indicadas abajo, el saldo nunca caduca y no necesitas una cuenta de facturación de Google Cloud.

¿Cuánto cuesta Gemini 2.5 Flash?

En Kunavo, Gemini 2.5 Flash cuesta $0.09 por 1M de tokens de entrada y $0.75 por 1M de tokens de salida, aproximadamente un 70% por debajo del precio de lista de Google de $0.30 / $2.50. Un turno típico de chatbot (1K de entrada, 300 de salida) cuesta aproximadamente $0.0003.

¿Gemini es más barato que Claude o GPT?

Gemini 2.5 Flash se encuentra entre los modelos potentes más baratos disponibles, por debajo de Claude Haiku y de la mayoría de los niveles de GPT para grandes volúmenes. Consulta la tabla completa en la página de precios.

¿Cómo reduzco los costes de la API de Gemini?

Cambia a Flash, limita la salida, reduce el contexto recuperado y procesa por lotes. Consulta los detalles en la guía de optimización de costes. Para empezar a llamar a Gemini, consulta cómo crear una clave de API de Gemini.