O Gemini oferece uma das melhores relações custo-benefício entre as IAs de ponta, e o Kunavo o disponibiliza cerca de 70% abaixo do preço de tabela do Google por trás de uma única API compatível com a OpenAI. Este guia de preços da API do Gemini apresenta as tarifas atuais por modelo, exemplos de custo que você pode recalcular e a forma mais barata de chamar o Gemini em produção.
Preços do Gemini em resumo
As tarifas estão em USD por milhão de tokens, conforme cobradas pelo Kunavo. A coluna “preço do Google” é a tarifa publicada pelo Google para o mesmo modelo, para comparação direta.
| Modelo | Entrada / 1M | Saída / 1M | Preço do Google (entrada / saída) | Economia |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70 % |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65 % |
Flash é o modelo de trabalho para grandes volumes; Pro é para raciocínio mais difícil, visão e contexto longo. As tarifas atuais estão sempre na página de preços e em cada página de modelo (gemini-2-5-flash, gemini-3-1-pro).
Como funciona a cobrança por token do Gemini
Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado, mensagem do usuário) e pelos tokens de saída (o que o modelo gera). A saída é a parte cara: portanto, a maior alavanca em uma fatura do Gemini é a quantidade de texto que você deixa o modelo escrever. Imagens e áudio são convertidos em equivalentes de tokens e cobrados no mesmo contador.
Exemplos detalhados de custo
Números reais usando a tarifa do Gemini 2.5 Flash no Kunavo, exceto a última linha, que usa Gemini 3.1 Pro:
| Carga de trabalho | Tokens (entrada / saída) | Modelo | Custo |
|---|---|---|---|
| Turno de chatbot | 1 000 / 300 | Flash | $0.0003 |
| Resposta de RAG | 8 000 / 500 | Flash | $0.0011 |
| Classificação em lote (por documento) | 500 / 20 | Flash | $0.00006 |
| Análise de contexto longo | 20 000 / 2 000 | Pro | $0.0224 |
Com essas tarifas, um lote de classificação de 100.000 documentos no Flash custa cerca de $6, e um milhão de turnos de chatbot custa cerca de $315. O cálculo, que pode ser executado, é:
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def cout(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cout(1_000, 300)) # un tour de chatbot -> $0.000315
print(cout(8_000, 500)) # une réponse RAG -> $0.001095
print(cout(500, 20) * 100_000) # lot de 100k documents -> ~$6.00Preços do Kunavo e cobrança pela Stripe
Sem assinatura e sem projeto do Google Cloud. Você recarrega um saldo (cartão, Apple Pay, Google Pay, Link), e as chamadas são descontadas pelas tarifas por token acima. Pagamento conforme o uso a partir de uma recarga mínima de $10; o saldo nunca expira, e recargas maiores recebem crédito bônus. Os preços estão em USD e são convertidos para EUR pela Stripe no checkout (a taxa inclui de 2% a 4% de tarifa de conversão paga por você; pagar em USD evita essa tarifa); no B2B, aplica-se a autoliquidação com um número de IVA intracomunitário. Um único saldo cobre Gemini e todos os demais modelos — Claude, GPT, imagem, vídeo e áudio — sem necessidade de conciliar faturas de cada fornecedor.
Qual modelo Gemini escolher?
- gemini-2-5-flash — a escolha padrão para chat, extração, classificação, resumo e a maior parte do RAG. Rápido e a opção capaz mais barata.
- gemini-3-1-pro — quando o Flash não é preciso o suficiente: raciocínio em várias etapas, código, visão e contexto muito longo.
Um bom padrão é o roteamento por dificuldade: Flash por padrão e escalonamento para Pro somente quando uma verificação falhar. A abordagem em código está no guia de otimização de custos de IA.
Como reduzir sua fatura do Gemini
- Desça de categoria. Envie para o Flash os 80% de tarefas que são simples; reserve o Pro para os 20% difíceis.
- Limite a saída. Defina
max_tokense sequências de parada — a saída é a parte cara do contador. - Reduza o input. Recupere menos chunks de RAG, porém mais relevantes, em vez de despejar toda a base de conhecimento no contexto.
- Agrupe. Coloque chamadas independentes em lotes para manter a latência baixa e evitar tempestades de novas tentativas.
A mesma chave também chama os modelos de vídeo do Google — o preço por clipe está detalhado em preço do Veo 3.
Perguntas frequentes
A API do Gemini é gratuita?
O Google AI Studio oferece um nível gratuito com limite de taxa para prototipagem. Em produção, você paga por token. O Kunavo funciona no modelo pay-as-you-go a partir de uma recarga mínima de $10 — você paga por token conforme as tarifas abaixo, o saldo nunca expira e não é necessária uma conta de faturamento do Google Cloud.
Quanto custa o Gemini 2.5 Flash?
No Kunavo, o Gemini 2.5 Flash custa $0.09 por 1 milhão de tokens de entrada e $0.75 por 1 milhão de tokens de saída — cerca de 70% abaixo do preço de tabela do Google ($0.30 / $2.50). Um turno típico de chatbot (1K de entrada, 300 de saída) custa cerca de $0.0003.
O Gemini é mais barato que Claude ou GPT?
O Gemini 2.5 Flash é um dos modelos capazes mais baratos do mercado — custa menos que o Claude Haiku e que a maioria dos tiers GPT em alto volume. Compare a tabela completa na página de preços e as tarifas do Claude no guia de preços da API do Claude.
Como reduzir o custo da API do Gemini?
Descer para o Flash, limitar a saída, usar um contexto recuperado menor e processar em lotes. Os detalhes estão no guia de otimização de custos. Para começar a chamar o Gemini, veja como obter uma chave de API do Gemini.