O Gemini é uma das melhores opções de preço/desempenho na IA de fronteira, e a Kunavo o oferece por cerca de %70 abaixo do preço de tabela do Google por trás de uma única API compatível com OpenAI. Este guia apresenta as tarifas atuais por modelo, exemplos de cálculos de custo que você pode verificar por conta própria e a forma mais barata de chamar o Gemini em produção.
Preços do Gemini em um relance
As tarifas são por 1M de tokens e em USD, conforme cobradas na Kunavo. A coluna “Preço de tabela do Google” mostra a tarifa publicada pelo Google para o mesmo modelo, para que você possa ver a diferença.
| Modelo | Entrada / 1M | Saída / 1M | Preço de tabela do Google (entrada / saída) | Economia |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~%70 |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~%65 |
O Flash é indicado para cargas de alto volume; o Pro é para raciocínio mais difícil, visão e contexto longo. As tarifas atuais aparecem sempre na página de preços e na página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Como funciona a cobrança por tokens do Gemini
Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado e mensagem do usuário) e pelos tokens de saída (o que o modelo gera). A saída é a parte mais cara; por isso, o maior fator individual na sua conta Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em equivalentes de tokens e cobrados pelo mesmo contador.
Exemplos de cálculos de custo
Números reais usando a tarifa do Gemini 2.5 Flash da Kunavo, exceto a última linha, que usa Gemini 3.1 Pro:
| Carga de trabalho | Tokens (entrada / saída) | Modelo | Custo |
|---|---|---|---|
| Rodada de conversa | 1.000 / 300 | Flash | $0.0003 |
| Resposta RAG | 8.000 / 500 | Flash | $0.0011 |
| Classificação em lote (por documento) | 500 / 20 | Flash | $0.00006 |
| Análise de contexto longo | 20.000 / 2.000 | Pro | $0.0224 |
Com essas tarifas, um lote de classificação de 100.000 documentos no Flash custa aproximadamente $6, e um milhão de rodadas de conversa custa aproximadamente $315. Matemática executável:
# Kunavo Gemini 2.5 Flash oranları (1M token başına USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # bir sohbet turu -> $0.000315
print(cost(8_000, 500)) # bir RAG yanıtı -> $0.001095
print(cost(500, 20) * 100_000) # 100k belge yığını -> ~$6.00Preços da Kunavo e cobrança da Stripe
Não há assinatura nem projeto do Google Cloud. Você adiciona saldo (via Stripe ou métodos de pagamento locais), e as chamadas são descontadas desse saldo pelas tarifas por token acima. O modelo pay-as-you-go começa com uma recarga mínima de $10; o saldo nunca expira e recargas maiores recebem créditos bônus. Um único saldo cobre Gemini e todos os outros modelos — Claude, GPT, imagem, vídeo e áudio — para que você não precise conciliar uma fatura separada por provedor.
Qual modelo Gemini devo escolher?
- gemini-2-5-flash — padrão para conversa, extração, classificação, resumo e a maioria dos casos de RAG. Opção rápida e mais barata entre os modelos capazes.
- gemini-3-1-pro — use quando o Flash não for preciso o suficiente: raciocínio em várias etapas, código, visão e contexto muito longo.
Um bom padrão é direcionar pelo nível de dificuldade: Flash para o caso comum e upgrade para Pro quando uma verificação falhar. Para o padrão de roteamento no código, consulte o guia de otimização de custos de IA.
Como reduzir sua conta do Gemini
- Desça de camada. Envie os 80% fáceis para o Flash; reserve o Pro para os 20% difíceis.
- Limite a saída. Configure
max_tokense sequências de parada — a saída é a parte cara do contador. - Reduza a entrada. Recupere menos trechos de RAG, mas melhores, em vez de preencher o contexto com toda a base de conhecimento.
- Processe em lotes. Agrupe chamadas independentes para manter a latência baixa e evitar tempestades de novas tentativas.
Perguntas frequentes
A API do Gemini é gratuita?
O Google AI Studio oferece uma camada gratuita limitada por velocidade para prototipagem. Para produção, você paga por token. A Kunavo funciona no modelo pay-as-you-go, com recarga mínima de $10 — você paga por token pelas tarifas abaixo, o saldo nunca expira e não é necessária uma conta de faturamento do Google Cloud.
Quanto custa o Gemini 2.5 Flash?
Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1M de tokens de entrada e $0.75 por 1M de tokens de saída — cerca de %70 abaixo do preço de tabela do Google de $0.30 / $2.50. Uma rodada de conversa típica (1K de entrada, 300 de saída) custa aproximadamente $0.0003.
O Gemini é mais barato que Claude ou GPT?
O Gemini 2.5 Flash é um dos modelos capazes mais baratos disponíveis — fica abaixo do Claude Haiku e da maioria das camadas GPT em cargas de alto volume. Compare a tabela completa na página de preços.
Como reduzo o custo da API Gemini?
Mude para o Flash, limite a saída, reduza o contexto recuperado e processe em lotes. Os detalhes estão no guia de otimização de custos. Para começar a chamar o Gemini, consulte o guia como obter uma chave da API Gemini.