O Gemini oferece uma das melhores relações custo-benefício da IA de ponta, e a Kunavo o disponibiliza cerca de 70% abaixo do preço de tabela do Google por trás de uma única API compatível com a OpenAI. Este guia de preços da Gemini API apresenta as tarifas atuais por modelo, fornece exemplos de custos verificáveis e mostra a maneira mais barata de chamar o Gemini em produção.
Preços do Gemini em resumo
As tarifas são por 1M de tokens em USD, conforme cobradas pela Kunavo. A coluna “Preço do Google” mostra a tarifa publicada pelo Google para o mesmo modelo, para que você veja a diferença.
| Modelo | Entrada / 1M | Saída / 1M | Preço do Google (entrada / saída) | Sua economia |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
O Flash é o modelo de trabalho para grandes volumes; o Pro é para raciocínio mais difícil, visão e tarefas com contexto longo. As tarifas atuais estão sempre na página de preços e na página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Como funciona a cobrança por tokens do Gemini
Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado, mensagem do usuário) e pelos tokens de saída (o que o modelo gera). A saída é a parte mais cara, por isso o maior fator em uma fatura do Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em equivalentes de tokens e cobrados no mesmo contador.
Exemplos de custos calculados
Números reais com a tarifa do Gemini 2.5 Flash da Kunavo, exceto a última linha, que usa Gemini 3.1 Pro:
| Carga de trabalho | Tokens (entrada / saída) | Modelo | Custos |
|---|---|---|---|
| Interação de chatbot | 1.000 / 300 | Flash | $0.0003 |
| Resposta de RAG | 8.000 / 500 | Flash | $0.0011 |
| Classificação em lote (por documento) | 500 / 20 | Flash | $0.00006 |
| Análise com contexto longo | 20.000 / 2.000 | Pro | $0.0224 |
Com essas tarifas, um lote de classificação de 100.000 documentos no Flash custa cerca de $6, e um milhão de interações de chatbot custa cerca de $315. O cálculo, pronto para executar:
# Kunavo-Tarife für Gemini 2.5 Flash (USD pro 1M Tokens)
IN_RATE, OUT_RATE = 0.09, 0.75
def kosten(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(kosten(1_000, 300)) # ein Chatbot-Turn -> $0.000315
print(kosten(8_000, 500)) # eine RAG-Antwort -> $0.001095
print(kosten(500, 20) * 100_000) # Batch mit 100k Docs -> ~$6.00Preços da Kunavo e faturamento pelo Stripe
Não há assinatura nem projeto do Google Cloud. Você adiciona crédito (via Stripe ou métodos de pagamento locais), e as chamadas são descontadas desse saldo conforme as tarifas de tokens acima. Pay-as-you-go a partir de uma recarga mínima de $10; o crédito nunca expira, e recargas maiores oferecem crédito bônus. Um saldo cobre o Gemini e qualquer outro modelo — Claude, GPT, imagem, vídeo e áudio — para que você não precise conciliar uma fatura separada por provedor.
Qual modelo Gemini devo escolher?
- gemini-2-5-flash — padrão para chat, extração, classificação, resumo e a maior parte de RAG. Rápido e a opção avançada mais barata.
- gemini-3-1-pro — escolha-o quando o Flash não for preciso o suficiente: raciocínio em várias etapas, código, visão e contexto muito longo.
Um bom padrão é rotear por dificuldade: Flash no caso normal e fazer upgrade para Pro apenas quando uma verificação falhar. O guia de otimização de custos de IA mostra a abordagem de roteamento no código.
Como reduzir sua fatura do Gemini
- Faça downgrade. Envie os 80% simples para o Flash; reserve o Pro para os 20% difíceis.
- Limite a saída. Defina
max_tokense sequências de parada — a saída é a parte cara do contador. - Reduza a entrada. Recupere menos chunks de RAG, mas melhores, em vez de colocar toda a base de conhecimento no contexto.
- Use processamento em lote. Agrupe chamadas independentes para manter a latência baixa e evitar tempestades de novas tentativas.
A mesma chave também chama os modelos de vídeo do Google — os custos por clipe estão em Custos do Veo 3, e a comparação com a OpenAI em Custos da OpenAI API.
Perguntas frequentes
A Gemini API é gratuita?
O Google AI Studio oferece um nível gratuito com limite de taxa para prototipagem. Em produção, você paga por token. A Kunavo funciona no modelo pay-as-you-go a partir de uma recarga mínima de $10 — você paga por token conforme as tarifas abaixo, o crédito nunca expira e não é necessária uma conta de faturamento do Google Cloud.
Quanto custa o Gemini 2.5 Flash?
Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1M de tokens de entrada e $0.75 por 1M de tokens de saída — cerca de 70% abaixo do preço de tabela do Google de $0.30 / $2.50. Uma interação típica de chatbot (1K de entrada, 300 de saída) custa cerca de $0.0003.
O Gemini é mais barato que Claude ou GPT?
O Gemini 2.5 Flash está entre os modelos avançados mais baratos disponíveis — abaixo do Claude Haiku e da maioria dos níveis GPT em grandes volumes. Compare a tabela completa na página de preços.
Como reduzo os custos da Gemini API?
Faça downgrade para o Flash, limite a saída, reduza o contexto recuperado e use processamento em lote. Veja os detalhes no guia de otimização de custos. Para começar a chamar o Gemini, leia como criar uma chave da Gemini API.