Voltar aos guias
Preço·10 de julho de 2026·Atualizado em 3 de outubro de 2026·8 min de leitura

Preços da API do Gemini 2026 — tarifas por modelo, exemplos e acesso mais barato

O Gemini oferece uma das melhores relações custo-benefício da IA de ponta. Veja as tarifas atuais por modelo — 30 a 70 % abaixo do preço de tabela do Google, conforme o modelo — com exemplos de custo e a forma mais barata de chamar o Gemini em produção.

O Gemini oferece uma das melhores relações custo-benefício entre as IAs de ponta, e o Kunavo o disponibiliza cerca de 70% abaixo do preço de tabela do Google por trás de uma única API compatível com a OpenAI. Este guia de preços da API do Gemini apresenta as tarifas atuais por modelo, exemplos de custo que você pode recalcular e a forma mais barata de chamar o Gemini em produção.

Preços do Gemini em resumo

As tarifas estão em USD por milhão de tokens, conforme cobradas pelo Kunavo. A coluna “preço do Google” é a tarifa publicada pelo Google para o mesmo modelo, para comparação direta.

ModeloEntrada / 1MSaída / 1MPreço do Google (entrada / saída)Economia
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70 %
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65 %

Flash é o modelo de trabalho para grandes volumes; Pro é para raciocínio mais difícil, visão e contexto longo. As tarifas atuais estão sempre na página de preços e em cada página de modelo (gemini-2-5-flash, gemini-3-1-pro).

Como funciona a cobrança por token do Gemini

Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado, mensagem do usuário) e pelos tokens de saída (o que o modelo gera). A saída é a parte cara: portanto, a maior alavanca em uma fatura do Gemini é a quantidade de texto que você deixa o modelo escrever. Imagens e áudio são convertidos em equivalentes de tokens e cobrados no mesmo contador.

Exemplos detalhados de custo

Números reais usando a tarifa do Gemini 2.5 Flash no Kunavo, exceto a última linha, que usa Gemini 3.1 Pro:

Carga de trabalhoTokens (entrada / saída)ModeloCusto
Turno de chatbot1 000 / 300Flash$0.0003
Resposta de RAG8 000 / 500Flash$0.0011
Classificação em lote (por documento)500 / 20Flash$0.00006
Análise de contexto longo20 000 / 2 000Pro$0.0224

Com essas tarifas, um lote de classificação de 100.000 documentos no Flash custa cerca de $6, e um milhão de turnos de chatbot custa cerca de $315. O cálculo, que pode ser executado, é:

gemini_cout.py
# Tarifs Kunavo pour Gemini 2.5 Flash (USD par 1M de tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def cout(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(cout(1_000, 300))            # un tour de chatbot     -> $0.000315
print(cout(8_000, 500))            # une réponse RAG        -> $0.001095
print(cout(500, 20) * 100_000)     # lot de 100k documents  -> ~$6.00

Preços do Kunavo e cobrança pela Stripe

Sem assinatura e sem projeto do Google Cloud. Você recarrega um saldo (cartão, Apple Pay, Google Pay, Link), e as chamadas são descontadas pelas tarifas por token acima. Pagamento conforme o uso a partir de uma recarga mínima de $10; o saldo nunca expira, e recargas maiores recebem crédito bônus. Os preços estão em USD e são convertidos para EUR pela Stripe no checkout (a taxa inclui de 2% a 4% de tarifa de conversão paga por você; pagar em USD evita essa tarifa); no B2B, aplica-se a autoliquidação com um número de IVA intracomunitário. Um único saldo cobre Gemini e todos os demais modelos — Claude, GPT, imagem, vídeo e áudio — sem necessidade de conciliar faturas de cada fornecedor.

Qual modelo Gemini escolher?

  • gemini-2-5-flash — a escolha padrão para chat, extração, classificação, resumo e a maior parte do RAG. Rápido e a opção capaz mais barata.
  • gemini-3-1-pro — quando o Flash não é preciso o suficiente: raciocínio em várias etapas, código, visão e contexto muito longo.

Um bom padrão é o roteamento por dificuldade: Flash por padrão e escalonamento para Pro somente quando uma verificação falhar. A abordagem em código está no guia de otimização de custos de IA.

Como reduzir sua fatura do Gemini

  1. Desça de categoria. Envie para o Flash os 80% de tarefas que são simples; reserve o Pro para os 20% difíceis.
  2. Limite a saída. Defina max_tokens e sequências de parada — a saída é a parte cara do contador.
  3. Reduza o input. Recupere menos chunks de RAG, porém mais relevantes, em vez de despejar toda a base de conhecimento no contexto.
  4. Agrupe. Coloque chamadas independentes em lotes para manter a latência baixa e evitar tempestades de novas tentativas.

A mesma chave também chama os modelos de vídeo do Google — o preço por clipe está detalhado em preço do Veo 3.

Perguntas frequentes

A API do Gemini é gratuita?

O Google AI Studio oferece um nível gratuito com limite de taxa para prototipagem. Em produção, você paga por token. O Kunavo funciona no modelo pay-as-you-go a partir de uma recarga mínima de $10 — você paga por token conforme as tarifas abaixo, o saldo nunca expira e não é necessária uma conta de faturamento do Google Cloud.

Quanto custa o Gemini 2.5 Flash?

No Kunavo, o Gemini 2.5 Flash custa $0.09 por 1 milhão de tokens de entrada e $0.75 por 1 milhão de tokens de saída — cerca de 70% abaixo do preço de tabela do Google ($0.30 / $2.50). Um turno típico de chatbot (1K de entrada, 300 de saída) custa cerca de $0.0003.

O Gemini é mais barato que Claude ou GPT?

O Gemini 2.5 Flash é um dos modelos capazes mais baratos do mercado — custa menos que o Claude Haiku e que a maioria dos tiers GPT em alto volume. Compare a tabela completa na página de preços e as tarifas do Claude no guia de preços da API do Claude.

Como reduzir o custo da API do Gemini?

Descer para o Flash, limitar a saída, usar um contexto recuperado menor e processar em lotes. Os detalhes estão no guia de otimização de custos. Para começar a chamar o Gemini, veja como obter uma chave de API do Gemini.