Voltar aos guias
Preços·18 de junho de 2026·Atualizado em 12 de setembro de 2026·8 min de leitura

Preços da API do Gemini 2026 — custo por modelo, exemplos e acesso compatível com OpenAI mais barato

O Gemini está entre os modelos de IA de ponta com melhor valor. Veja as tarifas atuais por modelo — cerca de 70% abaixo da tabela do Google — com exemplos de custo e a forma mais barata de chamar o Gemini em produção.

O Gemini está entre as opções de melhor custo-benefício entre as principais IAs, e a Kunavo o disponibiliza por cerca de 70% abaixo do preço de tabela oficial do Google, por trás de uma única API compatível com OpenAI. Este guia apresenta as tarifas atuais por modelo, exemplos de custos que você pode verificar por conta própria e a maneira mais barata de chamar o Gemini em produção.

Preços da API do Gemini em resumo

As tarifas são calculadas por 1 milhão de tokens, em USD, conforme cobradas pela Kunavo. A coluna “Tabela do Google” mostra a tarifa oficial publicada pelo Google para o mesmo modelo, para que você veja a diferença.

ModeloEntrada / 1 milhãoSaída / 1 milhãoTabela do Google (entrada / saída)Sua economia
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

O Flash é o cavalo de batalha para alto volume; o Pro é para raciocínio mais pesado, visão e tarefas com contexto longo. As tarifas diretas estão sempre na página de preços e na página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).

Como funciona o preço por token do Gemini

Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto dos resultados de busca, mensagens do usuário) e pelos tokens de saída (o que o modelo gera). A saída é o lado mais caro, então o maior fator na conta do Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em equivalentes de tokens e cobrados pelo mesmo medidor.

Exemplo de cálculo de custos

Números reais com as tarifas do Gemini 2.5 Flash da Kunavo, exceto a última linha, que usa Gemini 3.1 Pro:

Carga de trabalhoTokens (entrada / saída)ModeloCusto
Rodada de chatbot1.000 / 300Flash$0.0003
Resposta RAG8.000 / 500Flash$0.0011
Classificação em batch (por documento)500 / 20Flash$0.00006
Análise de contexto longo20.000 / 2.000Pro$0.0224

Com essas tarifas, um batch de classificação de 100.000 documentos no Flash custa cerca de $6, e um milhão de rodadas de chatbot custa cerca de $315. O cálculo, pronto para ser executado:

gemini_biaya.py
# Tarif Kunavo untuk Gemini 2.5 Flash (USD per 1J token)
IN_RATE, OUT_RATE = 0.09, 0.75

def biaya(token_masuk: int, token_keluar: int) -> float:
    return token_masuk / 1_000_000 * IN_RATE + token_keluar / 1_000_000 * OUT_RATE

print(biaya(1_000, 300))            # satu putaran chatbot      -> $0.000315
print(biaya(8_000, 500))            # satu jawaban RAG          -> $0.001095
print(biaya(500, 20) * 100_000)     # batch 100rb dokumen       -> ~$6.00

Preços da Kunavo e cobrança via Stripe

Não há assinatura nem projeto do Google Cloud. Você adiciona saldo à carteira (Stripe ou método de pagamento local), e cada chamada desconta desse saldo usando as tarifas por token acima. O pagamento conforme o uso começa com um depósito mínimo de $10, o saldo nunca expira e depósitos maiores recebem créditos de bônus. Uma única carteira cobre o Gemini e todos os outros modelos — Claude, GPT, imagens, vídeo e áudio — para que você não precise reconciliar cobranças separadas por provedor.

Qual modelo Gemini devo escolher?

  • gemini-2-5-flash — padrão para chat, extração, classificação, resumo e a maior parte do RAG. Rápido e a opção avançada mais barata.
  • gemini-3-1-pro — use quando o Flash não for preciso o suficiente: raciocínio em várias etapas, código, visão e contexto extremamente longo.

Um bom padrão é roteirizar com base no nível de dificuldade: Flash para casos comuns, com upgrade para Pro apenas quando uma verificação falhar. Consulte o guia de otimização de custos de IA para ver padrões de roteamento no código.

Como reduzir sua conta do Gemini

  1. Desça de nível. Envie 80% dos casos fáceis para o Flash; reserve o Pro para os 20% difíceis.
  2. Limite a saída. Defina max_tokens e uma sequência de parada — a saída é o lado caro do medidor.
  3. Reduza as entradas. Recupere trechos de RAG menos numerosos, porém melhores, em vez de enfiar toda a base de conhecimento no contexto.
  4. Faça batch. Combine chamadas independentes para manter a latência baixa e evitar tempestades de retry.

Perguntas frequentes

A API do Gemini é gratuita?

O Google AI Studio tem um nível gratuito com limite de taxa, adequado para protótipos. Na produção, você paga por token. A Kunavo oferece pagamento conforme o uso a partir de um depósito mínimo de $10 — você paga por token pelas tarifas abaixo, o saldo nunca expira e não precisa de uma conta de faturamento do Google Cloud.

Quanto custa o Gemini 2.5 Flash?

Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1 milhão de tokens de entrada e $0.75 por 1 milhão de tokens de saída — cerca de 70% abaixo do preço de tabela oficial do Google de $0.30 / $2.50. Uma rodada comum de chatbot (1 mil tokens de entrada, 300 de saída) custa cerca de $0.0003.

O Gemini é mais barato que Claude ou GPT?

O Gemini 2.5 Flash é um dos modelos avançados mais baratos disponíveis — abaixo do Claude Haiku e da maioria dos níveis do GPT para cargas de trabalho de alto volume. Compare a tabela completa na página de preços.

Como reduzir os custos da API do Gemini?

Use o Flash, limite a saída, reduza o contexto dos resultados de busca e faça batch. Os detalhes estão no guia de otimização de custos. Para começar a chamar o Gemini, consulte como obter uma chave de API do Gemini.