Voltar aos guias
Preços·18 de junho de 2026·Atualizado em 12 de setembro de 2026·8 min de leitura

Preços da API do Gemini em 2026 — guia completo de tarifas da API do Gemini

O Gemini está entre as IAs de fronteira com melhor custo-benefício, e a Kunavo o oferece de 30 a 70% mais barato que o preço oficial do Google, dependendo do modelo. Reunimos em um só lugar as tarifas atuais por modelo, exemplos de custos verificáveis diretamente e a forma mais barata de fazer chamadas em produção.

O Gemini está entre as IAs de ponta com melhor custo-benefício, e a Kunavo o oferece por trás de uma única API compatível com OpenAI, cerca de 70% mais barato que os preços oficiais do Google. Este guia apresenta as tarifas atuais por modelo, exemplos de cálculo de custos que você pode verificar diretamente e como chamar o Gemini pelo menor custo em produção.

Preços do Gemini em um relance

As tarifas são os valores cobrados pela Kunavo, em USD por 1 milhão de tokens. A coluna “Preço oficial do Google” mostra as tarifas publicadas pelo Google para o mesmo modelo, para que a diferença possa ser vista de relance.

ModeloEntrada / 1MSaída / 1MPreço oficial do Google (entrada / saída)Percentual de economia
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

O Flash é o principal modelo para processamento em grande volume, enquanto o Pro é adequado para raciocínio mais difícil, visão e tarefas com contexto longo. Consulte sempre as tarifas em tempo real na página de preços e nas páginas de cada modelo (gemini-2-5-flash, gemini-3-1-pro).

Como funcionam os preços dos tokens do Gemini

Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado e mensagem do usuário) e pelos tokens de saída (o que o modelo gera). Como a saída é mais cara, o principal fator que determina sua cobrança do Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em valores equivalentes em tokens e cobrados pelo mesmo medidor.

Exemplos de cálculo de custos

São valores reais calculados com as tarifas do Gemini 2.5 Flash da Kunavo; apenas a última linha usa Gemini 3.1 Pro:

TarefaTokens (entrada / saída)ModeloCustos
Um turno de chatbot1,000 / 300Flash$0.0003
Resposta RAG8,000 / 500Flash$0.0011
Classificação em lote (por documento)500 / 20Flash$0.00006
Análise de contexto longo20,000 / 2,000Pro$0.0224

Com essas tarifas, um lote que classifique 100 mil documentos com Flash custa aproximadamente US$ 6, e 1 milhão de turnos de chatbot custa aproximadamente US$ 315. Fórmula que você pode executar diretamente:

gemini_cost.py
# Kunavo Gemini 2.5 Flash 요율 (1M 토큰당 USD)
IN_RATE, OUT_RATE = 0.09, 0.75

def cost(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(cost(1_000, 300))            # 챗봇 한 턴        -> $0.000315
print(cost(8_000, 500))            # RAG 답변 한 건    -> $0.001095
print(cost(500, 20) * 100_000)     # 10만 건 배치      -> ~$6.00

Preços da Kunavo e pagamentos pelo Stripe

Não há assinatura nem projeto do Google Cloud. Depois de carregar o saldo (pelo Stripe ou por um método de pagamento local), cada chamada desconta do saldo conforme as tarifas por token acima. Comece com uma recarga mínima de US$ 10, pague conforme o uso, o saldo não expira e recargas maiores recebem créditos bônus. Use todos os modelos — Gemini, Claude, GPT, imagem, vídeo, áudio e outros — com um único saldo, sem precisar conciliar faturas separadas de cada provedor.

Qual modelo Gemini devo escolher?

  • gemini-2-5-flash — use como padrão para chat, extração, classificação, resumo e a maioria dos casos de RAG. É a opção de alto desempenho mais rápida e barata.
  • gemini-3-1-pro — escolha quando a precisão do Flash não for suficiente: raciocínio em várias etapas, código, visão e contexto extremamente longo.

Um bom padrão é fazer o roteamento conforme a dificuldade: use Flash nos casos comuns e promova para Pro apenas quando a validação falhar. Consulte o guia de otimização de custos de IA para ver um padrão de roteamento implementado em código.

Reduzindo a cobrança do Gemini

  1. Use um modelo inferior. Envie os 80% fáceis para o Flash e reserve o Pro para os 20% difíceis.
  2. Limite a saída. Defina max_tokens e sequências de parada — a saída é o lado mais caro do medidor.
  3. Reduza a entrada. Não despeje toda a base de conhecimento no contexto; recupere chunks de RAG menores e melhores.
  4. Processe em lote. Agrupe chamadas independentes para reduzir a latência e evitar picos de novas tentativas.

Perguntas frequentes

A API Gemini é gratuita?

O Google AI Studio oferece um nível gratuito para prototipagem (com limite de solicitações). Em produção, a cobrança é por token. A Kunavo funciona no modelo de pagamento conforme o uso, a partir de uma recarga mínima de US$ 10: você paga por token de acordo com as tarifas abaixo, o saldo não expira e não é necessária uma conta de faturamento do Google Cloud.

Quanto custa o Gemini 2.5 Flash?

Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1 milhão de tokens de entrada e $0.75 por 1 milhão de tokens de saída, cerca de 70% menos que os preços oficiais do Google, $0.30 / $2.50. Um turno típico de chatbot (1K de entrada e 300 de saída) custa aproximadamente US$ 0,0003.

O Gemini é mais barato que Claude ou GPT?

O Gemini 2.5 Flash é um dos modelos de alto desempenho mais baratos disponíveis e, em tarefas de grande volume, custa menos que o Claude Haiku e a maioria dos modelos GPT. Compare os preços e formas de pagamento do Claude em Preços e pagamentos da API do Claude e veja a tabela completa na página de preços.

Como reduzir o custo da API do Gemini?

Use um modelo inferior com o Flash, limite a saída, reduza o contexto de pesquisa e processe em lote. Veja mais detalhes no guia de otimização de custos. Para começar a fazer chamadas ao Gemini, consulte Como obter uma chave da API do Gemini.