Voltar aos guias
Preços·18 de junho de 2026·Atualizado em 12 de setembro de 2026·8 min de leitura

Preços da API do Gemini 2026 — tarifas por modelo, cerca de 70% abaixo da tabela do Google

Preços atuais da API do Gemini por modelo, exemplos de custo verificáveis e a forma mais barata de chamar o Gemini em produção — cerca de 70% abaixo da tabela do Google por trás de uma API compatível com OpenAI.

O Gemini oferece uma das melhores relações custo-benefício da IA de ponta, e a Kunavo o disponibiliza cerca de 70% abaixo do preço de tabela do Google por trás de uma única API compatível com a OpenAI. Este guia de preços da Gemini API apresenta as tarifas atuais por modelo, fornece exemplos de custos verificáveis e mostra a maneira mais barata de chamar o Gemini em produção.

Preços do Gemini em resumo

As tarifas são por 1M de tokens em USD, conforme cobradas pela Kunavo. A coluna “Preço do Google” mostra a tarifa publicada pelo Google para o mesmo modelo, para que você veja a diferença.

ModeloEntrada / 1MSaída / 1MPreço do Google (entrada / saída)Sua economia
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

O Flash é o modelo de trabalho para grandes volumes; o Pro é para raciocínio mais difícil, visão e tarefas com contexto longo. As tarifas atuais estão sempre na página de preços e na página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).

Como funciona a cobrança por tokens do Gemini

Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado, mensagem do usuário) e pelos tokens de saída (o que o modelo gera). A saída é a parte mais cara, por isso o maior fator em uma fatura do Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em equivalentes de tokens e cobrados no mesmo contador.

Exemplos de custos calculados

Números reais com a tarifa do Gemini 2.5 Flash da Kunavo, exceto a última linha, que usa Gemini 3.1 Pro:

Carga de trabalhoTokens (entrada / saída)ModeloCustos
Interação de chatbot1.000 / 300Flash$0.0003
Resposta de RAG8.000 / 500Flash$0.0011
Classificação em lote (por documento)500 / 20Flash$0.00006
Análise com contexto longo20.000 / 2.000Pro$0.0224

Com essas tarifas, um lote de classificação de 100.000 documentos no Flash custa cerca de $6, e um milhão de interações de chatbot custa cerca de $315. O cálculo, pronto para executar:

gemini_kosten.py
# Kunavo-Tarife für Gemini 2.5 Flash (USD pro 1M Tokens)
IN_RATE, OUT_RATE = 0.09, 0.75

def kosten(in_tokens: int, out_tokens: int) -> float:
    return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE

print(kosten(1_000, 300))            # ein Chatbot-Turn      -> $0.000315
print(kosten(8_000, 500))            # eine RAG-Antwort       -> $0.001095
print(kosten(500, 20) * 100_000)     # Batch mit 100k Docs    -> ~$6.00

Preços da Kunavo e faturamento pelo Stripe

Não há assinatura nem projeto do Google Cloud. Você adiciona crédito (via Stripe ou métodos de pagamento locais), e as chamadas são descontadas desse saldo conforme as tarifas de tokens acima. Pay-as-you-go a partir de uma recarga mínima de $10; o crédito nunca expira, e recargas maiores oferecem crédito bônus. Um saldo cobre o Gemini e qualquer outro modelo — Claude, GPT, imagem, vídeo e áudio — para que você não precise conciliar uma fatura separada por provedor.

Qual modelo Gemini devo escolher?

  • gemini-2-5-flash — padrão para chat, extração, classificação, resumo e a maior parte de RAG. Rápido e a opção avançada mais barata.
  • gemini-3-1-pro — escolha-o quando o Flash não for preciso o suficiente: raciocínio em várias etapas, código, visão e contexto muito longo.

Um bom padrão é rotear por dificuldade: Flash no caso normal e fazer upgrade para Pro apenas quando uma verificação falhar. O guia de otimização de custos de IA mostra a abordagem de roteamento no código.

Como reduzir sua fatura do Gemini

  1. Faça downgrade. Envie os 80% simples para o Flash; reserve o Pro para os 20% difíceis.
  2. Limite a saída. Defina max_tokens e sequências de parada — a saída é a parte cara do contador.
  3. Reduza a entrada. Recupere menos chunks de RAG, mas melhores, em vez de colocar toda a base de conhecimento no contexto.
  4. Use processamento em lote. Agrupe chamadas independentes para manter a latência baixa e evitar tempestades de novas tentativas.

A mesma chave também chama os modelos de vídeo do Google — os custos por clipe estão em Custos do Veo 3, e a comparação com a OpenAI em Custos da OpenAI API.

Perguntas frequentes

A Gemini API é gratuita?

O Google AI Studio oferece um nível gratuito com limite de taxa para prototipagem. Em produção, você paga por token. A Kunavo funciona no modelo pay-as-you-go a partir de uma recarga mínima de $10 — você paga por token conforme as tarifas abaixo, o crédito nunca expira e não é necessária uma conta de faturamento do Google Cloud.

Quanto custa o Gemini 2.5 Flash?

Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1M de tokens de entrada e $0.75 por 1M de tokens de saída — cerca de 70% abaixo do preço de tabela do Google de $0.30 / $2.50. Uma interação típica de chatbot (1K de entrada, 300 de saída) custa cerca de $0.0003.

O Gemini é mais barato que Claude ou GPT?

O Gemini 2.5 Flash está entre os modelos avançados mais baratos disponíveis — abaixo do Claude Haiku e da maioria dos níveis GPT em grandes volumes. Compare a tabela completa na página de preços.

Como reduzo os custos da Gemini API?

Faça downgrade para o Flash, limite a saída, reduza o contexto recuperado e use processamento em lote. Veja os detalhes no guia de otimização de custos. Para começar a chamar o Gemini, leia como criar uma chave da Gemini API.