Voltar aos guias
Preço·18 de junho de 2026·Atualizado em 12 de setembro de 2026·8 min de leitura

Preços da API Gemini 2026 — custo por modelo, exemplos e acesso compatível com OpenAI mais barato

O Gemini está entre as opções de melhor custo-benefício da IA de ponta. Estes são os preços atuais por modelo — cerca de 70% abaixo da tabela do Google — com exemplos de custos e a forma mais barata de chamar o Gemini em produção.

O Gemini está entre as opções de melhor custo-benefício em IA de ponta, e o Kunavo o precifica cerca de 70% abaixo dos preços oficiais publicados pelo Google por meio de uma única API compatível com OpenAI. Este guia apresenta os preços atuais por modelo, exemplos de custos que você pode verificar por conta própria e a forma mais barata de chamar o Gemini em produção.

Preços da API do Gemini de relance

Preços por 1 milhão de tokens, em USD, exatamente como calculados no Kunavo. A coluna “Preço publicado pelo Google” mostra o preço divulgado pelo Google para o mesmo modelo, para que você veja a diferença.

ModeloEntrada / 1 milhãoSaída / 1 milhãoPreço publicado pelo Google (entrada / saída)Sua economia
gemini-2-5-flash$0.09$0.75$0.30 / $2.50~70%
gemini-3-1-pro$0.70$4.20$2.00 / $12.00~65%

O Flash é o “cavalo de batalha” para alto volume; o Pro é para raciocínio mais difícil, visão e tarefas com contexto longo. Os preços diretos estão sempre visíveis na página de preços e na página de cada modelo (gemini-2-5-flash, gemini-3-1-pro).

Como funciona a cobrança por tokens do Gemini

Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado e mensagens do usuário) e pelos tokens de saída (o que o modelo gera). A saída é a parte mais cara, portanto a maior alavanca sobre sua fatura do Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em tokens equivalentes e cobrados pelo mesmo medidor.

Exemplos de custos pré-calculados

Números reais com os preços do Gemini 2.5 Flash no Kunavo; a última linha usa Gemini 3.1 Pro:

Carga de trabalhoTokens (entrada / saída)ModeloCusto
Interação de chatbot1.000 / 300Flash$0.0003
Resposta RAG8.000 / 500Flash$0.0011
Classificação em lote (por documento)500 / 20Flash$0.00006
Análise de contexto longo20.000 / 2.000Pro$0.0224

Com esses preços, um lote de classificação de 100.000 documentos no Flash custa cerca de US$ 6, e um milhão de interações de chatbot custa cerca de US$ 315. O cálculo, pronto para executar:

gemini_chi_phi.py
# Mức giá Kunavo cho Gemini 2.5 Flash (USD trên mỗi 1 triệu token)
IN_RATE, OUT_RATE = 0.09, 0.75

def chi_phi(token_vao: int, token_ra: int) -> float:
    return token_vao / 1_000_000 * IN_RATE + token_ra / 1_000_000 * OUT_RATE

print(chi_phi(1_000, 300))            # một lượt chatbot        -> $0.000315
print(chi_phi(8_000, 500))            # một câu trả lời RAG     -> $0.001095
print(chi_phi(500, 20) * 100_000)     # lô 100k tài liệu        -> ~$6.00

Preços do Kunavo e pagamentos via Stripe

Não há assinatura nem projeto do Google Cloud. Você recarrega o saldo da carteira (Stripe ou métodos de pagamento locais), e cada chamada desconta dela conforme os preços por token acima. Pague conforme o uso a partir da recarga mínima de US$ 10; o saldo nunca expira, e recargas maiores recebem créditos de bônus. Uma única carteira cobre Gemini e todos os outros modelos — Claude, GPT, imagem, vídeo e áudio — para que você não precise conciliar uma fatura separada de cada provedor.

Qual modelo Gemini devo escolher?

  • gemini-2-5-flash — padrão para chat, extração, classificação, resumo e a maior parte de RAG. Rápido e a opção suficientemente poderosa mais barata.
  • gemini-3-1-pro — use quando o Flash não for preciso o bastante: raciocínio em várias etapas, programação, visão e contexto muito longo.

Um bom padrão é rotear por dificuldade: Flash para os casos comuns e fazer upgrade para Pro apenas quando uma verificação falhar. Consulte o guia de otimização de custos de IA para ver o padrão de roteamento no código.

Como reduzir sua fatura do Gemini

  1. Faça downgrade. Envie 80% dos casos fáceis para o Flash; reserve o Pro para os 20% difíceis.
  2. Limite a saída. Defina max_tokens e uma sequência de parada — a saída é a parte mais cara do medidor.
  3. Simplifique a entrada. Recupere menos trechos de RAG, mas de melhor qualidade, em vez de despejar toda a base de conhecimento no contexto.
  4. Agrupe em lotes. Agrupe chamadas independentes para manter a latência baixa e evitar uma tempestade de retries.

Perguntas frequentes

A API do Gemini é gratuita?

O Google AI Studio oferece um nível gratuito com limite de velocidade, adequado para prototipagem. Ao passar para produção, você paga por token. O Kunavo cobra conforme o uso, a partir de uma recarga mínima de US$ 10 — você paga por token com os preços abaixo, o saldo nunca expira e não precisa de uma conta de cobrança do Google Cloud.

Quanto custa o Gemini 2.5 Flash?

No Kunavo, o Gemini 2.5 Flash custa $0.09 por 1 milhão de tokens de entrada e $0.75 por 1 milhão de tokens de saída — cerca de 70% menos que os preços oficiais publicados pelo Google, de $0.30 / $2.50. Uma interação típica de chatbot (1k de entrada, 300 de saída) custa cerca de US$ 0,0003.

O Gemini é mais barato que Claude ou GPT?

O Gemini 2.5 Flash é um dos modelos suficientemente poderosos mais baratos disponíveis — custa menos que o Claude Haiku e que a maioria dos níveis GPT em alto volume. Compare a tabela completa na página de preços.

Como reduzir o custo da API do Gemini?

Use o Flash, limite a saída, simplifique o contexto recuperado e agrupe em lotes. Veja os detalhes no guia de otimização de custos. Para começar a chamar o Gemini, consulte como obter uma chave de API do Gemini.