O preço do Gemini se divide em 3 partes.Camada gratuita (a camada gratuita da API no Google AI Studio, com limites de taxa e inadequada para produção), assinatura do Google (plano pago do aplicativo Gemini, com mensalidade fixa e sem chave de API), cobrança conforme o uso da API (por token, sem mensalidade; se você não fizer chamadas, custa $0).Essas 3 opções são produtos separados; assinar uma não dá acesso à outra.
O que os desenvolvedores normalmente procuram é a terceira opção. A Kunavo oferece essa API por cerca de 70% menos que o preço oficial do Google. Esta página aborda as tarifas atuais por modelo, exemplos de cálculo que você pode verificar por conta própria e a forma mais barata de chamar o Gemini em produção.
Como distinguir as 3 opções de preço
| Rota | O que você paga | Inclui chave de API |
|---|---|---|
| Camada gratuita (Google AI Studio) | $0. Com limites de taxa | Sim (com limitações) |
| Assinatura (plano pago do aplicativo Gemini) | Mensalidade fixa | Não inclui |
| Cobrança conforme o uso da API | Por token. Sem mensalidade | Sim |
O erro mais comum envolve a linha do meio. Pagar pelo plano pago do aplicativo Gemini não aumenta sua cota de uso da API. A mensalidade do aplicativo e a API para desenvolvedores são cobradas separadamente; para fazer chamadas a partir de código, de qualquer forma você precisa de uma chave e de cobrança conforme o uso (ou da camada gratuita). Como os limites específicos da camada gratuita mudam com frequência por decisões do Google, consulte os números na documentação oficial do Google. Não os reproduzimos aqui — se a intenção é colocar o sistema em produção, a camada gratuita deixa de ser uma opção de qualquer maneira.
Tabela rápida de preços do Gemini
As tarifas são por 1M de tokens, em USD, cobradas pela Kunavo. A coluna “preço oficial do Google” mostra o preço publicado pelo Google para o mesmo modelo, para que a diferença fique clara.
| Modelo | Entrada / 1M | Saída / 1M | Preço oficial do Google (entrada / saída) | Percentual de economia |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | Aproximadamente 70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | Aproximadamente 65% |
Flash é a opção principal para processamento em massa; Pro é indicado para raciocínio mais difícil, reconhecimento de imagens e tarefas com contexto longo. As tarifas mais recentes são sempre exibidas na página de preços e nas páginas de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Como funciona a cobrança por tokens do Gemini
A cobrança inclui tokens de entrada (tudo o que você envia — prompt do sistema, contexto recuperado e mensagem do usuário) e tokens de saída (o que o modelo gera). Como a saída custa mais, a principal alavanca que determina a cobrança do Gemini é “quanto você faz o modelo escrever”. Imagens e áudio são convertidos em tokens e cobrados pelo mesmo medidor.
Exemplos de cálculo
Valores reais usando as tarifas do Gemini 2.5 Flash da Kunavo. Somente a última linha usa Gemini 3.1 Pro.
| Carga de trabalho | Tokens (entrada / saída) | Modelo | Custo |
|---|---|---|---|
| Um turno de chatbot | 1,000 / 300 | Flash | $0.0003 |
| Resposta de RAG | 8,000 / 500 | Flash | $0.0011 |
| Classificação em lote (por documento) | 500 / 20 | Flash | $0.00006 |
| Análise de contexto longo | 20,000 / 2,000 | Pro | $0.0224 |
Com essas tarifas, um lote de classificação de 100 mil documentos usando Flash custa aproximadamente $6, e 1 milhão de conversas de chatbot custa aproximadamente $315. A fórmula pode ser executada diretamente.
# Kunavo の Gemini 2.5 Flash 料率(1M トークンあたり、USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # チャットボット 1 ターン -> $0.000315
print(cost(8_000, 500)) # RAG の回答 1 件 -> $0.001095
print(cost(500, 20) * 100_000) # 10 万件のバッチ処理 -> 約 $6.00Preços da Kunavo e pagamentos via Stripe
Não é necessária uma assinatura nem um projeto do Google Cloud. Ao adicionar saldo (via Stripe ou métodos de pagamento locais), cada chamada desconta do saldo com as tarifas de tokens acima. É uma cobrança conforme o uso que começa com uma recarga mínima de $10; o saldo não expira, e recargas maiores recebem créditos bônus. Um único saldo cobre o Gemini e todos os demais modelos — Claude, GPT, imagens, vídeo e áudio —, portanto você não precisa conciliar faturas separadas de cada provedor.
Qual modelo Gemini devo escolher?
- gemini-2-5-flash — o padrão para chat, extração, classificação, resumo e a maioria dos casos de RAG. É rápido e a opção de alto desempenho mais barata.
- gemini-3-1-pro — use quando a precisão do Flash não for suficiente: raciocínio em várias etapas, código, reconhecimento de imagens e contextos extremamente longos.
Uma boa abordagem é rotear por dificuldade. Atenda os casos comuns com Flash e faça a escalada para Pro somente quando uma verificação falhar. Para um padrão de roteamento com código, consulte o guia de otimização de custos de IA.
Reduzindo a cobrança do Gemini
- Reduza o nível. Envie os 80% simples para o Flash e reserve o Pro para os 20% difíceis.
- Limite a saída. Configure
max_tokense sequências de parada — a saída é o lado mais caro do medidor. - Reduza a entrada. Recupere poucos chunks de RAG de alta qualidade, em vez de inserir toda a base de conhecimento no contexto.
- Use processamento em lote. Agrupe chamadas independentes para reduzir a latência e evitar uma avalanche de novas tentativas.
Os modelos de imagem e vídeo do Google também podem ser chamados com a mesma chave. Os preços por imagem e por vídeo estão em preços do Nano Banana Pro e preços do Veo 3.
Perguntas frequentes
Quanto custa o Gemini?
O preço do Gemini se divide em 3 partes. A camada gratuita do Google AI Studio ($0, com limites de taxa), a assinatura paga do aplicativo Gemini (valor mensal fixo, sem chave de API) e a cobrança conforme o uso da API (por token, sem mensalidade). Para chamadas feitas a partir de código, é a terceira opção; na Kunavo, a tarifa por 1M de tokens é entrada $0.09 / saída $0.75 para o Gemini 2.5 Flash, e gemini-3-1-pro é $0.70 / $4.20 — cerca de 70% / 65% mais barato que o preço oficial do Google, respectivamente.
Quanto custa o Gemini Pro?
gemini-3-1-pro custa na Kunavo entrada $0.70 / saída $4.20 por 1M de tokens, cerca de 65% abaixo do preço oficial do Google, $2.00 / $12.00. Uma solicitação com 20.000 tokens de entrada e 2.000 de saída custa aproximadamente $0.0224. O Pro é indicado para tarefas de raciocínio difícil, reconhecimento de imagens e contexto longo; para processamento em massa, reduzir o nível para Flash diminui o custo em ordens de grandeza.
O Gemini pode ser usado gratuitamente?
O Google AI Studio oferece uma camada gratuita da API Gemini, permitindo chamadas a $0 dentro dos limites de taxa. É suficiente para protótipos, mas os limites podem mudar conforme decisões do Google e não são suficientes para tráfego de produção; portanto, se a intenção é colocar o sistema em produção, essa opção deixa de ser viável. A Kunavo não oferece uma camada gratuita, mas também não cobra mensalidade — o valor é descontado do saldo pré-pago conforme o uso, e os meses sem chamadas custam $0.
Assinar um plano pago do aplicativo Gemini também dá acesso à API?
Não. A assinatura paga do aplicativo Gemini e a API Gemini para desenvolvedores são produtos e cobranças diferentes; a mensalidade não inclui créditos de uso da API nem fornece uma chave de API. Para fazer chamadas a partir de código, é necessário obter separadamente uma chave e usar cobrança conforme o uso (ou a camada gratuita). Da mesma forma, ter uma chave de API não adiciona recursos ao aplicativo.
Quanto custa o Gemini 2.5 Flash?
Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1M de tokens de entrada e $0.75 por 1M de tokens de saída, cerca de 70% abaixo do preço oficial do Google, $0.30 / $2.50. Um turno comum de chatbot (1K de entrada, 300 de saída) custa aproximadamente $0.0003.
O Gemini é mais barato que Claude ou GPT?
O Gemini 2.5 Flash está entre os modelos de alto desempenho mais baratos em qualquer comparação — para processamento em massa, custa menos que o Claude Haiku e que a maioria dos níveis GPT. Consulte a página de preços para ver a tabela completa.
Como reduzir o custo da API Gemini?
Reduza o nível para Flash, limite a saída, restrinja o contexto recuperado e use processamento em lote. Consulte o guia de otimização de custos para mais detalhes. Para começar a chamar o Gemini, consulte como obter uma chave da API Gemini.