O Gemini está entre as IAs de ponta com melhor custo-benefício, e a Kunavo o oferece por trás de uma única API compatível com OpenAI, cerca de 70% mais barato que os preços oficiais do Google. Este guia apresenta as tarifas atuais por modelo, exemplos de cálculo de custos que você pode verificar diretamente e como chamar o Gemini pelo menor custo em produção.
Preços do Gemini em um relance
As tarifas são os valores cobrados pela Kunavo, em USD por 1 milhão de tokens. A coluna “Preço oficial do Google” mostra as tarifas publicadas pelo Google para o mesmo modelo, para que a diferença possa ser vista de relance.
| Modelo | Entrada / 1M | Saída / 1M | Preço oficial do Google (entrada / saída) | Percentual de economia |
|---|---|---|---|---|
gemini-2-5-flash | $0.09 | $0.75 | $0.30 / $2.50 | ~70% |
gemini-3-1-pro | $0.70 | $4.20 | $2.00 / $12.00 | ~65% |
O Flash é o principal modelo para processamento em grande volume, enquanto o Pro é adequado para raciocínio mais difícil, visão e tarefas com contexto longo. Consulte sempre as tarifas em tempo real na página de preços e nas páginas de cada modelo (gemini-2-5-flash, gemini-3-1-pro).
Como funcionam os preços dos tokens do Gemini
Você paga pelos tokens de entrada (tudo o que envia — prompt do sistema, contexto recuperado e mensagem do usuário) e pelos tokens de saída (o que o modelo gera). Como a saída é mais cara, o principal fator que determina sua cobrança do Gemini é quanto texto você permite que o modelo escreva. Imagens e áudio são convertidos em valores equivalentes em tokens e cobrados pelo mesmo medidor.
Exemplos de cálculo de custos
São valores reais calculados com as tarifas do Gemini 2.5 Flash da Kunavo; apenas a última linha usa Gemini 3.1 Pro:
| Tarefa | Tokens (entrada / saída) | Modelo | Custos |
|---|---|---|---|
| Um turno de chatbot | 1,000 / 300 | Flash | $0.0003 |
| Resposta RAG | 8,000 / 500 | Flash | $0.0011 |
| Classificação em lote (por documento) | 500 / 20 | Flash | $0.00006 |
| Análise de contexto longo | 20,000 / 2,000 | Pro | $0.0224 |
Com essas tarifas, um lote que classifique 100 mil documentos com Flash custa aproximadamente US$ 6, e 1 milhão de turnos de chatbot custa aproximadamente US$ 315. Fórmula que você pode executar diretamente:
# Kunavo Gemini 2.5 Flash 요율 (1M 토큰당 USD)
IN_RATE, OUT_RATE = 0.09, 0.75
def cost(in_tokens: int, out_tokens: int) -> float:
return in_tokens / 1_000_000 * IN_RATE + out_tokens / 1_000_000 * OUT_RATE
print(cost(1_000, 300)) # 챗봇 한 턴 -> $0.000315
print(cost(8_000, 500)) # RAG 답변 한 건 -> $0.001095
print(cost(500, 20) * 100_000) # 10만 건 배치 -> ~$6.00Preços da Kunavo e pagamentos pelo Stripe
Não há assinatura nem projeto do Google Cloud. Depois de carregar o saldo (pelo Stripe ou por um método de pagamento local), cada chamada desconta do saldo conforme as tarifas por token acima. Comece com uma recarga mínima de US$ 10, pague conforme o uso, o saldo não expira e recargas maiores recebem créditos bônus. Use todos os modelos — Gemini, Claude, GPT, imagem, vídeo, áudio e outros — com um único saldo, sem precisar conciliar faturas separadas de cada provedor.
Qual modelo Gemini devo escolher?
- gemini-2-5-flash — use como padrão para chat, extração, classificação, resumo e a maioria dos casos de RAG. É a opção de alto desempenho mais rápida e barata.
- gemini-3-1-pro — escolha quando a precisão do Flash não for suficiente: raciocínio em várias etapas, código, visão e contexto extremamente longo.
Um bom padrão é fazer o roteamento conforme a dificuldade: use Flash nos casos comuns e promova para Pro apenas quando a validação falhar. Consulte o guia de otimização de custos de IA para ver um padrão de roteamento implementado em código.
Reduzindo a cobrança do Gemini
- Use um modelo inferior. Envie os 80% fáceis para o Flash e reserve o Pro para os 20% difíceis.
- Limite a saída. Defina
max_tokense sequências de parada — a saída é o lado mais caro do medidor. - Reduza a entrada. Não despeje toda a base de conhecimento no contexto; recupere chunks de RAG menores e melhores.
- Processe em lote. Agrupe chamadas independentes para reduzir a latência e evitar picos de novas tentativas.
Perguntas frequentes
A API Gemini é gratuita?
O Google AI Studio oferece um nível gratuito para prototipagem (com limite de solicitações). Em produção, a cobrança é por token. A Kunavo funciona no modelo de pagamento conforme o uso, a partir de uma recarga mínima de US$ 10: você paga por token de acordo com as tarifas abaixo, o saldo não expira e não é necessária uma conta de faturamento do Google Cloud.
Quanto custa o Gemini 2.5 Flash?
Na Kunavo, o Gemini 2.5 Flash custa $0.09 por 1 milhão de tokens de entrada e $0.75 por 1 milhão de tokens de saída, cerca de 70% menos que os preços oficiais do Google, $0.30 / $2.50. Um turno típico de chatbot (1K de entrada e 300 de saída) custa aproximadamente US$ 0,0003.
O Gemini é mais barato que Claude ou GPT?
O Gemini 2.5 Flash é um dos modelos de alto desempenho mais baratos disponíveis e, em tarefas de grande volume, custa menos que o Claude Haiku e a maioria dos modelos GPT. Compare os preços e formas de pagamento do Claude em Preços e pagamentos da API do Claude e veja a tabela completa na página de preços.
Como reduzir o custo da API do Gemini?
Use um modelo inferior com o Flash, limite a saída, reduza o contexto de pesquisa e processe em lote. Veja mais detalhes no guia de otimização de custos. Para começar a fazer chamadas ao Gemini, consulte Como obter uma chave da API do Gemini.