Voltar aos guias
Preços·18 de setembro de 2026·Atualizado em 1 de outubro de 2026·9 min de leitura

Preços do Qwen Code: planos, custos da API e opções de provedores

O cliente é gratuito. O nível gratuito do OAuth acabou. Todo o restante é inferência que você compra.

Última revisão em .

O próprio Qwen Code é gratuito: o cliente é um software de código aberto Apache-2.0 sem camada paga, portanto cada dólar no orçamento do Qwen Code corresponde à inferência do modelo adquirida separadamente. O nível gratuito do Qwen OAuth que a maioria dos tutoriais ainda descreve foi descontinuado em 15 de abril de 2026, o que significa que um orçamento de 2026 parte de um endpoint adquirido: um Alibaba Cloud Model Studio Coding Plan, um pacote Token Plan Credit, cobrança de tokens conforme o uso ou um endpoint de terceiros ao qual você aponte o cliente manualmente.

Essas quatro rotas são medidas em quatro unidades diferentes — solicitações, Credits, tokens e o que quer que seu próprio provedor cobre — e é por isso que compará-las apenas pelo preço de destaque produz a resposta errada. Esta página separa o custo do software do custo da inferência, mostra uma estimativa de tokens que pode ser recalculada e marca os números que não puderam ser verificados.

Quanto custa o software e quanto custam os modelos

O repositório QwenLM/qwen-code é Apache-2.0 e está em desenvolvimento ativo; a API do GitHub informou que ele não estava arquivado em 21 de setembro de 2026. As versões são lançadas semanalmente ou com maior frequência: a v0.24.0 foi publicada no npm como @qwen-code/qwen-code em 16 de setembro de 2026 e a v0.24.2 veio em 20 de setembro; portanto, consulte o registro em vez de confiar em qualquer versão impressa em uma página. A instalação é feita por npm (Node.js 22 ou posterior), Homebrew ou um instalador independente.

Chamá-lo agora de CLI de terminal é subestimá-lo. O título do README o descreve como um agente de programação de IA de código aberto para terminal, editor, desktop, navegador e chat, e o projeto distribui um aplicativo para desktop, uma interface web iniciada com qwen serve --open, plugins para VS Code, Zed e JetBrains, SDKs para TypeScript, Python e Java e canais de chat. O campo de descrição do GitHub do repositório ainda o chama de um agente que vive no seu terminal, portanto os dois divergem; o README é o que lista as superfícies adicionais. Nenhuma dessas superfícies é uma atualização paga — todas estão no mesmo repositório gratuito, e nenhuma inclui inferência.

Vale esclarecer uma herança: o Qwen Code foi originalmente baseado no Google Gemini CLI v0.8.2, mas o projeto afirma que deixou de sincronizar com o upstream na v0.1 e passou a ser desenvolvido de forma independente. As cotas e os preços do Gemini CLI não são transferidos.

Limite gratuito do Qwen Code: o que terminou e quando

A documentação de autenticação afirma que o nível gratuito do Qwen OAuth foi descontinuado em 2026-04-15 e que tokens armazenados em cache existentes podem continuar funcionando brevemente enquanto novas solicitações são rejeitadas. O OAuth deixou de ser uma opção selecionável no diálogo /auth; ele permanece documentado apenas como um provedor descontinuado. Este é o fato mais desatualizado nos resultados de busca sobre este tema.

PeríodoCota gratuita do OAuthEvidência
Até a v0.9.0 (npm em 3 de fevereiro de 2026)2.000 solicitações/dia, 60 solicitações/minutoA documentação de autenticação foi publicada na tag v0.9.0
A partir da v0.10.0 (npm em 9 de fevereiro de 2026)1.000 solicitações/dia, 60 solicitações/minutoMesmo arquivo nas tags v0.10.0 a v0.14.0
A partir de 15 de abril de 2026Nenhuma — descontinuadoDocumentação de autenticação atual; issue #3316, aberta em 16 de abril e encerrada

Há duas ressalvas sobre esta tabela. A data exata do calendário em que a cota diária caiu de 2.000 para 1.000 não foi anunciada em nenhum lugar que encontramos; o intervalo acima foi derivado da tag de versão na qual a documentação publicada mudou, não de um anúncio do Qwen. E uma afirmação amplamente repetida de que a cota caiu para 100 por dia antes do encerramento não aparece em nenhuma das tags de versão que verificamos: v0.9.0 a v0.14.0 são as versões que informam uma cota, e elas dizem 2.000 e depois 1.000; a partir da v0.15.0, o arquivo não informa cota porque o nível já havia sido descontinuado. Considere o valor de 100 por dia sem respaldo. Também não foi localizado nenhum post oficial de blog ou comunicado de imprensa sobre o encerramento; portanto, ele foi documentado, não anunciado.

Duas outras restrições são importantes para quem espera reativar o caminho gratuito. Os modelos Qwen OAuth são definidos diretamente no código e não podem ser substituídos por meio de modelProviders, portanto a rota descontinuada não pode simplesmente ser redirecionada para outro endpoint. E o OAuth nunca foi utilizável sem interface: a documentação observa que, em ambientes de CI, SSH ou contêiner, normalmente não é possível concluir o fluxo de login no navegador.

Três endpoints oficiais, três unidades de cobrança

Dentro de /auth, o Alibaba ModelStudio abre um submenu com Coding Plan, Token Plan e Standard API Key. Essas não são três formas de pagar a mesma fatura: a documentação fornece a cada uma seu próprio host de endpoint e sua própria chave, e orienta a associar o baseUrl ao plano ao qual a chave pertence. As chaves do Coding Plan começam com sk-sp-; as chaves do Token Plan não exigem prefixo.

OpçãoCobrado emPreço publicadoHost do endpoint
Coding Plan Pro (internacional)Solicitações$50/mêscoding-intl.dashscope.aliyuncs.com
Coding Plan Pro (site da China)Solicitações¥200/mês, primeiro mês ¥39.90 para novos clientescoding.dashscope.aliyuncs.com
Token Plan, PersonalCréditosLite $8 (promocional $6), Essential $16 ($10), Standard $25 ($18), Pro $80 ($68) por mêstoken-plan.ap-southeast-1.maas.aliyuncs.com
Token Plan, TeamCréditosStandard $30 ($20), Pro $100 ($75), Max $200 por assento por mêsMesmo host de Singapura
Chave de API padrãoTokensPor modelo, escalonado pelo comprimento da entradadashscope.aliyuncs.com

A página do Coding Plan informa o preço do Pro como $50 por mês, com três limites simultâneos: até 6.000 solicitações por 5 horas, 45.000 por semana e 90.000 por mês. Quando qualquer limite é atingido, as chamadas são pausadas. A cota semanal é redefinida na segunda-feira às 00:00:00 UTC+08:00 e a mensal na data de renovação. A Alibaba afirma que esses limites não são cumulativos e não representam capacidade distribuída uniformemente ao longo do tempo. Em 1º de outubro de 2026, a página também indicava que o Pro tinha disponibilidade limitada: as vagas são preenchidas por ordem de chegada e repostas diariamente às 00:00 UTC+08:00; portanto, talvez não seja possível comprar uma assinatura no dia em que você tentar.

Quanto uma solicitação realmente custa: a mesma página afirma que cada consulta consome cota conforme o número de chamadas ao modelo e que tarefas simples normalmente usam 5–10 chamadas, enquanto tarefas complexas usam 10–30 ou mais. Uma instrução, portanto, corresponde a muitas solicitações. Considerando o valor literalmente, 90.000 solicitações por mês equivalem a algo entre aproximadamente 3.000 e 18.000 tarefas — mas a Alibaba apresenta essas contagens de chamadas como típicas, não garantidas, e afirma que o consumo real varia conforme a complexidade da tarefa, o contexto e o uso de ferramentas. Meça isso na sua própria conta antes de dimensionar um plano.

Duas cifras desatualizadas a descartar. O nível Lite do Coding Plan acabou — a página da China registra que novas assinaturas cessaram em 20 de março de 2026, e renovações e upgrades em 13 de abril de 2026 — portanto qualquer site de comparação que ainda ofereça um nível Lite mais barato como opção ativa está desatualizado. E o preço de ¥200 na China não é o preço internacional de $50 convertido: ¥200 é materialmente inferior a $50 em qualquer taxa de câmbio recente; trate as duas vitrines como ofertas comerciais separadas e confirme preço, moeda e elegibilidade no seu próprio console, em vez de presumir que uma se converte na outra.

O Token Plan exige duas divulgações. Primeiro, um conflito: a visão geral do Token Plan vende cotas mensais fixas de Credits — em 1º de outubro de 2026, todos os níveis Personal operavam em um ciclo de assinatura de 30 dias (usavam uma janela de 7 dias quando esta página foi escrita pela primeira vez), e o Team em um ciclo mensal — pausa o serviço quando a cota é atingida, vende Extra Bundles por $15 para 20.000 Credits e afirma que a cota não utilizada não é acumulada — enquanto a documentação de autenticação do Qwen Code descreve o Token Plan como cobrança baseada no uso para equipes e empresas. Essas descrições divergem; a página da Alibaba é a que o vende, e sua leitura é de uma assinatura. Segundo, a Alibaba afirma que o Token Plan está atualmente disponível apenas na região de Singapura, mas a documentação do cliente também lista um host do Token Plan em Pequim. Confirme a disponibilidade regional no checkout.

Por fim, os Credits não são convertidos em tokens na página que os vende. A visão geral do Token Plan publica uma quantidade de Credits por nível — 11.500, 25.500, 45.000 e 180.000 Credits por mês para Personal Lite, Essential, Standard e Pro em 1º de outubro de 2026 — mas não informa uma taxa de conversão de Credit para token nem um multiplicador por modelo; portanto, nada nessa página permite afirmar quantos tokens $18 por mês compram. Se existir uma taxa em outro local do seu console, consulte-a ali, em vez de confiar na conversão de terceiros.

Tarifas conforme o uso e uma página oficial expirada

A página de preços do Model Studio lista tarifas em USD por milhão de tokens, escalonadas pelo comprimento da entrada de cada solicitação. A tabela abaixo é a coluna de Singapura; a mesma página lista tarifas separadas e materialmente menores para a China (Pequim), portanto verifique em qual região sua conta é cobrada antes de usar estes números.

ModeloEntrada de 0–32K32K-128K128K-256K256K-1M
qwen3-coder-plus$1 entrada / $5 saída$1.8 / $9$3 / $15$6 / $60
qwen3-coder-next$0.3 entrada / $1.5 saída$0.5 / $2.5$0.8 / $4Não listado

Leia o nível superior antes de fazer o orçamento de uma sessão longa do agente: a saída de qwen3-coder-plus passa de $5 para $60 por milhão de tokens quando a entrada de uma solicitação ultrapassa 256K. Uma conversa de agente com contexto longo não tem o mesmo preço que uma conversa curta. Novas contas na região de Singapura também recebem uma concessão gratuita de 1 milhão de tokens por modelo, válida por 90 dias a partir da ativação, do lançamento do modelo ou da aprovação, o que ocorrer por último — uma concessão de teste, não um nível gratuito.

Vale mencionar uma armadilha porque ela está no domínio oficial e ainda assim aparece bem posicionada: a página qwen3-coder-plus price-drop anuncia um desconto no cache de contexto cuja janela promocional ocorreu de 24 de julho a 23 de agosto de 2025. Ela é oficial e expirada ao mesmo tempo. Não imprimimos aqui as tarifas dos outros modelos Qwen porque a tabela do qwen3.7-plus separa a saída com raciocínio e sem raciocínio em colunas distintas, e nossa leitura dela não foi confiável o suficiente para publicação.

Melhor API para Qwen Code: apontando o cliente para outro lugar

O Qwen Code fala quatro protocolos — OpenAI Chat Completions, OpenAI Responses, Anthropic e Gemini/Vertex — e cada um pode ser apontado para uma URL base personalizada. A própria documentação cita OpenRouter e Fireworks AI como alternativas para as quais mudar após o encerramento do OAuth, portanto um endpoint de terceiros é um caminho autorizado, não uma solução alternativa. A Kunavo disponibiliza /v1/chat/completions, /v1/responses e /v1/messages em https://api.kunavo.com/v1, que são três desses quatro formatos de comunicação.

Deixe claro o que isso proporciona. O catálogo da Kunavo não contém nenhum modelo de texto Qwen, portanto esta não é uma forma mais barata de executar o Qwen. É uma forma de executar modelos Claude ou GPT dentro do Qwen Code usando um único saldo pré-pago. A Kunavo também não testou o Qwen Code em tempo de execução com esses endpoints, embora agora exista uma página de configuração do Qwen Code, escrita com base na própria documentação do Qwen Code, assim como as páginas do Cline e do OpenCode. Trate a configuração abaixo como um ponto de partida documentado e mantenha sua rota de trabalho disponível enquanto você a testa.

Caminho compatível com OpenAI, apenas variáveis de ambiente
export OPENAI_API_KEY="your-kunavo-key"
export OPENAI_BASE_URL="https://api.kunavo.com/v1"
export OPENAI_MODEL="claude-sonnet-5"

A URL base mantém o sufixo /v1 — todos os exemplos de OPENAI_BASE_URL na documentação terminam nele, e o Qwen Code acrescenta a rota por conta própria. QWEN_MODEL é um alias aceito para OPENAI_MODEL. A configuração equivalente em um único arquivo fica em ~/.qwen/settings.json.

Mescle estes campos em ~/.qwen/settings.json
{
  "modelProviders": {
    "openai": [
      {
        "id": "claude-sonnet-5",
        "name": "Claude Sonnet 5",
        "baseUrl": "https://api.kunavo.com/v1",
        "envKey": "OPENAI_API_KEY"
      }
    ]
  },
  "env": {
    "OPENAI_API_KEY": "your-kunavo-key"
  },
  "security": {
    "auth": {
      "selectedType": "openai"
    }
  },
  "model": {
    "name": "claude-sonnet-5"
  }
}

Quatro fatos de configuração da referência de provedores de modelos e da documentação de autenticação vinculada acima economizam bastante tempo de depuração. Apenas as credenciais compatíveis com OpenAI têm flags de CLI — --openai-api-key e --openai-base-url existem, e não há equivalentes para Anthropic ou Gemini. As chaves de ambiente específicas do provedor não selecionam sozinhas o tipo de autenticação; portanto, exporte OPENAI_API_KEY em vez de uma variável com nome do fornecedor se você estiver configurando tudo apenas com variáveis de ambiente. A precedência de credenciais coloca a entrada modelProviders selecionada acima das flags de CLI — baseUrl e envKey têm precedência sobre --openai-base-url e --openai-api-key, que é justamente a ordem que a maioria das pessoas inverte — depois vêm as flags de CLI, as variáveis de ambiente e, por fim, settings.json. Apenas os valores inseridos por meio de /auth na sessão em execução ficam acima de modelProviders. As variáveis de ambiente incluem o que o primeiro arquivo .env encontrado fornecer, e esse arquivo apenas preenche variáveis que ainda não foram definidas — as variáveis não são mescladas entre vários arquivos. E as edições em modelProviders são recarregadas automaticamente em uma sessão em execução, enquanto providerProtocol é lido uma vez na inicialização e exige reinicialização.

Dois limites a considerar. A ferramenta integrada web_search usa a pesquisa do próprio servidor da DashScope, portanto o que a ativa é o host, não o plano: ela fica ativa para ModelStudio Standard API Key e Token Plan, e para uma entrada personalizada ou modelProviders que aponte para um host Responses reconhecido da DashScope com uma chave direta. Ela fica desativada para provedores de terceiros e para endpoints personalizados em qualquer outro host — e também para o Coding Plan pago, porque esse endpoint não é verificado para esta API. Essa última linha revela tudo: trata-se de uma restrição do host, não de uma penalidade por trazer sua própria chave. As alternativas documentadas são um servidor de pesquisa MCP ou apontar tools.webSearch.model para uma chave DashScope compatível separada enquanto o modelo principal é executado em outro lugar. Separadamente, wireApi: "responses" exige um endpoint genuinamente compatível com Responses, e a documentação afirma que não há detecção de endpoint nem fallback automático quando uma chamada falha. Não testamos a rota Responses da Kunavo com os requisitos do Qwen Code; portanto, comece com Chat Completions.

Uma estimativa mensal que você pode recalcular

Suponha um mês contendo 20 milhões de tokens de entrada não armazenados em cache e 1 milhão de tokens de saída. Com as tarifas atuais do catálogo da Kunavo, essa conta resulta em:

ModeloEntrada / saída por 1MMês estimadoFunção do candidato
Claude Haiku 4.5$0.70 / $3.50$17.50Edições delimitadas de alto volume e trabalho rotineiro de programação
GPT-5.6 Terra$0.70 / $4.20$18.20Raciocínio misto e uso de ferramentas
Claude Sonnet 5$1.40 / $7.00$35.00Alterações difíceis no repositório

Isto é uma conta de tokens baseada em uma carga de trabalho presumida, não uma tarefa medida do Qwen Code nem um teto de cobrança. Ela exclui cobranças de cache, ferramentas externas e impostos, e pressupõe que o modelo mais barato conclua o trabalho sem tentativas adicionais — a condição que realmente determina se uma tarifa menor produz uma cobrança menor. O valor do catálogo da Kunavo é um piso de cobrança, não um limite: quando o upstream informa sua cobrança, o valor cobrado é o maior entre o custo do catálogo e o custo do upstream multiplicado pela margem aplicável. Consulte os detalhes de cobrança.

Observe o que esta tabela não pode fazer. Ela não pode ser comparada ao Coding Plan de $50, porque esse plano contabiliza chamadas de modelo e esta estimativa contabiliza tokens, e uma quantidade de chamadas não informa a quantidade de tokens. Ela também não pode ser comparada ao Token Plan, porque os Credits não têm conversão de tokens publicada. Comparar uma assinatura com cobrança por uso exige que você meça seu próprio uso em ambos.

A Kunavo começa com uma recarga pré-paga de $10 sem assinatura. Esse é o dinheiro necessário para abrir uma conta com saldo, não o custo de uma tarefa.

API mais barata para Qwen Code: qual rota vence quando

EscolhaQuando se encaixaO que você abre mão
Assinatura do Coding PlanUso diário constante do Qwen que permanece dentro dos limites de solicitaçõesChamadas pausadas em qualquer limite; sem pesquisa na web integrada; cota compartilhada com qualquer outra ferramenta que use a chave
Tokens padrão pagos conforme o usoUso irregular ou ocasional e sessões de contexto longo cujo preço você quer calcular com precisãoFaixas de tamanho de entrada que aumentam acentuadamente a tarifa em solicitações grandes
Credits do Token PlanVocê confirmou a tarifa de Credits dos seus modelos no seu próprio consoleSem conversão pública, cota mensal que pausa o serviço quando consumida, disponibilidade em Singapura
Um gateway como a KunavoVocê quer modelos Claude ou GPT no Qwen Code usando um único saldo pré-pagoSem modelos Qwen; configuração de provedor personalizado; sem pesquisa na web integrada
Inferência localVocê possui hardware adequado e o modelo lida com seu fluxo de trabalho com ferramentasO hardware, a manutenção e a confiabilidade das chamadas de ferramentas passam a ser sua responsabilidade

Mantenha as duas perguntas separadas. O menor preço listado por milhão de tokens é um fato que você pode ler em uma página; o menor custo para concluir sua tarefa é uma medição que ninguém publicou para este cliente, inclusive nós. Execute as mesmas três tarefas — uma pequena edição, uma correção de bug e uma investigação em vários arquivos — em duas rotas e compare as cobranças registradas antes de decidir.

Se a rota pelo gateway é a que você quer experimentar, crie uma conta da Kunavo e siga o início rápido e a referência de Chat Completions para obter o endpoint e os IDs dos modelos. Para tomar a mesma decisão em outros clientes, consulte preços do OpenCode, preços do Cline e o guia da API compatível com OpenAI.

Perguntas frequentes

Quanto custa o Qwen Code?

O cliente Qwen Code não custa nada. Ele é um software de código aberto Apache-2.0 no GitHub, em QwenLM/qwen-code, sem camada paga, sem assentos e sem assinatura; o aplicativo para desktop, a interface web, os plugins de editor e os SDKs são distribuídos no mesmo repositório gratuito. O que você paga é a inferência do modelo, adquirida separadamente do endpoint que configurar.

O Qwen Code ainda é gratuito? Qual é o limite gratuito do Qwen Code?

O software continua gratuito. A inferência hospedada gratuita, não: a própria documentação de autenticação do Qwen Code afirma que o nível gratuito do Qwen OAuth foi descontinuado em 2026-04-15, e o OAuth deixou de ser uma opção selecionável no diálogo /auth. Tutoriais que citam 2.000 solicitações por dia descrevem a cota disponível até a v0.9.0, em fevereiro de 2026. O subsídio gratuito restante na plataforma da Alibaba é uma concessão para novas contas de 1 milhão de tokens por modelo na região de Singapura, válida por 90 dias; trata-se de uma concessão de teste, não de um nível gratuito.

Qual é a melhor API para o Qwen Code?

Depende do modelo que você deseja. Especificamente para modelos Qwen, o Alibaba Cloud Model Studio é a fonte oficial: uma assinatura Coding Plan se seu uso for constante e assumir o formato de solicitações, ou cobrança de tokens conforme o uso se ele for irregular. A própria documentação do Qwen Code também cita OpenRouter e Fireworks AI como alternativas após o encerramento do OAuth. Se quiser executar modelos Claude, GPT ou Gemini dentro do Qwen Code, qualquer endpoint compatível com OpenAI, Anthropic ou Gemini pode ser definido como provedor personalizado.

Qual é a API mais barata para o Qwen Code?

O menor preço listado por milhão de tokens e o menor custo para concluir uma tarefa são questões diferentes, e apenas a primeira pode ser respondida por uma página de preços. Entre as tarifas publicadas pela Alibaba para Singapura, qwen3-coder-next, a $0.30 por milhão de tokens de entrada e $1.50 de saída (faixa de entrada de 0–32K), é mais barato que qwen3-coder-plus, a $1 e $5. Saber se um modelo mais barato é realmente mais barato para seu repositório depende de quantas tentativas ele exige, algo que nenhuma tabela de preços publicada mede.

Uma assinatura Coding Plan funciona apenas com o Qwen Code?

Não. A página Coding Plan da Alibaba Cloud lista Claude Code, Cline, Cursor, Codex, OpenCode, OpenClaw, Qoder, Lingma, Cherry Studio, Chatbox e outras entre as ferramentas compatíveis, e sua lista de modelos inclui modelos que não são Qwen, como glm-5, kimi-k2.5 e MiniMax-M2.5. Uma assinatura não está vinculada a um único cliente, o que também significa que a cota consumida por outra ferramenta deixa de estar disponível para o Qwen Code.

Posso usar crédito da Kunavo para pagar modelos Qwen no Qwen Code?

Não. O catálogo da Kunavo não contém nenhum modelo de texto Qwen, portanto a Kunavo não pode ser uma rota mais barata para a inferência Qwen. O que a Kunavo pode fazer é fornecer modelos Claude e GPT por endpoints compatíveis com OpenAI, Responses e Anthropic Messages, formatos de comunicação que a documentação do Qwen Code declara serem compatíveis. A Kunavo não testou o Qwen Code em tempo de execução com esses endpoints; portanto, considere essa configuração um caminho documentado para experimentar, não uma integração verificada.

Repositório do Qwen Code, dados de versão e documentação verificados em 21 de setembro de 2026 contra github.com/QwenLM/qwen-code, o registro npm e a documentação distribuída no branch main e nas tags de versão v0.9.0 a v0.15.0. Páginas do Alibaba Cloud Coding Plan, Token Plan e preços dos modelos verificadas no mesmo dia e novamente em 1º de outubro de 2026, quando os termos de cota do Token Plan e a observação de disponibilidade do Coding Plan foram atualizados aqui. As tarifas de tokens da Kunavo são lidas do catálogo ativo; os totais mensais são uma conta ilustrativa de tokens, não custos de tarefas medidos.