Qwen Code lui-même est gratuit : le client est open source sous Apache-2.0, sans niveau payant, donc chaque euro d’un budget Qwen Code part dans l’inférence du modèle, achetée à part. L’offre gratuite Qwen OAuth que décrivent encore la plupart des tutoriels a été arrêtée le 15 avril 2026. En 2026, un budget part donc d’un endpoint payant : un Coding Plan d’Alibaba Cloud Model Studio, un forfait de Credits Token Plan, une facturation à l’usage par token, ou un endpoint tiers que vous configurez vous-même.
Ces quatre voies se mesurent en quatre unités différentes — requêtes, Credits, tokens, et ce que votre propre fournisseur facture — et c’est pour cela qu’une comparaison au prix d’appel donne la mauvaise réponse. Cette page sépare le coût du logiciel de celui de l’inférence, donne une estimation recalculable et signale ce qui n’a pas pu être vérifié. La version anglaise détaillée est Qwen Code pricing.
Le logiciel est gratuit, les modèles non
Le dépôt QwenLM/qwen-code est sous Apache-2.0 et activement développé ; l’API GitHub le donnait non archivé le 1er octobre 2026, avec un push le jour même. Les versions sortent au moins chaque semaine : la v0.24.7 a été publiée sur npm (@qwen-code/qwen-code) le 29 septembre 2026. Installation par script autonome, npm (Node.js 22 ou plus) ou Homebrew. Le même dépôt gratuit livre une application de bureau, une interface web (qwen serve --open), des extensions VS Code, Zed et JetBrains et des SDK TypeScript, Python et Java ; aucune de ces surfaces n’est une option payante et aucune n’inclut d’inférence.
Une parenté à écarter : Qwen Code reposait au départ sur Google Gemini CLI v0.8.2, mais le projet ne se synchronise plus avec lui depuis la v0.1. Quotas et tarifs de Gemini CLI ne s’appliquent pas.
La limite gratuite : ce qui s’est arrêté, et quand
La documentation d’authentification indique que l’offre gratuite Qwen OAuth a été arrêtée le 2026-04-15 et que les jetons déjà en cache peuvent fonctionner brièvement, mais que les nouvelles requêtes sont refusées. Dans l’interface, choisir Qwen OAuth affiche désormais « Discontinued — switch to Coding Plan or API Key ».
| Période | Quota OAuth gratuit | Source |
|---|---|---|
| Jusqu’à la v0.9.0 (npm, 3 février 2026) | 2 000 requêtes/jour, 60 requêtes/minute | Documentation d’authentification au tag v0.9.0 |
| À partir de la v0.10.0 (npm, 9 février 2026) | 1 000 requêtes/jour, 60 requêtes/minute | Même fichier aux tags v0.10.0 à v0.14.0 |
| À partir du 15 avril 2026 | Aucun — arrêté | Documentation actuelle ; issue #3316 |
La date exacte du passage de 2 000 à 1 000 requêtes n’a été annoncée nulle part : la fourchette ci-dessus vient du tag de version où la documentation a changé. Le chiffre de 100 requêtes par jour qui circule n’apparaît dans aucun des tags vérifiés ; considérez-le comme non étayé. Les modèles Qwen OAuth sont par ailleurs codés en dur et ne peuvent pas être redirigés via modelProviders.
Trois endpoints officiels, trois unités de facturation
Dans /auth, Alibaba ModelStudio ouvre un sous-menu Coding Plan, Token Plan et Standard API Key. Ce ne sont pas trois façons de payer la même facture : la documentation donne à chacun son hôte et sa clé, et demande d’accorder le baseUrl au forfait de la clé. Les clés Coding Plan commencent par sk-sp-.
| Voie | Facturé en | Prix publié (1er octobre 2026) | Hôte |
|---|---|---|---|
| Coding Plan Pro (international) | Requêtes | $50/mois | coding-intl.dashscope.aliyuncs.com |
| Coding Plan Pro (site chinois) | Requêtes | ¥200/mois ; ¥39,90 le premier mois pour un nouveau client | coding.dashscope.aliyuncs.com |
| Token Plan, Personal | Credits | Lite $8 (promo $6), Essential $16 ($10), Standard $25 ($18), Pro $80 ($68) par mois | token-plan.ap-southeast-1.maas.aliyuncs.com |
| Token Plan, Team | Credits | Standard $30 ($20), Pro $100 ($75), Max $200 par siège et par mois | Même hôte Singapour |
| Standard API Key | Tokens | Par modèle, par tranche de longueur d’entrée | dashscope.aliyuncs.com |
La page Coding Plan applique trois plafonds simultanés au Pro : jusqu’à 6 000 requêtes par 5 heures, 45 000 par semaine et 90 000 par mois ; dès que l’un est atteint, les appels sont suspendus. Le quota de 5 heures se libère au fil de l’eau, le quota hebdomadaire repart le lundi à 0 h (UTC+8) et le mensuel à la date de renouvellement. Le 1er octobre 2026, la page signalait aussi une disponibilité limitée : places en nombre limité, premier arrivé premier servi, réapprovisionnées chaque jour (0 h UTC+8 à l’international, 9 h 30 UTC+8 sur le site chinois). L’offre Lite n’existe plus : nouvelles souscriptions arrêtées le 20 mars 2026, renouvellements et montées de gamme le 13 avril 2026. Et ¥200 n’est pas la conversion de $50 : traitez les deux vitrines comme des offres distinctes.
Ce que coûte vraiment une requête : chaque question consomme du quota selon le nombre d’appels de modèle, et Alibaba indique 5 à 10 appels pour une tâche simple, 10 à 30 ou plus pour une tâche complexe. Une instruction vaut donc plusieurs requêtes ; à ce compte, 90 000 requêtes par mois représentent grossièrement entre 3 000 et 18 000 tâches — mais Alibaba présente ces chiffres comme typiques, pas garantis. Mesurez sur votre compte avant de dimensionner.
Le Token Plan appelle deux remarques. D’abord, il a changé : le 1er octobre 2026, la page Token Plan attribuait aux forfaits Personal un quota mensuel (cycle de 30 jours à partir de la souscription) de 11 500, 25 500, 45 000 et 180 000 Credits pour Lite, Essential, Standard et Pro, suspendait le service une fois le quota atteint, vendait des paquets supplémentaires à $15 les 20 000 Credits et précisait que le quota non utilisé n’est pas reporté. Ensuite, aucune conversion Credits → tokens n’y est publiée, ni multiplicateur par modèle : rien ne permet de dire ce que $18 par mois achètent en tokens. L’offre n’est vendue que dans la région Singapour.
Le paiement à l’usage, par token
La page des tarifs Model Studio donne des prix en dollars par million de tokens, par tranche de longueur d’entrée de chaque requête. Colonne Singapour ci-dessous ; les tarifs Chine (Pékin) sont distincts et nettement plus bas, vérifiez donc votre région de facturation.
| Modèle | Entrée 0-32K | 32K-128K | 128K-256K | 256K-1M |
|---|---|---|---|---|
| qwen3-coder-plus | $1 entrée / $5 sortie | $1,8 / $9 | $3 / $15 | $6 / $60 |
| qwen3-coder-next | $0,3 entrée / $1,5 sortie | $0,5 / $2,5 | $0,8 / $4 | Non listé |
Lisez la dernière tranche avant de budgéter une longue session d’agent : la sortie de qwen3-coder-plus passe de $5 à $60 par million dès que l’entrée d’une requête dépasse 256K. Les nouveaux comptes Singapour reçoivent 1 million de tokens gratuits par modèle, valables 90 jours — un essai, pas une offre gratuite. Méfiez-vous aussi de la page officielle de baisse de prix de qwen3-coder-plus : la remise de cache qu’elle annonce courait du 24 juillet au 23 août 2025.
Brancher Qwen Code sur un autre endpoint
Qwen Code parle quatre protocoles — OpenAI Chat Completions, OpenAI Responses, Anthropic et Gemini/Vertex — et chacun accepte une URL de base personnalisée ; sa propre documentation cite OpenRouter et Fireworks AI comme alternatives après l’arrêt d’OAuth. Kunavo sert /v1/chat/completions, /v1/responses et /v1/messages sous https://api.kunavo.com/v1.
Soyons clairs sur ce que cela apporte. Le catalogue Kunavo ne contient aucun modèle texte Qwen : ce n’est pas une façon moins chère de faire tourner Qwen, mais de faire tourner Claude ou GPT dans Qwen Code avec un seul solde prépayé. Kunavo n’a pas non plus exécuté Qwen Code contre ces endpoints ; la configuration ci-dessous vient de la documentation de Qwen Code, comme la page de configuration Qwen Code en anglais.
{
"modelProviders": {
"openai": [
{
"id": "claude-sonnet-5",
"name": "Claude Sonnet 5",
"baseUrl": "https://api.kunavo.com/v1",
"envKey": "KUNAVO_API_KEY"
}
]
},
"security": {
"auth": {
"selectedType": "openai"
}
},
"model": {
"name": "claude-sonnet-5"
}
}Quatre faits qui évitent des heures de débogage, tirés de la référence des model providers : le baseUrl s’arrête à /v1 (le SDK ajoute le chemin ; avec /v1/chat/completions, c’est un 404) ; la clé est lue dans la variable nommée par envKey, de préférence via .qwen/.env plutôt qu’en clair dans settings.json ; l’entrée modelProviders sélectionnée passe avant les options CLI --openai-base-url et --openai-api-key, d’où l’impression qu’elles sont ignorées ; et wireApi: "responses" n’a ni détection d’endpoint ni repli automatique — commencez en Chat Completions.
Deux limites à prévoir. L’outil web_search intégré s’appuie sur la recherche côté serveur de DashScope : actif avec une Standard API Key ou un Token Plan, inactif avec le Coding Plan (non vérifié sur cet endpoint), et inactif avec un fournisseur tiers ou un endpoint sur un autre hôte. L’alternative documentée est un serveur de recherche MCP. Et une voie Kunavo ne sert que le chat : pas d’embeddings, de synthèse ni de reconnaissance vocale.
Une estimation mensuelle recalculable
Supposons un mois de 20 millions de tokens d’entrée non mis en cache et 1 million de tokens de sortie. Aux tarifs actuels du catalogue Kunavo :
| Modèle | Entrée / sortie par million | Mois estimé | Rôle possible |
|---|---|---|---|
| Claude Haiku 4.5 | $0,70 / $3,50 | $17,50 | Modifications bornées et volume élevé |
| GPT-5.6 Terra | $0,70 / $4,20 | $18,20 | Raisonnement et outils mêlés |
| Claude Sonnet 5 | $1,40 / $7,00 | $35,00 | Changements difficiles dans le dépôt |
C’est de l’arithmétique sur une charge supposée, pas une tâche Qwen Code mesurée ni un plafond de facture ; cache, outils externes et taxes exclus, et elle suppose que le modèle moins cher finit le travail sans nouvelle tentative. Le montant du catalogue Kunavo est un plancher de facturation, pas un plafond : quand l’amont déclare son coût, la facture est le plus élevé entre le coût catalogue et le coût amont multiplié par la majoration applicable. Ce tableau ne se compare pas au Coding Plan à $50 (qui compte des appels, pas des tokens) ni au Token Plan (Credits sans conversion publiée) : pour comparer un forfait et un compteur, il faut votre propre consommation mesurée des deux côtés.
Kunavo démarre à une recharge prépayée de $10, sans abonnement — le montant pour ouvrir un compte approvisionné, pas le prix d’une tâche. Le checkout Stripe accepte les cartes (Visa, Mastercard, American Express), Apple Pay et Link ; le prélèvement SEPA n’est pas proposé pour l’instant.
Quelle voie choisir, et quand
| Choisir | Quand cela convient | Ce que vous cédez |
|---|---|---|
| Coding Plan | Un usage Qwen quotidien et régulier qui reste sous les plafonds de requêtes | Appels suspendus à chaque plafond ; pas de recherche web intégrée ; quota partagé avec tout autre outil utilisant la clé ; places limitées |
| Paiement à l’usage par token | Usage irrégulier ou ponctuel, longues sessions à chiffrer précisément | Tranches de longueur d’entrée qui font grimper le tarif sur les grosses requêtes |
| Credits Token Plan | Vous avez confirmé le taux en Credits de vos modèles dans votre console | Pas de conversion publique, quota mensuel qui suspend le service une fois épuisé, Singapour uniquement |
| Une passerelle comme Kunavo | Vous voulez Claude ou GPT dans Qwen Code avec un seul solde prépayé | Pas de modèles Qwen ; configuration manuelle ; pas de recherche web intégrée |
| Inférence locale | Vous avez le matériel adapté et le modèle gère vos outils | Matériel, maintenance et fiabilité des appels d’outils deviennent votre affaire |
Gardez les deux questions séparées : le prix par million de tokens se lit sur une page ; le coût le plus bas pour finir votre tâche est une mesure que personne n’a publiée pour ce client, nous compris. Lancez les trois mêmes tâches — une petite modification, une correction de bug, une enquête multi-fichiers — sur deux voies et comparez les montants enregistrés. Pour essayer la voie passerelle, créez un compte Kunavo puis suivez le quickstart.
FAQ
Combien coûte Qwen Code ?
Le client Qwen Code ne coûte rien : il est open source sous Apache-2.0 sur GitHub (QwenLM/qwen-code), sans niveau payant, sans siège ni abonnement, et l'application de bureau, l'interface web, les extensions d'éditeur et les SDK sont dans le même dépôt gratuit. Ce que vous payez, c'est l'inférence du modèle, achetée séparément auprès de l'endpoint que vous configurez.
Qwen Code est-il encore gratuit ? Quelle est la limite gratuite ?
Le logiciel reste gratuit, l'inférence hébergée gratuite non. La documentation d'authentification de Qwen Code indique que l'offre gratuite Qwen OAuth a été arrêtée le 15 avril 2026, et OAuth n'est plus sélectionnable dans le menu /auth. Les tutoriels qui annoncent 2 000 requêtes par jour décrivent le quota livré jusqu'à la v0.9.0 de février 2026. Il reste, côté Alibaba, un crédit d'essai pour les nouveaux comptes : 1 million de tokens par modèle dans la région Singapour, valable 90 jours — un essai, pas une offre gratuite.
Combien coûte le Coding Plan d'Alibaba pour Qwen Code ?
Sur le site international, le Coding Plan Pro coûte $50 par mois, avec trois plafonds simultanés : 6 000 requêtes par tranche de 5 heures, 45 000 par semaine, 90 000 par mois ; dès qu'un plafond est atteint, les appels sont suspendus. Une requête correspond à un appel de modèle, et Alibaba indique qu'une tâche simple en consomme en général 5 à 10, une tâche complexe 10 à 30 ou plus. Sur le site chinois, le même Pro est à ¥200 par mois (¥39,90 le premier mois pour un nouveau client). Le 1er octobre 2026, l'offre était en disponibilité limitée, avec des places réapprovisionnées chaque jour. L'ancienne offre Lite n'est plus vendue.
Quelle est l'API la moins chère pour Qwen Code ?
Le prix par million de tokens le plus bas et le coût le plus bas pour finir une tâche sont deux questions différentes, et seule la première se lit sur une grille tarifaire. Parmi les tarifs publiés par Alibaba pour Singapour, qwen3-coder-next à $0,30 en entrée et $1,50 en sortie par million (tranche 0-32K) est moins cher que qwen3-coder-plus à $1 et $5. Qu'un modèle moins cher soit vraiment moins cher sur votre dépôt dépend du nombre de tentatives qu'il lui faut, ce qu'aucune grille ne mesure.
Puis-je payer des modèles Qwen avec un crédit Kunavo ?
Non. Le catalogue Kunavo ne contient aucun modèle texte Qwen, Kunavo n'est donc pas une voie moins chère vers Qwen. Ce que Kunavo peut faire, c'est servir des modèles Claude et GPT via des endpoints compatibles OpenAI (Chat Completions et Responses) et Anthropic Messages, des formats que Qwen Code sait utiliser. Kunavo n'a pas exécuté Qwen Code contre ces endpoints : c'est une configuration documentée à essayer, pas une intégration vérifiée.
Vérifié le 1er octobre 2026 : dépôt, versions et documentation de Qwen Code (branche main et tags v0.9.0 à v0.15.0 pour l’historique du quota gratuit), registre npm, pages Coding Plan (international et site chinois), Token Plan et tarifs de Model Studio. Les tarifs Kunavo viennent du catalogue en direct ; les totaux mensuels sont une arithmétique de tokens illustrative, pas des coûts de tâche mesurés.