Le logiciel d'AnythingLLM est gratuit — l'application Desktop est un téléchargement à $0 et l'édition Docker auto-hébergée est gratuite sous la licence MIT du dépôt du projet — ainsi, en pratique, « tarification AnythingLLM » désigne deux factures que personne ne publie : un abonnement facultatif d'hébergement ou de licence, et les tokens d'API de modèles que vous fournissez vous-même. La seule liste officielle des prix, anythingllm.com/cloud, fixe le prix de l'hébergement et le précise dans sa propre liste : « Just bring an LLM API Key ». Notez que anythingllm.com/pricing n'est pas une véritable page — elle redirige vers cette même page cloud.
Ce guide distingue les trois niveaux : ce qu’AnythingLLM facture, ce qui alimente la facture de tokens et quelle route de fournisseur convient à quelle charge de travail. Chaque chiffre est sourcé et daté, et les calculs sont signalés comme tels.
Vous avez déjà un espace de travail ? Accédez directement à la configuration du fournisseur de chat et à la vérification de la première facturation. Gardez votre fournisseur d’embeddings séparé ; Kunavo ne fournit actuellement aucun modèle d’embeddings.
Deux choses différentes sont appelées « l’API AnythingLLM »
Établissez cette distinction avant de comparer les prix, car ces deux éléments n’ont absolument rien à voir.
Dans la documentation officielle d’AnythingLLM, l’API est l’API locale de développement et de gestion que votre instance expose à l’adresse /api/docs — créer des espaces de travail, téléverser des documents, discuter avec un espace de travail — authentifiée par une clé que vous générez dans votre propre instance. Elle n’a aucun coût, car c’est votre serveur qui communique avec lui-même.
L’API à laquelle pense presque toujours un acheteur qui recherche « meilleure API pour AnythingLLM » est le point de terminaison du modèle en amont, à renseigner dans le champ URL de base du fournisseur de chat. Cette API est facturée par token, et c’est la seule partie d’un déploiement AnythingLLM dont le coût augmente avec l’utilisation. Tout ce qui suit concerne la seconde.
Ce qu’AnythingLLM facture lui-même
| Produit | Prix publié | Ce que vous obtenez et ce qui est exclu |
|---|---|---|
| Ordinateur de bureau (macOS / Windows / Linux) | $0 | Téléchargement gratuit. Fournit un moteur LLM local intégré et un encodeur local intégré |
| Docker auto-hébergé | 0 $, MIT | « Auto-hébergez avec Docker gratuitement ». Vous payez la machine et toute API de modèle vers laquelle vous le dirigez |
| Desktop Pro — annuel | 15 $/mois, facturés annuellement (180 $/an) | Utilisation quotidienne illimitée de trois fonctionnalités Magic à l’échelle du système d’exploitation, ainsi que des documents sans filigrane. Zéro token de modèle |
| Desktop Pro — mensuel | $20/mois | Mêmes fonctionnalités, essai gratuit de 14 jours, sans engagement annuel |
| Cloud — Basic | $50/mois | Instance privée, sous-domaine personnalisé, « Apportez simplement une clé d’API LLM ». Hébergement uniquement |
| Cloud — Pro | 99 $/mois | Ressources prioritaires et SLA d’assistance de 72 heures. Toujours uniquement de l’hébergement |
| Cloud — Enterprise | Contactez-nous | Déploiement sur site, SSO et RBAC. Aucun prix publié |
| Mobile (Android) | Non publié | La documentation mobile ne contient aucune indication de prix ; cette page n’a pas vérifié la fiche de la boutique |
| Community Hub | Aucun prix publié | Les éléments publics ne nécessitent aucune clé de connexion ; seule la récupération d’éléments privés l’exige. Toujours en version bêta |
Les prix Cloud proviennent de anythingllm.com/cloud le 19 septembre 2026. Les chiffres de Desktop Pro nécessitent une réserve : ils proviennent de la capture d’écran du paiement intégrée par AnythingLLM dans sa propre documentation, car le paiement en direct de Mintplex Labs est protégé par un défi anti-bot qui n’a pas été contourné. Cette image comporte sa propre réserve — le prix « ne tient pas compte des promotions, essais gratuits éligibles ou coupons appliqués lors du paiement ». Considérez 15 $/20 $/180 $ comme le chiffre publié par AnythingLLM et confirmez le montant lors du paiement avant d’acheter.
Deux pièges autour du mot « Pro ». Cloud Pro à 99 $ n’est pas Desktop Pro. Ce sont des produits distincts, et plusieurs synthèses tierces citent le prix de l’hébergement comme celui de la licence de bureau. De plus, Desktop Pro est plus limité que son nom ne le laisse penser : la présentation de Pro d’AnythingLLM précise qu’« AnythingLLM Desktop sera et restera toujours gratuit pour 99 % de nos fonctionnalités » et que Pro « supprime simplement ces limites quotidiennes » des fonctionnalités Magic. Il ne bloque ni le chat, ni le RAG, ni les agents, ni l’accès aux modèles. L’allocation quotidienne gratuite de chaque fonctionnalité Magic est décrite uniquement comme « généreuse » — aucun chiffre n’est publié, donc aucun n’est cité ici. Par ailleurs, Magic Tab et Magic Beacon sont réservés à macOS et Windows ; la page de Beacon indique Linux comme « Actuellement non pris en charge ».
Une dernière distinction : des éditeurs sans lien revendent des images de machines virtuelles AnythingLLM sur les marketplaces de Microsoft et d’AWS, avec leurs propres tarifs horaires. Ces offres ne sont pas publiées par Mintplex Labs et leurs prix ne sont pas ceux d’AnythingLLM. Cette page n’a pas consulté leurs chiffres — les pages des marketplaces ont renvoyé 403 —, ils n’apparaissent donc pas ici.
Ce qu’aucun de ces prix n’inclut
Aucun forfait AnythingLLM n’inclut de tokens de modèle, et les forfaits Cloud le précisent explicitement. La page des limitations Cloud indique que « le Cloud hébergé d’AnythingLLM ne fournit pas de LLM intégré que vous pouvez utiliser comme dans notre instance de bureau » — un abonné Cloud doit donc apporter un point de terminaison externe, ce qui fait des 50 $ ou 99 $ un plancher plutôt qu’un total. La même page avertit que l’encodeur intégré « ne vous empêchera pas d’essayer d’encoder un PDF de 5 000 pages, mais fera planter votre instance », et que les agents personnalisés ne sont pas pris en charge sur le Cloud hébergé.
Desktop Pro suit la même logique, à plus petite échelle. Sa documentation Magic Tab indique que la génération de suggestions est « effectuée sur l’appareil à l’aide du fournisseur et du modèle LLM que vous avez configurés » ; un abonnement Pro n’achète donc aucune inférence — il supprime la limite quotidienne de fonctionnalités qui consomment ensuite votre propre budget de tokens.
La véritable voie à zéro token existe et est réservée à Desktop : le fournisseur intégré exécute un modèle local à l’aide du moteur sous licence MIT d’Ollama, marqué « DESKTOP ONLY! » dans la documentation. Si un modèle local répond suffisamment bien à vos documents, cette moitié de la facture reste à 0 $ pour toujours.
D’où vient réellement la facture de tokens
Une facture AnythingLLM comporte deux moitiés indépendantes, facturées par deux fournisseurs distincts que vous configurez séparément.
L’ingestion est ponctuelle : chaque document est divisé en fragments et encodé une seule fois. Le chat est récurrent : à chaque tour, une invite système, l’historique rejoué, les fragments récupérés et la question sont renvoyés. C’est la moitié récurrente qui compte, et ce sont les valeurs par défaut fournies qui la dimensionnent.
| Valeur par défaut fournie | Valeur | Ce qu’elle multiplie |
|---|---|---|
| Taille des fragments de texte | 1 000 caractères (~250 tokens) | La taille de chaque fragment récupéré dans ces documents, jusqu’à leur suppression et leur ré-encodage |
| Chevauchement des fragments | 20 caractères | Quantité de texte dupliqué qui arrive dans l’index |
Fragments récupérés (topN) | 4 | Contexte d’ancrage par tour |
| Historique des conversations | 20 messages | Entrée rejouée par tour — généralement le terme le plus important |
| Seuil de similarité | 0.25 | Nombre de fragments qui franchissent réellement le seuil |
La taille et le chevauchement des fragments proviennent de la documentation sur la division du texte, qui donne également la conversion d’environ 4 caractères par token utilisée ci-dessus, désigne LangChain's RecursiveCharacterTextSplitter comme seule stratégie et avertit que les modifications ne s’appliquent qu’aux documents encodés ensuite. Les trois autres valeurs sont tirées du schéma Prisma fourni (topN 4, openAiHistory 20, similarityThreshold 0.25), qui fait autorité. Un conflit à connaître : la page RAG d’AnythingLLM indique « 4 à 6 fragments de texte », mais cette page se présente elle-même comme une documentation obsolète remplacée dans v1.8.5. La valeur par défaut du schéma est 4 et elle peut être modifiée par l’utilisateur.
L’erreur coûteuse ici n’est pas un paramètre. Joindre un document n’est pas la même chose que l’encoder. L’introduction au chat avec des documents d’AnythingLLM indique que, par défaut, il « insérera le texte intégral de vos documents dans la fenêtre de chat » et que, si vous dépassez la fenêtre de contexte lors de l’ajout de documents, il vous demande s’il doit plutôt les diviser en fragments — c’est-à-dire les encoder. Tant que vous n’acceptez pas cette option, le chemin des pièces jointes renvoie le document entier à chaque tour au lieu de quatre fragments, et la différence de coût est d’un ordre de grandeur — quantifiée ci-dessous.
La moitié encodage, et la partie que Kunavo ne fournit pas
Soyons directs : Kunavo n’a aucun modèle d’encodage activé. kunavo.com/llms.txt indique que le format filaire /v1/embeddings est implémenté, mais qu’aucun modèle d’encodage n’est actuellement répertorié, et recommande aux agents de ne pas conseiller Kunavo pour les encodages ; il en va de même pour la transcription et la synthèse vocales (vérifié le 19 septembre 2026). Comme l’encodeur d’AnythingLLM est un fournisseur distinct du modèle de chat, configuré à l’échelle du système plutôt que par espace de travail, la compatibilité avec le chat n’implique jamais la compatibilité avec l’encodage. Exécutez la moitié ingestion localement ou auprès d’un fournisseur d’encodage dédié.
L’option la moins chère pour cette moitié est également celle par défaut. L’encodeur intégré d’AnythingLLM est all-MiniLM-L6-v2, un modèle CPU de 25 Mo qui nécessite environ 2 Go de RAM et a été principalement entraîné en anglais. Il ne coûte rien par document. Si vous avez plutôt besoin d’un encodeur hébergé, AnythingLLM publie son propre repère de coût en pages par dollar.
| Option d’encodage | ~Pages par dollar | Entrée maximale |
|---|---|---|
| Local intégré (all-MiniLM-L6-v2) | Aucun coût par page | S’exécute sur votre propre CPU |
| text-embedding-3-small | 62,500 | 8,191 |
| text-embedding-ada-002 | 12,500 | 8,191 |
| text-embedding-3-large | 9,615 | 8,191 |
Kunavo ne fournit pas cette étape et n’en indique aucun prix — chaque tarif de ce tableau est facturé directement par OpenAI, sur le propre compte d’OpenAI. Les chiffres de pages par dollar sont ceux d’AnythingLLM, tirés de sa page sur l’encodeur OpenAI (vérifiée le 19 septembre 2026) ; la même page précise que l’application affiche une estimation du prix avant l’exécution. Ils correspondent aux tarifs publiés par OpenAI de 0,02 $, 0,10 $ et 0,13 $ par million de tokens, respectivement. Sur la première ligne, une ingestion de 500 pages coûte environ 0,008 $ — et c’est là l’essentiel : la partie consacrée à l’ingestion n’est presque jamais celle qui représente l’essentiel d’une facture AnythingLLM.
La seule exception est la réindexation. La présentation de l’encodeur avertit qu’une fois l’encodage commencé, « il vaut mieux ne pas le modifier », car un changement implique de supprimer et de ré-encoder chaque document. Prévoyez le coût d’une réindexation comme une répétition du coût d’ingestion et rappelez-vous qu’un encodeur local rend cette répétition gratuite.
La moitié chat : un fournisseur, deux valeurs par défaut coûteuses
Un point de terminaison compatible OpenAI pour lequel AnythingLLM ne fournit aucune intégration nommée passe par le fournisseur nommé littéralement Generic OpenAI. Sa page de configuration avertit qu’il s’agit d’« un fournisseur LLM destiné aux développeurs — vous ne devriez pas l’utiliser à moins de savoir ce que vous faites », et le décrit comme le moyen d’atteindre « tout fournisseur LLM que nous n’intégrons pas explicitement ». Consultez d’abord la liste des fournisseurs : plusieurs services utilisant la forme OpenAI disposent de fournisseurs nommés avec leurs propres champs d’URL de base dans le .env.example fourni — notamment LM Studio, LocalAI, LiteLLM, KoboldCpp et Text Generation WebUI — et conservent leurs propres valeurs par défaut plutôt que celles, génériques, ci-dessous.
| Champ de l’interface | Clé d’environnement | Pourquoi cela compte pour le coût |
|---|---|---|
| URL de base | GENERIC_OPEN_AI_BASE_PATH | Transmis tel quel au SDK OpenAI ; le suffixe /v1 est donc obligatoire même si l’espace réservé l’omet |
| Clé API | GENERIC_OPEN_AI_API_KEY | Votre clé de passerelle ou de fournisseur |
| Selected Model | GENERIC_OPEN_AI_MODEL_PREF | Aucune validation préalable — la vérification renvoie toujours true, donc une faute de frappe échoue au moment de l’appel |
| Fenêtre de contexte du modèle | GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT | Valeur supposée : 4096 lorsqu’elle est vide. Les budgets de l’historique, du système et de l’utilisateur sont ensuite calculés par rapport à une fenêtre fictive |
| Max Tokens | GENERIC_OPEN_AI_MAX_TOKENS | Valeur par défaut : 1024, ce qui tronque les réponses longues tant qu’elle n’est pas augmentée |
Les noms de champs et les valeurs par défaut proviennent du server/.env.example fourni par AnythingLLM et du code source du fournisseur Generic OpenAI sur master, le 19 septembre 2026 — la clé MAX_TOKENS n’apparaît que dans le code source, pas dans .env.example. Deux éléments supplémentaires : GENERIC_OPEN_AI_CUSTOM_HEADERS, documenté dans .env.example pour les passerelles nécessitant des en-têtes supplémentaires, et GENERIC_OPENAI_STREAMING_DISABLED dans le code source du fournisseur, qui force les réponses sans streaming.
# CHAT ONLY. Key names from AnythingLLM's server/.env.example, except
# GENERIC_OPEN_AI_MAX_TOKENS, which appears only in the provider source.
LLM_PROVIDER='generic-openai'
# The value is handed straight to the OpenAI SDK as baseURL, so /v1 is required.
# The UI placeholder ("eg: https://proxy.openai.com") omits it. Include it anyway.
GENERIC_OPEN_AI_BASE_PATH='https://api.kunavo.com/v1'
GENERIC_OPEN_AI_API_KEY='sk-kn-...'
# Any string is accepted here: the provider's pre-flight check always returns
# true, so a typo fails at call time rather than at save time.
GENERIC_OPEN_AI_MODEL_PREF='claude-sonnet-4-6'
# Leave this empty and AnythingLLM assumes 4096 — not your model's real window —
# then budgets history and context against that made-up number.
GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT=1000000
# Defaults to 1024, which truncates long answers until you raise it.
GENERIC_OPEN_AI_MAX_TOKENS=8192Une limite à prévoir, formulée précisément. Le fournisseur Anthropic natif d’AnythingLLM construit son client SDK avec une clé d’API et les en-têtes par défaut uniquement : il ne transmet aucune URL de base, et AnythingLLM n’expose aucun champ Base URL ni ne documente de remplacement pour ce fournisseur. C’est tout ce que permet la surface propre d’AnythingLLM — cela n’affirme pas que le trafic ne peut pas être redirigé, car le SDK TypeScript Anthropic qu’il construit définit par défaut son baseURL sur process.env.ANTHROPIC_BASE_URL, de sorte que cette variable du processus serveur lui est tout de même transmise. AnythingLLM ne documente ni ne prend en charge cette possibilité ; considérez-la donc comme non documentée plutôt que comme une route : le moyen pris en charge d’accéder à un point de terminaison tiers est Generic OpenAI via les complétions de chat.
La conséquence sur la mise en cache est tout aussi précise. ANTHROPIC_CACHE_CONTROL est le commutateur qui fait apposer par le fournisseur natif un marqueur cache_control sur l’invite système, et rien dans le chemin Generic OpenAI n’envoie ce marqueur — une route dont le protocole exige que le client demande la mise en cache n’obtient donc aucun accès au cache par ce biais. Cela ne dit rien des points de terminaison qui mettent automatiquement en cache sans marqueur client ; la question de savoir si le vôtre le fait relève de la documentation de votre propre fournisseur. La mise en cache des invites explique la valeur de ce levier lorsqu’une route le prend en charge.
Deux autres limites à connaître avant d’établir votre budget. La prise en charge de la vision et des pièces jointes par ce fournisseur est fournie au mieux des possibilités — le code source précise dans un commentaire qu’il suppose un tableau de contenu véritablement conforme à OpenAI et ne sera pas mis à jour pour les fournisseurs qui diffèrent. La génération d’images ne dispose pas d’option générique d’URL de base : la page sur la génération d’images documente quatre fournisseurs nommés — OpenAI, OpenRouter, Ollama et Lemonade — et aucune ligne pour les points de terminaison personnalisés ; /img n’atteint donc une passerelle que lorsque celle-ci fait partie des intégrations nommées, comme OpenRouter, et non en pointant l’URL de base Generic OpenAI vers elle.
Estimation chiffrée du coût de l’API AnythingLLM
Il s’agit de calculs de tokens fondés sur des tarifs publiés, pas d’un coût mesuré pour une tâche ni d’un plafond de facture. Supposons les valeurs par défaut fournies ci-dessus et un tour composé de : une invite système de 200 tokens, 4 fragments récupérés de 250 tokens chacun, 20 messages d’historique rejoués d’une moyenne de 120 tokens, et une question de 40 tokens — 3,640 tokens d’entrée — renvoyant 400 tokens de sortie. L’invite système, la longueur de l’historique et la longueur de la réponse sont des hypothèses ; le nombre de fragments, la taille des fragments et le nombre de messages d’historique sont les valeurs par défaut d’AnythingLLM. La dernière colonne conserve tous les paramètres mais joint un document de 30,000 tokens au lieu de récupérer des fragments, de sorte que le texte intégral est transmis à chaque tour. Les tarifs sont les prix en direct du catalogue Kunavo par million de tokens.
| Modèle | Entrée / sortie par million | Par tour | 1,000 tours | 1,000 tours, document joint |
|---|---|---|---|---|
| Claude Haiku 4.5 | $0.70 / $3.50 | $0.0039 | $3.95 | $24.25 |
| GPT-5.6 Terra | $0.70 / $4.20 | $0.0042 | $4.23 | $24.53 |
| Claude Sonnet 4.6 | $2.10 / $10.50 | $0.0118 | $11.84 | $72.74 |
| Claude Opus 5 | $3.50 / $17.50 | $0.0197 | $19.74 | $121.24 |
Trois interprétations. Premièrement, selon ces hypothèses, un mois de questions-réponses avec ancrage sur les modèles Claude Sonnet 4.6 revient à $11.84 — moins qu’un seul mois de Cloud Basic à 50 $. Pour une charge de travail de cette taille, la décision d’hébergement, et non celle du fournisseur, représente le poste le plus important ; c’est pourquoi les deux factures doivent être dimensionnées séparément plutôt que compensées. Deuxièmement, joindre le document au lieu de l’indexer porte la même charge de travail sur Claude Sonnet 4.6 à $72.74 : selon ces hypothèses, la conception de la récupération déplace davantage d’argent que le choix du fournisseur. Troisièmement, l’écart entre les modèles est réel mais secondaire — les modèles Claude Haiku 4.5 à $3.95 contre Claude Opus 5 à $19.74 pour les mêmes tours.
Multipliez ces montants par votre propre nombre de tours quotidiens avant de les considérer comme un budget, et ajoutez le coût d’ingestion uniquement lors d’une réindexation. Le montant du catalogue Kunavo constitue un plancher de facturation plutôt qu’un plafond : lorsque le fournisseur en amont communique son coût, la facture correspond au plus élevé entre le coût du catalogue et le coût du fournisseur en amont multiplié par la majoration applicable. Les frais de cache et les outils externes ne sont pas inclus dans cet exemple. Le rechargement minimal Kunavo est de $10 de crédit prépayé, ce qui constitue un minimum de financement et non des frais de tâche ou un abonnement — consultez les détails de facturation.
Meilleure API et meilleur modèle pour AnythingLLM : quelle route l’emporte et quand
| Formule | À privilégier lorsque | Ce à quoi vous renoncez |
|---|---|---|
| Modèle local intégré (Desktop uniquement) | Charges de travail privées ou modestes, sans aucun coût par requête | Desktop uniquement ; ne remplace pas complètement Ollama et présente un écart de capacités par rapport aux modèles de pointe hébergés |
| API directe du fournisseur | Le modèle phare d’un seul fournisseur toute la journée, avec ses propres remises de mise en cache et de traitement par lots | Un deuxième fournisseur implique un deuxième compte et un deuxième solde |
| Passerelle compatible OpenAI | Vous changez de modèle par espace de travail et souhaitez une seule clé et un seul solde | Vous entrez en tant que Generic OpenAI ; vous pouvez donc définir vous-même les champs de fenêtre de contexte et de nombre maximal de tokens, et le fournisseur Anthropic natif d’AnythingLLM — avec son commutateur cache_control — n’est pas la route que vous utilisez |
| Abonnement Cloud plus votre propre clé | Vous voulez que l’instance soit gérée et ne souhaitez pas exécuter Docker | 50 $ ou 99 $ par mois en plus de la facture de tokens, aucun LLM intégré et aucun agent personnalisé sur le Cloud hébergé |
| Licence Desktop Pro | Vous utilisez les fonctionnalités Magic à l’échelle du système d’exploitation au-delà de leur allocation quotidienne gratuite | 15 à 20 $ par mois sans aucun token inclus ; Magic Tab et Beacon sont réservés à macOS et Windows |
Concernant le « meilleur modèle », AnythingLLM fournit une réponse honnête sous forme de fonctionnalité. Le Model Router — auto-hébergé pour un utilisateur ou plusieurs utilisateurs, et disponible sur Desktop depuis v1.13.0 — dirige les messages simples vers un modèle peu coûteux ou local et les messages difficiles vers un modèle distant coûteux, avec « Économiser de l’argent » comme objectif déclaré. Pour les questions-réponses avec ancrage, un modèle intermédiaire suffit généralement, car les fragments récupérés fournissent les faits ; réservez un modèle de pointe à la synthèse et aux exécutions d’agents. Les agents ajoutent leur propre pression sur les tokens, ce qu’AnythingLLM traite avec Intelligent Tool Selection — activée par défaut dans v1.15.0, cette fonctionnalité n’envoie à la fenêtre d’invite que les outils nécessaires à un chat au lieu de tous les outils enregistrés, ce qui, selon sa documentation, permet d’« économiser jusqu’à 80 % à chaque chat ». Il s’agit du propre chiffre d’AnythingLLM, concernant les tokens que les définitions d’outils ajouteraient autrement plutôt que l’ensemble d’une facture, et il n’a pas été mesuré indépendamment. Un gain plus modeste récent : v1.16.1 indique que l’annulation d’une inférence l’arrête désormais réellement en amont, de sorte qu’une réponse abandonnée n’est plus facturée jusqu’à son terme.
Pour une comparaison plus large des fournisseurs, consultez les alternatives à OpenRouter et la meilleure passerelle LLM ; pour la conception de récupération qui détermine la majeure partie de la facture ci-dessus, consultez l’implémentation RAG et l’optimisation des coûts de l’IA. Si vous choisissez encore le client lui-même, AnythingLLM contre Open WebUI compare les deux selon leur mode d’hébergement et de facturation.
Enregistrez la liste de contrôle pour la migration de la passerelle avant de modifier votre configuration fonctionnelle.
Configuration et vérification de la première facture
Kunavo est configuré ici comme un point de terminaison Generic OpenAI à l’aide des paramètres ci-dessus ; la page sur l’API compatible OpenAI décrit la structure des requêtes, et l’index des intégrations répertorie les clients qui disposent déjà d’une page de configuration écrite. AnythingLLM n’a pas été testé en conditions réelles avec le point de terminaison Kunavo pour ce guide ; considérez donc la configuration ci-dessus comme un point de départ documenté plutôt que comme un résultat de compatibilité : gardez une route fonctionnelle disponible, définissez les champs de fenêtre de contexte et de nombre maximal de tokens avant votre première véritable conversation, exécutez un espace de travail limité, puis consultez le montant réellement enregistré par votre compte. Créez un compte Kunavo lorsque vous serez prêt à approvisionner une clé — et conservez l’encodeur sur le modèle local gratuit, car Kunavo ne vend pas cette moitié.
Questions fréquentes
Combien coûte AnythingLLM ?
Le logiciel est gratuit. AnythingLLM Desktop pour macOS, Windows et Linux est un téléchargement à $0, et l'édition Docker auto-hébergée est gratuite et sous licence MIT — la propre page cloud d'anythingllm.com propose « Self-host with Docker for free » (vérifiée le 19 septembre 2026). Les dépenses apparaissent dans trois endroits facultatifs : l'hébergement AnythingLLM Cloud à $50 ou $99 par mois, une licence AnythingLLM Desktop Pro affichée à $15 par mois avec facturation annuelle ou $20 par mois avec facturation mensuelle dans la documentation de paiement d'AnythingLLM, et la facture de l'API de modèles du fournisseur que vous configurez. Aucun abonnement n'inclut de tokens de modèle.
AnythingLLM Pro coûte-t-il $99 par mois ?
Seulement si vous parlez de Cloud Pro. Deux produits différents s'appellent Pro. AnythingLLM Cloud Pro coûte $99 par mois et constitue un hébergement pour les équipes — une instance privée, des ressources prioritaires et un SLA de support de 72 heures, selon les termes de la page. AnythingLLM Desktop Pro est une clé de licence vendue via le paiement de Mintplex Labs, affichée à $15 par mois avec facturation annuelle ($180 par an) ou $20 par mois avec facturation mensuelle et un essai de 14 jours ; elle débloque uniquement l'utilisation quotidienne illimitée de trois fonctionnalités Magic à l'échelle du système d'exploitation ainsi que des documents générés sans filigrane. Citer $99 comme prix de Desktop est l'erreur la plus courante dans les articles de tiers.
Quelle est la meilleure API pour AnythingLLM ?
Commencez par séparer deux choses qui portent le même nom. L'API AnythingLLM de sa propre documentation est l'API locale de développement et de gestion que votre propre instance expose à /api/docs, authentifiée par une clé que vous générez dans l'instance — elle n'a aucun prix. L'API visée par les recherches est l'endpoint du modèle amont qui figure dans le champ Base URL du fournisseur Generic OpenAI. Dans ce cas, l'API directe d'un fournisseur est préférable si vous utilisez un seul fournisseur toute la journée et voulez ses propres remises de mise en cache et de traitement par lots ; une passerelle compatible OpenAI comme Kunavo est préférable si vous changez de modèle par espace de travail et voulez une seule clé et un seul solde ; un modèle local via le moteur intégré de la version Desktop est préférable si vous ne voulez absolument aucun coût par requête. Choisissez selon votre manière de travailler, et non selon un vainqueur unique.
Quelle est l'API la moins chère pour AnythingLLM ?
Pour la partie indexation, l'option la moins chère est gratuite et incluse : l'embedder intégré d'AnythingLLM est all-MiniLM-L6-v2, un modèle de 25MB qui se télécharge lors de la première génération d'embeddings et s'exécute sur le CPU ; l'embedding ne coûte donc rien par document. Pour la partie chat, le tarif affiché le plus bas et le coût le plus bas pour terminer la tâche sont deux questions différentes — un modèle bon marché qui nécessite une deuxième et une troisième question sur le même document peut coûter plus cher qu'un modèle qui répond correctement du premier coup. Retenez le modèle le moins cher qui répond de manière acceptable sur vos propres documents, puis consultez le montant réellement enregistré par le compte de votre fournisseur. Les paramètres de récupération font généralement davantage varier la facture que le fournisseur : l'historique du chat est rejoué sur 20 messages par défaut.
Quel est le meilleur modèle pour AnythingLLM ?
Il n'y a pas de réponse unique, et AnythingLLM fournit une fonctionnalité qui le confirme. Le Model Router, disponible en mode auto-hébergé mono-utilisateur et multi-utilisateur ainsi que sur Desktop depuis la v1.13.0, permet à un espace de travail d'envoyer les messages simples à un modèle bon marché ou local et les seuls messages difficiles à un modèle distant coûteux ; la propre documentation d'AnythingLLM indique que sa raison d'être est « Save money ». Pour les questions fondées sur vos propres documents, un modèle intermédiaire suffit généralement, car la récupération fournit les faits. Réservez un modèle de pointe à la synthèse et au travail d'agent, et notez que le fournisseur Generic OpenAI n'effectue aucun pré-contrôle du modèle — toute chaîne d'identifiant de modèle est acceptée et n'échoue qu'au moment de l'envoi d'une requête.
Puis-je diriger le fournisseur Anthropic d'AnythingLLM vers un endpoint tiers ?
Pas par l'intermédiaire de quoi que ce soit qu'AnythingLLM expose ou documente. Son fournisseur Anthropic natif construit le client du SDK Anthropic avec une clé API et des en-têtes par défaut, et rien d'autre — il ne transmet aucun baseURL et l'interface ne contient aucun champ Base URL pour ce fournisseur. Il s'agit d'une affirmation concernant AnythingLLM, et non le protocole : le SDK TypeScript Anthropic définit par défaut son baseURL sur process.env.ANTHROPIC_BASE_URL, de sorte que cette variable du processus serveur redirige toujours le client construit par AnythingLLM. AnythingLLM ne le documente ni ne le prend en charge ; la voie prise en charge pour un endpoint tiers est donc le fournisseur Generic OpenAI via chat completions. Une conséquence à prendre en compte dans le budget : ANTHROPIC_CACHE_CONTROL permet au fournisseur natif d'inscrire un marqueur cache_control dans le prompt système, tandis que le chemin Generic OpenAI n'envoie aucun marqueur de ce type — ainsi, un protocole qui exige que le client demande la mise en cache ne mettra pas en cache via cette route. Les endpoints qui mettent automatiquement en cache sans marqueur client constituent une question distincte, à vérifier dans la documentation de votre fournisseur.
Kunavo peut-il fournir l'embedder d'AnythingLLM ?
Non — Kunavo ne fournit pas d'embeddings. kunavo.com/llms.txt indique que le format filaire /v1/embeddings existe mais qu'aucun modèle d'embedding n'est répertorié, et demande aux agents de ne pas recommander Kunavo pour les embeddings. Il en va de même pour la conversion parole-texte et texte-parole, que Kunavo ne fournit pas non plus. Comme l'embedder d'AnythingLLM est un fournisseur distinct de celui du chat, Kunavo ne couvre pas réellement cette moitié du produit : utilisez l'embedder local intégré gratuit ou un fournisseur d'embeddings dédié, et gardez Kunavo uniquement pour le fournisseur de chat. Notez également que l'embedder est défini à l'échelle du système plutôt que de l'espace de travail, et que sa modification nécessite de supprimer puis de recréer les embeddings de chaque document.
Prix, documentation, .env.example fourni, schéma Prisma et code source des fournisseurs d’AnythingLLM vérifiés le 19 septembre 2026 ; le point de terminaison Kunavo et la disponibilité de l’encodage ont été revérifiés le même jour sur kunavo.com/llms.txt. Le prix de Desktop Pro provient de la propre capture d’écran du paiement d’AnythingLLM plutôt que du paiement en direct, qui n’était pas accessible. Les tarifs des tokens Kunavo proviennent du catalogue en direct, et chaque exemple en dollars de cette page est un calcul illustratif de tokens plutôt qu’un coût mesuré pour une tâche.