SillyTavern ne vend ni API ni abonnement ; choisir la meilleure API pour SillyTavern revient donc à acheter un modèle et un fournisseur — et le chiffre décisif est le coût d’un tour avec votre taille de contexte, non le prix affiché par million de tokens. SillyTavern renvoie la fiche du personnage, le prompt système et autant d’historique que possible à chaque génération ; la facture augmente donc avec la conversation, même si le tarif ne change jamais.
La version 1.19.0 a été publiée le 14 septembre 2026 sous AGPL-3.0, et le dernier push du dépôt date du 14 septembre 2026 (vérifié le 18 septembre 2026). Deux éléments ne sont pas SillyTavern : TavernAI, le projet ancêtre distinct — la documentation date SillyTavern de « février 2023, en tant que fork de TavernAI 1.2.8 » — et SillyTavern-Extras, dont la description du dépôt commence désormais par « [OBSOLETE] ». Les tutoriels qui vous demandent d’installer Extras sont obsolètes.
Ce qui est gratuit et ce qui ne l’est pas
| Ce que vous achetez | Prix | Source |
|---|---|---|
| SillyTavern, toutes plateformes | 0 $, AGPL-3.0, aucun niveau payant et aucun service hébergé vendu par le projet | La documentation précise que le projet « sera toujours gratuit et open source » |
| Quelque chose pour l’exécuter | Node.js 20 ou version ultérieure | package.json déclare "engines": { "node": ">= 20" } |
| Le modèle qui rédige les réponses | C’est l’intégralité de la facture récurrente | La documentation le décrit comme « une interface utilisateur installée localement qui vous permet d’interagir avec des LLM de génération de texte » |
| Un « hébergement SillyTavern » tiers ou des applications mobiles payantes | Le produit de quelqu’un d’autre | sillytavern.app ne publie aucun prix, quel qu’il soit |
Sources vérifiées le 18 septembre 2026 : le dépôt du projet et la FAQ officielle. La FAQ répartit les backends entre les modèles auto-hébergés, gratuits à exécuter, et les services web payants qui, selon ses termes, « coûtent de l’argent à utiliser ».
Comment une conversation SillyTavern génère sa facture
La documentation de SillyTavern sur la taille de contexte définit ce réglage comme le nombre maximal de tokens que SillyTavern enverra à l’API dans le prompt, moins la longueur de la réponse, et précise que le contexte « comprend les informations du personnage, les prompts système, l’historique de la conversation, etc. ». Les messages situés au-dessus de la ligne pointillée dans la conversation ne sont tout simplement pas envoyés, plutôt que résumés. Un tour coûte donc environ context tokens × input rate + reply tokens × output rate, et une réponse régénérée paie de nouveau l’intégralité de la partie entrée.
Le contexte Chat Completion par défaut est de 4 095 tokens, défini dans les valeurs par défaut fournies (lues le 18 septembre 2026) ; le curseur l’augmente de plusieurs ordres de grandeur, puis davantage encore avec le contexte déverrouillé. La taille de contexte est donc le principal levier budgétaire de l’application : la quadrupler multiplie environ par quatre le coût d’entrée de chaque message suivant au même tarif.
Sélection de modèles et coût de chacun
USD par million de tokens d’entrée / de sortie : tarifs actuels du catalogue Kunavo à côté du prix catalogue publié par le fournisseur, tous vérifiés le 18 septembre 2026.
| Modèle | Kunavo : entrée / sortie | Fournisseur : entrée / sortie | Utilisation conseillée |
|---|---|---|---|
| GPT-5.6 Terra | $0.70 / $4.20 | $2.00 / $12.00 | Une voix non-Claude, utile pour obtenir un second avis sur la même fiche de personnage |
| Claude Haiku 4.5 | $0.70 / $3.50 | $1.00 / $5.00 | La ligne la moins chère ici — le Claude économique pour les longues sessions où le coût d’entrée par tour domine |
| Claude Sonnet 5 | $1.40 / $7.00 | $2.00 / $10.00 | Un équilibre quotidien entre qualité et coût par tour |
| Claude Opus 5 | $3.50 / $17.50 | $5.00 / $25.00 | Niveau Claude supérieur ; comparez sa ligne avant de supposer qu’il coûte plus cher |
| Claude Fable 5.1 | $7.00 / $35.00 | $10.00 / $50.00 | Le coût par tour le plus élevé de ce tableau, aux prix du catalogue comme à ceux du fournisseur |
Les prix des fournisseurs proviennent de la page tarifaire d’Anthropic et de la tarification développeur d’OpenAI.
Une estimation mensuelle détaillée
Supposons 100 générations par mois, un prompt porté à environ 16 000 tokens, des réponses de 300 tokens et aucun nouveau tirage. Cela représente 1,6 million de tokens d’entrée et 30 000 tokens de sortie. Aux tarifs du catalogue ci-dessus :
| Modèle | Total estimé pour 100 tours |
|---|---|
| GPT-5.6 Terra | $1.25 |
| Claude Haiku 4.5 | $1.22 |
| Claude Sonnet 5 | $2.45 |
| Claude Fable 5.1 | $12.25 |
Il s’agit d’un calcul de tokens fondé sur des hypothèses, non d’une session mesurée ni d’un plafond de facturation. Modifiez une hypothèse et le résultat change : augmenter la taille de contexte, régénérer des réponses ou effectuer 500 tours au lieu de 100 augmente chaque fois la partie entrée. Les frais de cache sont également exclus ; ils font l’objet de la section suivante.
L’écart de cache qui détermine le coût d’une longue conversation
C’est la partie invisible depuis l’interface. Dans la branche de publication 1.19.0 de son backend de chat-completions (lue le 18 septembre 2026), chaque marqueur cache_control est soumis à une vérification de source intégrée : la source Claude, la source ElectronHub pour les identifiants de modèle claude-, la source OpenRouter pour les identifiants de modèle anthropic/claude, puis à nouveau la source OpenRouter pour les identifiants google/gemini qu’elle juge compatibles avec le cache, ainsi qu’un indicateur NanoGPT. La branche Custom (compatible OpenAI) ne figure dans aucune de ces vérifications et ne définit aucun champ cache_control — elle définit plutôt logprobs, un response_format si vous avez configuré un schéma JSON, vos paramètres Include Headers et Include Body Parameters, ainsi que reasoning_effort ou verbosity lorsque vous les avez demandés. Il n’existe pas non plus de section custom: dans la configuration fournie, où se trouvent les commutateurs de cache claude: et gemini:.
La conséquence concerne précisément le protocole d’Anthropic : la source Custom ne définit jamais de marqueur cache_control ; avec un modèle Claude, tout l’historique est donc refacturé au prix d’entrée complet à chaque tour, sauf si le point de terminaison insère lui-même les séparateurs. Cela ne signifie pas que rien n’est mis en cache sur ce chemin. Le cache de prompts d’OpenAI est activé par défaut pour les modèles compatibles et ne demande rien au client ; une route GPT via la même source Custom peut donc utiliser le cache, contrairement à une route Claude. Le cache est déterminé par le modèle et le point de terminaison, pas par ce que SillyTavern envoie. La traduction OpenAI-vers-Anthropic de Kunavo les insère bien — sur les blocs d’outils et du système, ainsi qu’un séparateur glissant sur le dernier message dès que la conversation contient déjà un tour assistant, ce qui correspond à une conversation SillyTavern après le premier tour. Il faut 8 192 caractères de prompt avant son activation et elle ne dépasse jamais la limite de quatre séparateurs du fournisseur. Les détails figurent dans la documentation sur le cache, destinée aux appelants qui définissent eux-mêmes les séparateurs.
Ce que cela peut rapporter, dans le meilleur des cas et non comme prévision : si 12 000 de ces 16 000 tokens de prompt étaient lus depuis le cache à chaque tour au tarif de lecture du cache de Kunavo pour Claude Sonnet 5 ($0.14 par million), les mêmes 100 tours reviendraient à environ $0.94 au lieu de $2.45. Considérez cela comme l’économie maximale disponible, et non comme un plafond de paiement : cette hypothèse suppose que le contenu demandé est trouvé dans le cache à chaque tour et ne compte aucune écriture dans le cache ; une facture réelle sera donc supérieure. Anthropic facture une lecture du cache à 0,1× le prix d’entrée de base (0,025× sur Fable 5.1), mais une écriture à 1,25× pour une fenêtre de cinq minutes — un utilisateur de roleplay qui attend plus longtemps entre deux messages paie de nouveau l’écriture au lieu de la lecture. Anthropic vend également une écriture d’une heure à 2×. Aucune session SillyTavern réelle n’a été facturée via la passerelle pour ce guide ; vérifiez donc d’abord l’utilisation indiquée lors de votre propre première longue conversation avant d’établir un budget fondé sur des lectures réussies depuis le cache.
Quand le direct, une passerelle, un abonnement ou le local l’emporte
| Formule | Achetez-le lorsque | Le compromis |
|---|---|---|
| Fournisseur direct (Anthropic, OpenAI, Google) | Vous voulez un seul fournisseur et la source intégrée de SillyTavern correspondante | La source Claude intégrée expose des réglages de cache auxquels la source Custom n’a aucun chemin de code ; un compte par fournisseur |
| Passerelle multi-modèles | Vous voulez des identifiants Claude et GPT derrière une seule clé et un seul solde | SillyTavern lui parle en chat OpenAI standard ; les contrôles propres au fournisseur qu’elle expose restent donc sur les sources intégrées |
| Hébergeur de modèles open-weight à tarif fixe | Vous discutez quotidiennement et voulez un montant mensuel prévisible | Vérifiez les limites du niveau : les forfaits d’Arli AI sont séparés par longueur maximale de contexte, exactement la ressource consommée par une longue conversation |
| Hébergement gratuit | Vous essayez l’application ou acceptez des conversations soumises à une file d’attente | Priorité et limites de débit plutôt qu’une facture |
| Modèle local | Vous avez le matériel et ne voulez ni filtre de contenu ni clé | Votre machine, votre maintenance, votre plafond de qualité |
Chiffres précis, vérifiés le 18 septembre 2026. OpenRouter répercute les prix des fournisseurs et facture 5,5 % (minimum 0,80 $) sur les achats de crédit par carte ; les modèles gratuits sont limités à 50 requêtes par jour, ou 1 000 après l’achat d’au moins 10 $ de crédits. NanoGPT propose un paiement à l’usage ainsi qu’un abonnement facultatif à 12 $ par mois, avec un dépôt minimal de 0,10 $ en cryptomonnaie ou de 1 $ par carte. Arli AI propose un niveau gratuit ainsi que des niveaux mensuels à 10 $, 15 $, 20 $, 30 $ et 160 $, qui diffèrent par la longueur maximale du contexte (12K sur le niveau gratuit jusqu’à 512K sur le niveau supérieur), la taille du modèle et les requêtes parallèles ; Infermatic affiche une formule gratuite ainsi que des formules à 9 $, 16 $ et 20 $ ; Featherless affiche Chat à 25 $ par mois et Developer à 50 $. AI Horde se décrit comme « Gratuit · géré par la communauté · open source » ; sa FAQ explique que la position dans la file dépend du solde total de kudos et que les utilisateurs anonymes commencent à zéro, de sorte que les utilisateurs inscrits passent devant eux. Google publie un niveau Gemini gratuit, mais sa page sur les limites de débit ne donne aucun chiffre gratuit par modèle et renvoie vers AI Studio ; considérez donc comme non vérifié tout quota précis du niveau gratuit lu ailleurs.
Kunavo n’a ni niveau gratuit ni crédit d’inscription : le minimum est de $10 en crédit prépayé, sans abonnement et avec un solde qui n’expire pas. Une estimation du catalogue ne constitue pas non plus un plafond tarifaire — consultez la facturation pour savoir comment une charge est réglée.
Les règles de contenu passent avant le prix
La FAQ de SillyTavern indique elle-même que les services web payants « sont souvent censurés et refuseront de discuter avec vous de certains sujets ». C’est une information de première main et l’attente appropriée à établir. La politique d’utilisation d’Anthropic interdit les conversations érotiques et la génération sexuellement explicite, sans exception pour les utilisateurs adultes ; une passerelle ne modifie pas la politique du modèle utilisé — la propre politique de Kunavo précise que les politiques des fournisseurs en amont s’appliquent à ce que vous envoyez. Rien sur cette page ne doit être interprété comme la proposition d’un point de terminaison sans filtre. Si votre exigence est un roleplay adulte sans restrictions, la réponse honnête est un modèle local ou un hébergeur open-weight ; la sélection de modèles ci-dessus n’est alors pas la bonne catégorie.
Configurez-le, puis maîtrisez la facture
Le chemin documenté est Chat Completion → Custom (compatible OpenAI), en remplissant Custom Endpoint (Base URL) et Custom API Key. N’ajoutez pas /chat/completions ; ajoutez /v1 si la connexion échoue. Voici quatre points à connaître avant votre première longue conversation :
- Les paramètres d’échantillonnage sont envoyés, sauf si l’identifiant du modèle figure sur une liste d’exclusion. Le générateur de requêtes du front-end place
temperature,top_p,frequency_penaltyetpresence_penaltydans chaque requête Chat Completion. Dans la branche de publication 1.19.0, il supprime ensuite ces quatre champs ainsi quetop_kpour tout identifiant de modèle correspondant àclaude-fable,claude-opus-5ouclaude-sonnet-5— cette règle dépend de l’identifiant du modèle sans vérifier la source ; elle s’applique donc aussi à la source Custom. Elle ne couvre pas Claude Haiku 4.5, et la règle GPT-5 comparable située à côté ne s’exécute que pour les sources intégrées OpenAI, Azure et OpenRouter ; ces identifiants continuent donc de transporter les champs d’échantillonnage via un point de terminaison Custom. Le catalogue de Kunavo marque séparémenttemperature,top_pettop_kcomme non pris en charge sur les modèles Claude 5 listés ci-dessus et les supprime avant l’appel en amont ; sur un point de terminaison qui ne le fait pas, videz-les via Exclude Body Parameters dans le panneau Additional Parameters, sinon un modèle qui rejette ces champs répondra par une erreur 400. - Commencez le post-traitement du prompt à None. L’API Messages d’Anthropic fusionne elle-même les tours consécutifs du même rôle et ne possède pas de rôle système ; une passerelle de traduction élève donc les messages système au paramètre de niveau supérieur. La documentation de SillyTavern définit None comme « aucun traitement explicite appliqué, sauf si l’API l’exige strictement », Semi-strict comme la fusion des rôles avec un seul message système facultatif, et Strict comme exigeant en plus un message utilisateur en premier — si vous voyez une erreur 400 concernant les rôles des messages, passez à Semi-strict. Notez que Merge, Semi-strict et Strict suppriment également les appels d’outils, sauf si vous choisissez la variante « with tools ».
- Le compteur de tokens est une estimation. La documentation de SillyTavern sur les tokeniseurs précise que les comptes sont « estimés selon le type de tokeniseur sélectionné » lorsque le backend n’en fournit pas, et que ses règles Best-match nomment des fournisseurs précis plutôt qu’un point de terminaison Custom arbitraire. Anthropic indique que les modèles Claude 4.7 et ultérieurs utilisent un tokeniseur plus récent produisant « environ 30 % de tokens supplémentaires pour le même texte » ; un compte produit par un tokeniseur plus ancien sera donc inférieur à ce que ces modèles facturent.
- Le panneau Reverse Proxy est une autre fonctionnalité. Son bloc d’avertissement dans l’interface fournie concerne les sources intégrées (
data-source="openai,claude,mistralai,…") et indique : « ANY support requests will be REFUSED if you are using a proxy. » La page documentaire portant ce nom traite du placement de SillyTavern lui-même derrière Traefik, NGINX ou Caddy, ce qui est encore un autre sujet. La source Custom est le chemin pris en charge et ne correspond pas à ce panneau.
Kunavo publie un guide de configuration SillyTavern contenant les valeurs exactes des champs — une configuration écrite, et non un test de compatibilité d’exécution effectué pour vous. Si les tarifs ci-dessus conviennent à vos conversations, créez un compte et commencez par le minimum de $10 plutôt que par un abonnement.
Questions fréquentes
Combien coûte SillyTavern ?
SillyTavern lui-même ne coûte rien. Il s’agit d’un logiciel AGPL-3.0 que vous installez et exécutez localement ; la version 1.19.0 a été publiée le 14 septembre 2026, et la documentation du projet indique qu’il « will always be free and open-sourced ». Ce qui coûte de l’argent, c’est l’API de modèle à laquelle il se connecte, facturée au token par le fournisseur que vous choisissez, ou le matériel et l’électricité si vous exécutez un modèle localement. Une page qui affiche un prix pour SillyTavern vend de l’hébergement ou un abonnement API, et non l’application.
Quelle est l’API la moins chère pour SillyTavern ?
Les routes qui ne génèrent absolument aucune facture comprennent l’inférence locale (KoboldCpp, llama.cpp, Ollama, Oobabooga) et AI Horde, un service géré par des bénévoles que SillyTavern utilise directement, où le compromis porte sur la priorité dans la file d’attente plutôt que sur l’argent ; certains fournisseurs proposent également leur propre niveau gratuit. Parmi les points de terminaison payants, le tarif affiché le plus bas et le chat final le moins cher sont deux affirmations différentes : SillyTavern renvoie l’intégralité du prompt à chaque génération ; ainsi, un faible tarif par token sur un modèle qui nécessite plusieurs régénérations peut coûter plus cher qu’un modèle plus cher qui produit la bonne réponse du premier coup. Comparez le coût par tour avec votre Context Size réel, et non avec le tarif mis en avant.
Quel est le meilleur modèle pour SillyTavern ?
Cette page ne classe aucun modèle selon la qualité de la prose, car aucune mesure n’a été effectuée ; choisissez selon la contrainte que vous pouvez réellement chiffrer, à savoir le coût par tour. Pour obtenir le coût par tour le plus faible dans les conversations longues, examinez un niveau économique tel que Claude Haiku 4.5. Pour un équilibre quotidien, Claude Sonnet 5 ou Claude Opus 5. Claude Fable 5.1 est le plus cher par tour parmi les modèles comparés sur cette page ; il n’en vaut donc la peine que si vous percevez la différence dans vos propres conversations. Les notes de version de SillyTavern 1.19.0 indiquent l’ajout de la prise en charge backend de Claude Fable 5 et 5.1, Claude Opus 4.8 et 5, Claude Sonnet 5 et des modèles GPT-5.6 ; ses sources Anthropic et OpenAI intégrées connaissent donc déjà ces identifiants.
SillyTavern fonctionne-t-il avec une API personnalisée compatible OpenAI ?
Oui, et il s’agit d’une voie documentée de première classe, et non d’un contournement. Définissez API sur Chat Completion, définissez Chat Completion Source sur Custom (OpenAI-compatible), puis renseignez Custom Endpoint (Base URL) et Custom API Key. La documentation de SillyTavern indique de ne pas ajouter le suffixe /chat/completions à l’URL de base et d’essayer d’ajouter /v1 si la connexion échoue. Si le point de terminaison implémente GET /v1/models, la liste déroulante Available Models se remplit automatiquement ; sinon, saisissez manuellement l’identifiant du modèle.
Pourquoi la facture SillyTavern augmente-t-elle à mesure qu’une conversation s’allonge ?
Parce que le prompt s’allonge. À chaque génération, SillyTavern envoie la fiche du personnage, le prompt système et autant d’historique de conversation que possible dans la limite de Context Size ; le tour 200 facture donc bien plus de tokens d’entrée que le tour 2 au même tarif par token. La mise en cache du prompt est le levier qui modifie ce phénomène, mais dans la branche de version 1.19.0, chaque cache_control envoyé par SillyTavern est conditionné à une source intégrée : sa propre source Claude, sa source ElectronHub pour les identifiants de modèle claude-*, sa source OpenRouter pour les identifiants de modèle anthropic/claude et pour ceux de google/gemini compatibles avec la mise en cache, ainsi qu’un indicateur propre à NanoGPT. La source Custom (OpenAI-compatible) n’en fait pas partie ; sur un point de terminaison personnalisé, la mise en cache doit donc provenir du point de terminaison lui-même.
Puis-je utiliser une API payante pour un jeu de rôle sans censure ?
Pas auprès des fournisseurs frontier. La propre FAQ de SillyTavern avertit que les services web payants sont souvent censurés et refusent certains sujets, et la politique d’utilisation d’Anthropic interdit explicitement les conversations érotiques et la génération sexuellement explicite. Faire passer la même requête par une passerelle ne modifie pas la politique sous laquelle le modèle est fourni, et la politique d’utilisation acceptable de Kunavo indique que les politiques des fournisseurs en amont s’appliquent au contenu qui y est envoyé. Si du contenu adulte sans restriction est requis, cette décision relève des modèles locaux ou des hébergeurs de modèles open-weight, et non d’un point de terminaison Claude, GPT ou Gemini.
État des versions de SillyTavern, documentation, code fourni et prix des concurrents vérifiés le 18 septembre 2026. Les tarifs Kunavo sont lus dans le catalogue en direct ; tous les totaux présentés ici sont des calculs de tokens fondés sur les hypothèses indiquées, et non des sessions mesurées.