SillyTavern verkauft weder eine API noch ein Abonnement. Die Wahl der besten API für SillyTavern ist daher ein Kauf von Modell und Anbieter — und die entscheidende Zahl sind die Kosten für einen Turn bei Ihrer Context Size, nicht der Schlagzeilenpreis pro Million Tokens. SillyTavern sendet die Charakterkarte, den System-Prompt und so viel Verlauf, wie bei jeder Generierung passt, erneut. Deshalb wächst die Rechnung mit dem Gespräch, obwohl sich der Tarif nie ändert.
Release 1.19.0 wurde am 14. September 2026 unter AGPL-3.0 veröffentlicht, und der letzte Push des Repositorys erfolgte am 14. September 2026 (geprüft am 18. September 2026). Zwei Dinge, die nicht SillyTavern sind: TavernAI, das separate Vorgängerprojekt — die Dokumentation datiert SillyTavern auf „Februar 2023 als Fork von TavernAI 1.2.8“ — und SillyTavern-Extras, dessen Repository-Beschreibung nun mit „[OBSOLETE]“ beginnt. Tutorials, die zur Installation von Extras auffordern, sind veraltet.
Was kostenlos ist und was nicht
| Was Sie kaufen | Preis | Quelle |
|---|---|---|
| SillyTavern auf jeder Plattform | $0, AGPL-3.0, keine kostenpflichtige Stufe und kein vom Projekt verkaufter Hostingdienst | Die Dokumentation erklärt, dass sie „immer kostenlos und quelloffen sein wird“ |
| Etwas, worauf Sie es ausführen | Node.js 20 oder neuer | package.json deklariert "engines": { "node": ">= 20" } |
| Das Modell, das die Antworten schreibt | Dies ist die gesamte wiederkehrende Rechnung | Die Dokumentation bezeichnet es als „eine lokal installierte Benutzeroberfläche, die Ihnen die Interaktion mit LLMs zur Textgenerierung ermöglicht“ |
| „SillyTavern-Hosting“ von Drittanbietern oder kostenpflichtige mobile Apps | Das Produkt eines anderen Anbieters | sillytavern.app veröffentlicht keinerlei Preis |
Geprüfte Quellen vom 18. September 2026: das Projekt-Repository und die offizielle FAQ. Die FAQ unterteilt Backends in selbst gehostete Modelle, deren Betrieb kostenlos ist, und kostenpflichtige Webdienste, die nach ihren Worten „Geld für die Nutzung kosten“.
Wie ein SillyTavern-Chat seine Rechnung erzeugt
SillyTaverns Dokumentation zu Context Size definiert die Einstellung als maximale Anzahl von Tokens, die SillyTavern als Prompt an die API sendet, abzüglich der Antwortlänge, und erklärt, dass der Kontext „Charakterinformationen, System-Prompts, Chatverlauf usw.“ umfasst. Nachrichten oberhalb der gepunkteten Linie im Chat werden einfach nicht gesendet, statt zusammengefasst zu werden. Ein Turn kostet daher ungefähr context tokens × input rate + reply tokens × output rate, und eine neu generierte Antwort bezahlt die Eingabeseite erneut vollständig.
Der Standardkontext für Chat Completion beträgt 4,095 Tokens und ist in den mitgelieferten Standardeinstellungen festgelegt (gelesen am 18. September 2026). Der Schieberegler erhöht ihn um Größenordnungen und mit freigeschaltetem Kontext noch weiter. Context Size ist daher die größte Budgetsteuerung der Anwendung: Eine Vervierfachung vervierfacht bei unverändertem Tarif ungefähr die Eingabekosten jeder folgenden Nachricht.
Modell-Shortlist und die Kosten der einzelnen Modelle
USD pro Million Eingabe-/Ausgabe-Tokens: aktuelle Kunavo-Katalogtarife neben dem vom Anbieter selbst veröffentlichten Listenpreis, alle geprüft am 18. September 2026.
| Modell | Kunavo: Eingabe / Ausgabe | Anbieter-Liste: Eingabe / Ausgabe | Einsatzbereich |
|---|---|---|---|
| GPT-5.6 Terra | $0.70 / $4.20 | $2.00 / $12.00 | Eine Stimme, die nicht von Claude stammt und für eine zweite Meinung zur selben Charakterkarte nützlich ist |
| Claude Haiku 4.5 | $0.70 / $3.50 | $1.00 / $5.00 | Die günstigste Zeile hier — das günstige Claude für lange Sitzungen, bei denen die Eingabe pro Turn dominiert |
| Claude Sonnet 5 | $1.40 / $7.00 | $2.00 / $10.00 | Alltägliches Gleichgewicht zwischen Qualität und Kosten pro Turn |
| Claude Opus 5 | $3.50 / $17.50 | $5.00 / $25.00 | Höhere Claude-Stufe; vergleichen Sie die Zeile, bevor Sie annehmen, dass sie mehr kostet |
| Claude Fable 5.1 | $7.00 / $35.00 | $10.00 / $50.00 | In dieser Tabelle pro Turn am teuersten, sowohl zum Katalog- als auch zum Listenpreis |
Die Anbieterpreise stammen von Anthropics Preisseite und der Entwicklerpreisübersicht von OpenAI.
Eine beispielhafte monatliche Schätzung
Nehmen wir 100 Generierungen in einem Monat an, einen auf etwa 16.000 Tokens angewachsenen Prompt, Antworten mit 300 Tokens und keine erneuten Generierungen. Das ergibt 1,6 Millionen Eingabe-Tokens und 30.000 Ausgabe-Tokens. Zu den oben genannten Katalogtarifen:
| Modell | Geschätzte Gesamtkosten für 100 Turns |
|---|---|
| GPT-5.6 Terra | $1.25 |
| Claude Haiku 4.5 | $1.22 |
| Claude Sonnet 5 | $2.45 |
| Claude Fable 5.1 | $12.25 |
Dies ist Token-Arithmetik auf Grundlage angenommener Zahlen, keine gemessene Sitzung und keine Obergrenze für den Betrag, der Ihnen berechnet wird. Ändern Sie eine Annahme, ändert sich das Ergebnis: Eine größere Context Size, erneute Generierungen oder 500 statt 100 Turns skalieren die Eingabeseite jeweils mit. Cache-Gebühren sind ebenfalls nicht enthalten; darum geht es im nächsten Abschnitt.
Die Cache-Lücke, die bei einem langen Chat entscheidet
Dies ist der Teil, der innerhalb der Benutzeroberfläche unsichtbar ist. Im Release-Branch 1.19.0 von seinem Chat-Completions-Backend (gelesen am 18. September 2026) liegt jedes cache_control-Marker hinter einer Prüfung auf eine integrierte Quelle: die Claude-Quelle, die ElectronHub-Quelle für claude--Modell-IDs, die OpenRouter-Quelle für anthropic/claude-Modell-IDs, erneut die OpenRouter-Quelle für google/gemini-IDs, die sie als cachebar erkennt, sowie ein NanoGPT-Flag. Der Zweig Custom (OpenAI-kompatibel) kommt in keiner dieser Prüfungen vor und setzt kein cache_control-Feld irgendeiner Art — gesetzt werden stattdessen logprobs, ein response_format, wenn Sie ein JSON-Schema konfiguriert haben, Ihre Include Headers und Include Body Parameters sowie reasoning_effort oder verbosity an den von Ihnen angeforderten Stellen. Außerdem gibt es keinen Abschnitt custom: in der mitgelieferten Konfiguration, in dem sich die Caching-Schalter claude: und gemini: befinden.
Die Konsequenz ist spezifisch für Anthropics Protokoll: Die Custom-Quelle setzt nie einen cache_control-Marker. Bei einem Claude-Modell wird daher der gesamte Verlauf in jedem Turn erneut zum vollen Eingabepreis abgerechnet, sofern der Endpunkt die Breakpoints nicht selbst einfügt. Daraus folgt nicht, dass auf diesem Pfad überhaupt nichts gecacht wird. OpenAIs Prompt-Caching ist für unterstützte Modelle standardmäßig aktiviert und erfordert vom Client nichts. Eine GPT-Route über dieselbe Custom-Quelle kann also cachen, während eine Claude-Route dies nicht tut. Caching wird vom Modell und vom Endpunkt bestimmt, nicht davon, was SillyTavern sendet. Kunavos OpenAI-zu-Anthropic-Übersetzung fügt diese Marker ein — in den Tool- und Systemblöcken sowie einen gleitenden Breakpoint bei der letzten Nachricht, sobald der Gesprächsverlauf bereits einen Assistant-Turn enthält, was nach Turn eins der Form eines SillyTavern-Chats entspricht. Der Prompt muss 8.192 Zeichen enthalten, bevor dies greift, und die Obergrenze des Anbieters von vier Breakpoints wird nie überschritten. Einzelheiten stehen in der Caching-Dokumentation, die für Aufrufer geschrieben ist, die Breakpoints selbst setzen.
Was das im besten Fall wert ist — als Best-Case und nicht als Prognose: Wenn bei Kunavos Cache-Leserate für Claude Sonnet 5 ($0.14 pro Million) in jedem Turn 12.000 der 16.000 Prompt-Tokens aus dem Cache gelesen würden, kämen dieselben 100 Turns auf etwa $0.94 statt auf $2.45. Betrachten Sie das als größtmögliche Ersparnis und nicht als Obergrenze dessen, was Sie zahlen werden: Es wird ein Cache-Treffer in jedem Turn angenommen und es werden keine Cache-Schreibvorgänge gezählt, daher liegt eine reale Rechnung höher. Anthropic berechnet für einen Cache-Lesevorgang das 0,1-Fache des regulären Eingabepreises (das 0,025-Fache bei Fable 5.1), für einen Cache-Schreibvorgang mit einem Cache-Zeitfenster von fünf Minuten jedoch das 1,25-Fache — ein Rollenspieler, der länger als diese Zeit zwischen Nachrichten wartet, zahlt erneut für das Schreiben statt für das Lesen. Anthropic bietet außerdem Cache-Schreibvorgänge mit einem Cache-Zeitfenster von einer Stunde zum 2-Fachen des regulären Eingabepreises an. Für diesen Leitfaden wurde keine laufende SillyTavern-Sitzung über das Gateway abgerechnet. Prüfen Sie daher zunächst die gemeldete Nutzung Ihres ersten langen Chats, bevor Sie auf Grundlage von Cache-Treffern budgetieren.
Wann direkt, ein Gateway, ein Abonnement oder lokal gewinnt
| Weg | Kaufen Sie es, wenn | Der Kompromiss |
|---|---|---|
| Direkter Anbieter (Anthropic, OpenAI, Google) | Sie einen Anbieter und SillyTaverns integrierte Quelle dafür möchten | Die integrierte Claude-Quelle stellt Caching-Einstellungen bereit, für die die Custom-Quelle keinen Codepfad besitzt; ein Konto pro Anbieter |
| Multi-Modell-Gateway | Sie Claude- und GPT-IDs hinter einem Schlüssel und einem Guthaben möchten | SillyTavern spricht einfaches OpenAI-Chatformat mit dem Gateway. Daher bleiben die anbieterspezifischen Steuerungen, die es bereitstellt, auf die integrierten Quellen beschränkt |
| Host mit offenen Gewichten und Pauschaltarif | Sie täglich chatten und einen vorhersehbaren Monatsbetrag möchten | Prüfen Sie, was die Stufe begrenzt: Die Tarife von Arli AI sind nach der maximalen Kontextlänge getrennt, also genau nach der Ressource, die ein langer Chat verbraucht |
| Kostenlos gehostet | Sie die App ausprobieren oder Chats führen, die eine Warteschlange tolerieren | Priorität und Ratenlimits statt einer Rechnung |
| Lokales Modell | Sie die Hardware besitzen und keinen Inhaltsfilter sowie keinen Schlüssel möchten | Ihre Maschine, Ihre Wartung, Ihre Qualitätsobergrenze |
Konkrete Zahlen, geprüft am 18. September 2026. OpenRouter reicht die Anbieterpreise weiter und berechnet 5,5 % (mindestens $0.80) auf Kartenguthabenkäufe; kostenlose Modelle sind auf 50 Anfragen pro Tag begrenzt, beziehungsweise auf 1.000 nach dem Kauf von mindestens $10 Guthaben. NanoGPT verkauft Pay-as-you-go plus ein optionales Abonnement für $12 pro Monat, mit einer Mindesteinzahlung von $0.10 in Kryptowährung oder $1 per Karte. Arli AI bietet eine kostenlose Stufe sowie monatliche Stufen für $10, $15, $20, $30 und $160 an. Diese unterscheiden sich durch maximale Kontextlänge (12K bei kostenlos bis 512K bei der höchsten Stufe), Modellgröße und parallele Anfragen. Infermatic führt einen kostenlosen Tarif sowie Tarife für $9, $16 und $20 auf; Featherless führt Chat für $25 pro Monat und Developer für $50 auf. AI Horde beschreibt sich als „Kostenlos · gemeinschaftlich betrieben · Open Source“; die FAQ erklärt, dass die Position in der Warteschlange Ihrem gesamten Kudos-Guthaben folgt und anonyme Nutzer mit null beginnen, sodass registrierte Nutzer vor ihnen eingestuft werden. Google veröffentlicht eine kostenlose Gemini-Stufe, aber seine Seite zu Ratenlimits nennt keine kostenlosen, modellspezifischen Zahlen und verweist stattdessen auf AI Studio. Behandeln Sie daher jede konkrete kostenlose Kontingentangabe, die Sie anderswo lesen, als unverifiziert.
Kunavo hat keine kostenlose Stufe und kein Anmeldeguthaben: Das Minimum beträgt $10 als vorausbezahltes Guthaben, ohne Abonnement und mit einem Guthaben, das nicht verfällt. Eine Katalogschätzung ist ebenfalls keine Preisobergrenze — siehe Abrechnung für die Abwicklung einer Belastung.
Inhaltsregeln kommen vor dem Preis
SillyTaverns eigene FAQ erklärt, dass kostenpflichtige Webdienste „oft zensiert sind und sich weigern werden, mit Ihnen über bestimmte Themen zu chatten“. Dies stammt aus erster Hand und ist die richtige Erwartung. Anthropics Usage Policy untersagt erotische Chats und sexuell explizite Generierung ohne Ausnahme für erwachsene Nutzer. Ein Gateway ändert nichts an der Richtlinie, unter der das Modell bereitgestellt wird — Kunavos eigene Richtlinie besagt, dass Richtlinien der vorgelagerten Anbieter für Ihre Übermittlungen gelten. Nichts auf dieser Seite sollte als Angebot eines ungefilterten Endpunkts verstanden werden. Wenn uneingeschränktes Rollenspiel für Erwachsene erforderlich ist, lautet die ehrliche Antwort: ein lokales Modell oder ein Host mit offenen Gewichten. Die obige Modell-Shortlist ist dafür nicht das richtige Regal.
Konfigurieren Sie es und kontrollieren Sie dann die Rechnung
Der dokumentierte Pfad lautet Chat Completion → Custom (OpenAI-kompatibel). Füllen Sie Custom Endpoint (Base URL) und Custom API Key aus. Hängen Sie /chat/completions nicht an; fügen Sie /v1 hinzu, wenn die Verbindung fehlschlägt. Vor Ihrem ersten langen Chat sind vier Dinge wichtig:
- Sampling-Parameter werden gesendet, sofern die Modell-ID nicht auf einer Ausschlussliste steht. Der Request-Builder des Frontends fügt
temperature,top_p,frequency_penaltyundpresence_penaltyjeder Chat-Completion-Anfrage hinzu. Im Release-Branch 1.19.0 löscht er diese vier sowietop_kanschließend für jede Modell-ID, die aufclaude-fable,claude-opus-5oderclaude-sonnet-5passt — die Regel basiert auf der Modell-ID ohne Prüfung der Quelle und greift daher auch bei der Custom-Quelle. Claude Haiku 4.5 ist davon nicht abgedeckt. Die danebenstehende vergleichbare GPT-5-Regel gilt hingegen nur für die integrierten Quellen OpenAI, Azure und OpenRouter, sodass diese IDs Sampling-Felder weiterhin über einen benutzerdefinierten Endpunkt senden. Kunavos Katalog kennzeichnettemperature,top_pundtop_kbei den oben aufgeführten Claude-5-Modellen separat als nicht unterstützt und entfernt sie vor dem Aufruf des vorgelagerten Anbieters. Bei einem Endpunkt, der dies nicht tut, lassen Sie sie über Exclude Body Parameters im Drawer Additional Parameters leer; andernfalls antwortet ein Modell, das diese Felder ablehnt, mit einem 400-Fehler. - Belassen Sie die Prompt-Nachbearbeitung zunächst auf None. Anthropics Messages API führt aufeinanderfolgende Turns derselben Rolle selbst zusammen und verfügt über keine Systemrolle. Daher hebt ein übersetzendes Gateway Systemnachrichten in den Parameter der obersten Ebene. SillyTaverns Dokumentation definiert None als „keine explizite Verarbeitung, sofern sie nicht von der API unbedingt erforderlich ist“, Semi-strict als Zusammenführen von Rollen und Zulassen nur einer optionalen Systemnachricht sowie Strict als zusätzliche Anforderung einer zuerst stehenden User-Nachricht. Wenn Sie also einen 400-Fehler zu Nachrichtenrollen sehen, wechseln Sie zu Semi-strict. Beachten Sie, dass Merge, Semi-strict und Strict Tool-Aufrufe ebenfalls entfernen, sofern Sie nicht die Variante „with tools“ auswählen.
- Der Tokenzähler ist eine Schätzung. SillyTaverns Tokenizer-Dokumentation erklärt, dass die Zählungen „auf Grundlage des ausgewählten Tokenizer-Typs geschätzt“ werden, wenn das Backend keine Tokenzahl bereitstellt. Die Best-match-Regeln nennen bestimmte Anbieter und keinen beliebigen benutzerdefinierten Endpunkt. Anthropic erklärt, dass Claude-4.7- und spätere Modelle einen neueren Tokenizer verwenden, der „für denselben Text ungefähr 30 % mehr Tokens“ erzeugt. Eine Zählung mit einem älteren Tokenizer fällt daher gegenüber der Abrechnung dieser Modelle zu niedrig aus.
- Der Drawer Reverse Proxy ist eine andere Funktion. Sein Warnblock in der mitgelieferten Benutzeroberfläche bezieht sich auf die integrierten Quellen (
data-source="openai,claude,mistralai,…") und lautet: „ANY support requests will be REFUSED if you are using a proxy.“ Die Dokumentationsseite dieses Namens handelt davon, SillyTavern selbst hinter Traefik, NGINX oder Caddy zu betreiben, also wiederum von einem anderen Thema. Die Custom-Quelle ist der unterstützte Pfad und nicht dieser Drawer.
Kunavo veröffentlicht eine SillyTavern-Einrichtungsanleitung mit den genauen Feldwerten — eine schriftliche Konfiguration und kein in Ihrem Namen ausgeführter Laufzeittest der Kompatibilität. Wenn die oben genannten Tarife zu Ihren Chats passen, erstellen Sie ein Konto und beginnen Sie mit dem Mindestbetrag von $10 statt mit einem Abonnement.
Häufig gestellte Fragen
Wie viel kostet SillyTavern?
SillyTavern selbst kostet nichts. Es ist AGPL-3.0-Software, die du lokal installierst und ausführst; Version 1.19.0 wurde am 14. September 2026 veröffentlicht, und laut der Dokumentation des Projekts wird es „immer kostenlos und quelloffen sein“. Kosten entstehen durch die Modell-API, mit der es sich verbindet und die vom jeweiligen Provider pro Token abgerechnet wird, oder durch Hardware und Strom, wenn du ein Modell lokal ausführst. Eine Seite, die einen Preis für SillyTavern bewirbt, verkauft Hosting oder ein API-Abonnement, nicht die Anwendung.
Was ist die günstigste API für SillyTavern?
Routen, die überhaupt keine Rechnung erzeugen, umfassen lokale Inferenz (KoboldCpp, llama.cpp, Ollama, Oobabooga) und AI Horde, einen von Freiwilligen betriebenen Dienst, den SillyTavern sofort nutzen kann; dort besteht der Preis in der Warteschlangenpriorität statt in Geld. Einige Anbieter veröffentlichen außerdem ein eigenes kostenloses Kontingent. Bei kostenpflichtigen Endpunkten sind der günstigste aufgeführte Tarif und der günstigste fertige Chat unterschiedliche Aussagen: SillyTavern sendet bei jeder Generierung den gesamten Prompt erneut, sodass ein niedriger Tokenpreis bei einem Modell, das mehrere erneute Versuche benötigt, mehr kosten kann als ein teureres Modell, das die Antwort beim ersten Mal liefert. Vergleiche die Kosten pro Runde bei deiner tatsächlichen Context Size, nicht den hervorgehobenen Tarif.
Welches ist das beste Modell für SillyTavern?
Diese Seite bewertet kein Modell nach Textqualität, weil keine gemessen wurde — wähle nach der Einschränkung, die du tatsächlich bepreisen kannst: den Kosten pro Runde. Für die niedrigsten Kosten pro Runde bei langen Chats solltest du eine günstige Stufe wie Claude Haiku 4.5 betrachten. Für ein ausgewogenes Modell im Alltag Claude Sonnet 5 oder Claude Opus 5. Claude Fable 5.1 ist pro Runde das teuerste der auf dieser Seite verglichenen Modelle und lohnt sich daher nur, wenn du in deinen eigenen Chats einen Unterschied feststellen kannst. Die Versionshinweise von SillyTavern 1.19.0 verzeichnen zusätzliche Backend-Unterstützung für Claude Fable 5 und 5.1, Claude Opus 4.8 und 5, Claude Sonnet 5 und die GPT-5.6-Modelle; die integrierten Anthropic- und OpenAI-Quellen kennen diese IDs daher bereits.
Funktioniert SillyTavern mit einer benutzerdefinierten OpenAI-kompatiblen API?
Ja, und es handelt sich um einen dokumentierten, erstklassigen Pfad und nicht um einen Workaround. Setzen Sie API auf Chat Completion, Chat Completion Source auf Custom (OpenAI-compatible) und füllen Sie anschließend Custom Endpoint (Base URL) sowie Custom API Key aus. In der Dokumentation von SillyTavern steht, dass Sie das Suffix /chat/completions nicht an die Basis-URL anhängen und bei einem Verbindungsfehler versuchen sollten, /v1 hinzuzufügen. Wenn der Endpunkt GET /v1/models implementiert, wird das Dropdown Available Models automatisch ausgefüllt; andernfalls geben Sie die Modell-ID manuell ein.
Warum wächst die SillyTavern-Rechnung, wenn ein Chat länger wird?
Weil der Prompt wächst. SillyTavern sendet bei jeder einzelnen Generierung die Charakterkarte, den System-Prompt und so viel Chatverlauf, wie in Context Size passt. Daher wird bei Turn 200 deutlich mehr Eingabe abgerechnet als bei Turn 2, obwohl der Preis pro Token gleich bleibt. Prompt-Caching ist der Hebel, der dies verändert. Im Release-Branch 1.19.0 ist jedes von SillyTavern gesendete cache_control jedoch an eine integrierte Quelle gebunden: an die eigene Claude-Quelle, die ElectronHub-Quelle für claude-*-Modell-IDs, die OpenRouter-Quelle für anthropic/claude-Modell-IDs und cachebare google/gemini-Modelle sowie ein NanoGPT-spezifisches Flag. Die Quelle Custom (OpenAI-kompatibel) gehört nicht dazu. Bei einem benutzerdefinierten Endpunkt muss das Caching daher vom Endpunkt selbst kommen.
Kann ich eine kostenpflichtige API für unzensiertes Rollenspiel verwenden?
Nicht bei den führenden Anbietern. Die eigene FAQ von SillyTavern warnt, dass kostenpflichtige Webdienste oft zensiert sind und bestimmte Themen ablehnen. Außerdem untersagt die Usage Policy von Anthropic erotische Chats und sexuell explizite Generierung ausdrücklich. Das Weiterleiten derselben Anfrage über ein Gateway ändert nichts an der Richtlinie, unter der das Modell bereitgestellt wird, und Kunavos Richtlinie zur akzeptablen Nutzung besagt, dass die Richtlinien der vorgelagerten Anbieter für übermittelten Inhalt gelten. Wenn uneingeschränkter Inhalt für Erwachsene erforderlich ist, gehört diese Entscheidung zu lokalen Modellen oder Hosts mit offenen Gewichten, nicht zu einem Claude-, GPT- oder Gemini-Endpunkt.
SillyTavern-Release-Status, Dokumentation, ausgelieferter Quellcode und Preise der Wettbewerber geprüft am 18. September 2026. Kunavo-Tarife stammen aus dem Live-Katalog; alle Summen hier sind Token-Arithmetik auf Grundlage angegebener Annahmen und keine gemessenen Sitzungen.