Zurück zu den Leitfäden
Preise·21. September 2026·Aktualisiert am 3. Oktober 2026·10 Min. Lesezeit

AnythingLLM-Preise und API-Kosten: die Software, die Token und die zwei Rechnungen, die niemand veröffentlicht

Die Software ist kostenlos, und die einzige offizielle Preisliste bepreist das Hosting. Die Rechnung, die mit der Nutzung wächst, entsteht pro Chat-Runde; ihre Höhe wird durch die ausgelieferten Standardwerte von AnythingLLM bestimmt.

Zuletzt überprüft am .

AnythingLLMs Software ist kostenlos — die Desktop-App kann für $0 heruntergeladen werden, und die selbst gehostete Docker-Edition ist unter der MIT-Lizenz des Projekt-Repositorys kostenlos — daher bedeutet „AnythingLLM pricing“ in der Praxis zwei Rechnungen, die niemand veröffentlicht: ein optionales Hosting- oder Lizenzabonnement und die Modell-API-Tokens, die Sie selbst mitbringen. Die einzige offizielle Preisliste, anythingllm.com/cloud, nennt Hostingpreise und sagt es in einem eigenen Aufzählungspunkt: „Just bring an LLM API Key“. Beachten Sie, dass anythingllm.com/pricing keine echte Seite ist — sie leitet auf dieselbe Cloud-Seite weiter.

Dieser Leitfaden trennt die drei Ebenen: was AnythingLLM berechnet, wodurch die Tokenrechnung entsteht und welche Provider-Route für welche Arbeitslast am besten geeignet ist. Jede Zahl ist mit Quelle und Datum versehen, und die Berechnungen sind als solche gekennzeichnet.

Bereits einen Workspace? Wechseln Sie direkt zur Einrichtung des Chat-Providers und Prüfung der ersten Abrechnung. Halten Sie Ihren Embedding-Provider getrennt; Kunavo stellt derzeit kein Embedding-Modell bereit.

Zwei verschiedene Dinge heißen „die AnythingLLM-API“

Klären Sie dies, bevor Sie Preise vergleichen, denn die beiden Dinge haben nichts miteinander zu tun.

In AnythingLLMs eigener Dokumentation ist die API die lokale Entwickler- und Verwaltungs-API, die Ihre Instanz unter /api/docs bereitstellt — Arbeitsbereiche erstellen, Dokumente hochladen, mit einem Arbeitsbereich chatten — und die mit einem Schlüssel authentifiziert wird, den Sie in Ihrer eigenen Instanz erzeugen. Sie hat keinen Preis, weil Ihr Server mit sich selbst kommuniziert.

Mit der API, die ein Käufer bei der Suche nach „best API for AnythingLLM“ fast immer meint, ist der Upstream-Modellendpunkt gemeint, der in das Feld Basis-URL des Chat-Providers eingetragen wird. Dieser hat einen Preis pro Token und ist der einzige Teil einer AnythingLLM-Bereitstellung, dessen Kosten mit der Nutzung steigen. Alles Folgende bezieht sich auf diesen zweiten Typ.

Was AnythingLLM selbst berechnet

ProduktVeröffentlichter PreisWas Sie erhalten und was nicht enthalten ist
Desktop (macOS / Windows / Linux)$0Kostenloser Download. Enthält eine integrierte lokale LLM-Engine und einen integrierten lokalen Embedder
Selbst gehostetes Docker$0, MIT„Self-host with Docker for free“. Sie zahlen für den Rechner und jede Modell-API, auf die Sie es richten
Desktop Pro — jährlich$15/Monat, jährlich abgerechnet ($180/Jahr)Unbegrenzte tägliche Nutzung von drei Magic-Funktionen auf Betriebssystemebene sowie Dokumente ohne Wasserzeichen. Keine Modell-Tokens
Desktop Pro — monatlich$20/MonatDieselben Funktionen, 14-tägige kostenlose Testversion, keine jährliche Bindung
Cloud — Basic50 $/MonatPrivate Instanz, benutzerdefinierte Subdomain, „Just bring an LLM API Key“. Nur Hosting
Cloud — Pro$99/MonatPriorisierte Ressourcen und eine Support-SLA von 72 Stunden. Weiterhin nur Hosting
Cloud — EnterpriseKontaktieren Sie unsOn-Premises-Bereitstellung, SSO und RBAC. Kein veröffentlichter Preis
Mobil (Android)Nicht veröffentlichtDie mobile Dokumentation enthält keine Preisangabe; diese Seite hat den Store-Eintrag nicht geprüft
Community HubKein Preis veröffentlichtFür öffentliche Elemente ist kein Connection-Schlüssel erforderlich; nur zum Abrufen privater Elemente. Noch in der Beta

Die Cloud-Preise wurden am 19. September 2026 von anythingllm.com/cloud abgelesen. Bei den Zahlen für Desktop Pro ist ein Hinweis erforderlich: Sie stammen aus dem Checkout-Screenshot, den AnythingLLM in die eigene Dokumentation einbettet, weil der Live-Checkout von Mintplex Labs hinter einer Bot-Prüfung liegt, die nicht umgangen wurde. Dieses Bild enthält einen eigenen Hinweis — der Preis „does not reflect any promotions, eligible free trials, or coupons applied at checkout“. Betrachten Sie $15/$20/$180 als von AnythingLLM veröffentlichte Angaben und bestätigen Sie den Betrag vor dem Kauf im Checkout.

Zwei Fallen rund um das Wort „Pro“. Cloud Pro für $99 ist nicht Desktop Pro. Es handelt sich um separate Produkte, und mehrere Zusammenfassungen Dritter geben den Hostingpreis als Desktop-Lizenzpreis an. Außerdem ist Desktop Pro enger gefasst, als der Name vermuten lässt: AnythingLLMs Pro-Übersicht erklärt, dass „AnythingLLM Desktop will and forever will be free to use for 99% of our features“ und Pro „simply removes those daily limits“ bei Magic-Funktionen. Es schränkt weder Chat noch RAG, Agenten oder den Modellzugriff ein. Das kostenlose tägliche Kontingent für jede Magic-Funktion wird lediglich als „generous“ beschrieben — es ist keine Zahl veröffentlicht, daher wird hier keine genannt. Separat davon sind Magic Tab und Magic Beacon nur für macOS und Windows verfügbar; auf der Beacon-Seite steht für Linux „Not currently supported“.

Noch eine Klarstellung: Unabhängige Herausgeber verkaufen VM-Images von AnythingLLM auf den Marktplätzen von Microsoft und AWS zu ihren eigenen Stundensätzen weiter. Diese Angebote werden nicht von Mintplex Labs veröffentlicht, und ihre Preise sind keine AnythingLLM-Preise. Diese Seite hat ihre Zahlen nicht übernommen – die Marktplatzseiten gaben 403 zurück –, daher erscheinen sie hier nicht.

Was keiner dieser Preise umfasst

Kein einziger AnythingLLM-Tarif umfasst Modell-Token, und bei den Cloud-Tarifen wird dies ausdrücklich klargestellt. Auf der Seite zu den Cloud-Einschränkungen steht, dass „AnythingLLM hosted cloud does not ship with a built-in LLM you can use like in our desktop instance“ – ein Cloud-Abonnent muss also einen externen Endpunkt bereitstellen, wodurch die 50 $ oder 99 $ eher eine Untergrenze als ein Gesamtpreis sind. Auf derselben Seite wird gewarnt, dass der integrierte Embedder „will not block you from trying to embed a 5,000pg PDF, but it will crash your instance“ und dass benutzerdefinierte Agents in der gehosteten Cloud nicht unterstützt werden.

Desktop Pro erzählt im Kleinen dieselbe Geschichte. Die Dokumentation zu Magic Tab besagt, dass die Vorschlagserstellung „done on device using your configured LLM provider and model“ ist. Ein Pro-Abonnement kauft also keine Inferenz, sondern entfernt eine tägliche Begrenzung für Funktionen, die anschließend Ihr eigenes Token-Budget verbrauchen.

Der echte Weg zu null Token existiert und ist ausschließlich für den Desktop verfügbar: Der integrierte Anbieter führt ein lokales Modell mit Ollamas MIT-lizenzierter Engine aus und ist in der Dokumentation mit „DESKTOP ONLY!“ gekennzeichnet. Wenn ein lokales Modell Ihre Dokumente ausreichend gut beantwortet, beträgt diese Hälfte der Rechnung dauerhaft 0 $.

Wo die Token-Rechnung tatsächlich entsteht

Eine AnythingLLM-Rechnung besteht aus zwei unabhängigen Hälften, die von zwei separaten Anbietern abgerechnet werden, die Sie jeweils separat konfigurieren.

Aufnahme ist einmalig: Jedes Dokument wird in Chunks aufgeteilt und einmal eingebettet. Chat ist wiederkehrend: Bei jeder Anfrage werden ein System-Prompt, der wiedergegebene Verlauf, die abgerufenen Chunks und die Frage erneut gesendet. Die wiederkehrende Hälfte ist entscheidend, und ihre Größe wird durch die mitgelieferten Standardwerte bestimmt.

Mitgelieferter StandardwertWertWas er multipliziert
Text-Chunk-Größe1.000 Zeichen (~250 Token)Die Größe jedes aus diesen Dokumenten abgerufenen Chunks, bis sie gelöscht und erneut eingebettet werden
Chunk-Überlappung20 ZeichenWie viel doppelter Text im Index landet
Abgerufene Chunks (topN)4Grounding-Kontext pro Anfrage
Chatverlauf20 NachrichtenErneut gesendete Eingabe pro Anfrage – normalerweise der größte Faktor
Ähnlichkeitsschwellenwert0.25Wie viele Chunks die Schwelle überhaupt überschreiten

Chunk-Größe und Überlappung stammen aus der Dokumentation zur Textaufteilung, die außerdem die oben verwendete Umrechnung von ~4 Zeichen pro Token angibt, LangChains RecursiveCharacterTextSplitter als einzige Strategie nennt und davor warnt, dass Änderungen nur auf danach eingebettete Dokumente angewendet werden. Die anderen drei Werte werden aus dem mitgelieferten Prisma-Schema gelesen (topN 4, openAiHistory 20, similarityThreshold 0.25), das maßgeblich ist. Ein zu beachtender Widerspruch: Die RAG-Seite von AnythingLLM spricht von „4-6 text chunks“, bezeichnet sich jedoch selbst als veraltete Dokumentation, die in v1.8.5 abgelöst wurde. Der Standardwert im Schema ist 4 und kann vom Benutzer angepasst werden.

Der teure Fehler liegt hier nicht in einer Einstellung. Ein Dokument anzuhängen ist nicht dasselbe wie es einzubetten. Die Einführung in den Dokument-Chat von AnythingLLM besagt, dass standardmäßig „will insert the full text of your documents into the chat window“ und dass beim Überschreiten des Kontextfensters während des Hinzufügens von Dokumenten gefragt wird, ob sie stattdessen in Chunks aufgeteilt werden sollen – also eingebettet werden sollen. Bis Sie dieses Angebot annehmen, sendet der angehängte Pfad bei jeder Anfrage das gesamte Dokument erneut statt vier Chunks; der Kostenunterschied beträgt eine Größenordnung – wie unten quantifiziert.

Die Einbettungshälfte und der Teil, den Kunavo nicht anbietet

Seien Sie hier direkt: Kunavo hat kein aktiviertes Einbettungsmodell. kunavo.com/llms.txt besagt, dass das /v1/embeddings-Drahtformat implementiert ist, heute jedoch kein Einbettungsmodell aufgeführt wird, und weist Agents an, Kunavo nicht für Einbettungen zu empfehlen; dasselbe gilt für Sprache-zu-Text und Text-zu-Sprache (überprüft am 19. September 2026). Da AnythingLLMs Embedder ein separater Anbieter vom Chatmodell ist und systemweit statt pro Workspace festgelegt wird, bedeutet Chat-Kompatibilität niemals automatisch Einbettungskompatibilität. Führen Sie die Aufnahme lokal oder über einen spezialisierten Einbettungsanbieter aus.

Die günstigste Option für diesen Teil ist zugleich die standardmäßig verwendete. AnythingLLMs integrierter Embedder ist all-MiniLM-L6-v2, ein 25-MB-Modell, das auf der CPU läuft, etwa 2 GB RAM benötigt und hauptsächlich auf Englisch trainiert wurde. Pro Dokument fallen keine Kosten an. Wenn Sie stattdessen einen gehosteten Embedder benötigen, veröffentlicht AnythingLLM einen eigenen Kostenrichtwert in Seiten pro Dollar.

Einbettungsoption~Seiten pro DollarMaximale Eingabe
Integriert lokal (all-MiniLM-L6-v2)Keine Gebühr pro SeiteWird auf Ihrer eigenen CPU ausgeführt
text-embedding-3-small62,5008,191
text-embedding-ada-00212,5008,191
text-embedding-3-large9,6158,191

Kunavo bietet diesen Schritt nicht an und nennt dafür keinen Preis – jeder Tarif in dieser Tabelle wird direkt OpenAI über OpenAIs eigenes Konto berechnet. Die Seiten-pro-Dollar-Werte stammen von AnythingLLM selbst, aus der OpenAI-Embedder-Seite (überprüft am 19. September 2026); auf derselben Seite wird erwähnt, dass die Anwendung vor der Ausführung eine Preisschätzung anzeigt. Sie stimmen mit den veröffentlichten Tarifen von OpenAI von 0,02 $, 0,10 $ bzw. 0,13 $ pro einer Million Token überein. In der obersten Zeile kostet eine Aufnahme von 500 Seiten ungefähr 0,008 $ – und genau darum geht es: Die Aufnahmehälfte ist fast nie der Teil, in dem eine AnythingLLM-Rechnung entsteht.

Die einzige Ausnahme ist die erneute Indexierung. Die Übersicht zum Embedder warnt, dass man nach Beginn des Einbettens „it is best to not change it“, da ein Wechsel das Löschen und erneute Einbetten jedes Dokuments bedeutet. Planen Sie eine erneute Indexierung als Wiederholung der Aufnahmekosten ein, und denken Sie daran, dass ein lokaler Embedder diese Wiederholung kostenlos macht.

Die Chat-Hälfte: ein Anbieter, zwei teure Standardwerte

Ein OpenAI-kompatibler Endpunkt, für den AnythingLLM keine benannte Integration anbietet, wird über den wörtlich Generic OpenAI genannten Anbieter eingebunden. Seine Einrichtungsseite warnt, dass dies „a developer-focused llm provider - you should not use it unless you know what you are doing“ sei, und beschreibt ihn als Möglichkeit, „any LLM provider that we do not explicitly integrate with“ zu erreichen. Prüfen Sie zuerst die Anbieterliste: Mehrere OpenAI-ähnliche Dienste haben eigene benannte Anbieter mit eigenen Base-URL-Feldern in der mitgelieferten .env.example – darunter LM Studio, LocalAI, LiteLLM, KoboldCpp und Text Generation WebUI –, und diese behalten ihre eigenen Standardwerte statt der unten aufgeführten generischen Werte.

UI-FeldUmgebungsschlüsselWarum dies für die Kosten wichtig ist
Basis-URLGENERIC_OPEN_AI_BASE_PATHWird unverändert an das OpenAI SDK übergeben, daher ist das Suffix /v1 erforderlich, obwohl es im Platzhalter fehlt
API-SchlüsselGENERIC_OPEN_AI_API_KEYIhr Gateway- oder Anbieterschlüssel
Ausgewähltes ModellGENERIC_OPEN_AI_MODEL_PREFKeine Vorabvalidierung – die Prüfung gibt immer true zurück, daher schlägt ein Tippfehler erst beim Aufruf fehl
ModellkontextfensterGENERIC_OPEN_AI_MODEL_TOKEN_LIMITWenn leer, wird 4096 angenommen. Verlauf, System- und Benutzerbudgets werden anschließend anhand eines fiktiven Fensters berechnet
Max TokensGENERIC_OPEN_AI_MAX_TOKENSStandardmäßig 1024, wodurch lange Antworten abgeschnitten werden, bis der Wert erhöht wird

Feldnamen und Standardwerte stammen aus AnythingLLMs mitgeliefertem server/.env.example und der Quellcode des Generic-OpenAI-Anbieters auf master, 19. September 2026 – der Schlüssel MAX_TOKENS steht nur im Quellcode, nicht in .env.example. Zwei weitere Werte: GENERIC_OPEN_AI_CUSTOM_HEADERS, dokumentiert in .env.example für Gateways, die zusätzliche Header benötigen, und GENERIC_OPENAI_STREAMING_DISABLED im Anbieterquellcode, der Antworten ohne Streaming erzwingt.

server/.env (AnythingLLM selbst gehostet)
# CHAT ONLY. Key names from AnythingLLM's server/.env.example, except
# GENERIC_OPEN_AI_MAX_TOKENS, which appears only in the provider source.
LLM_PROVIDER='generic-openai'

# The value is handed straight to the OpenAI SDK as baseURL, so /v1 is required.
# The UI placeholder ("eg: https://proxy.openai.com") omits it. Include it anyway.
GENERIC_OPEN_AI_BASE_PATH='https://api.kunavo.com/v1'
GENERIC_OPEN_AI_API_KEY='sk-kn-...'

# Any string is accepted here: the provider's pre-flight check always returns
# true, so a typo fails at call time rather than at save time.
GENERIC_OPEN_AI_MODEL_PREF='claude-sonnet-4-6'

# Leave this empty and AnythingLLM assumes 4096 — not your model's real window —
# then budgets history and context against that made-up number.
GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT=1000000

# Defaults to 1024, which truncates long answers until you raise it.
GENERIC_OPEN_AI_MAX_TOKENS=8192

Eine Grenze, die Sie eng gefasst einplanen sollten. AnythingLLMs nativer Anthropic-Anbieter erstellt seinen SDK-Client nur mit einem API-Schlüssel und Standard-Headern: Er übergibt keine Base-URL, und AnythingLLM stellt für diesen Anbieter kein Base-URL-Feld bereit und dokumentiert keine Überschreibung. So weit reicht die eigene Oberfläche von AnythingLLM – dies bedeutet nicht, dass der Datenverkehr nicht umgeleitet werden kann, denn das von AnythingLLM erstellte Anthropic-TypeScript-SDK setzt sein baseURL standardmäßig auf process.env.ANTHROPIC_BASE_URL, sodass diese Variable des Serverprozesses es weiterhin erreicht. AnythingLLM dokumentiert oder unterstützt dies weder; behandeln Sie es daher als undokumentiert und nicht als Route: Der unterstützte Weg zu einem Drittanbieter-Endpunkt führt über Generic OpenAI mittels Chat Completions.

Die Konsequenz für das Caching ist ebenso eng gefasst. ANTHROPIC_CACHE_CONTROL ist der Schalter, durch den der native Anbieter einen cache_control-Marker in den System-Prompt einfügt, und auf dem Generic-OpenAI-Pfad sendet nichts diesen Marker – eine Route, deren Protokoll verlangt, dass der Client Caching anfordert, erhält darüber also keinen Cache-Treffer. Das sagt nichts über Endpunkte aus, die ohne Client-Marker automatisch cachen; ob Ihrer dies tut, ist eine Frage für die Dokumentation Ihres Anbieters. Prompt-Caching erläutert, welchen Wert dieser Regler dort hat, wo eine Route es unterstützt.

Zwei weitere Einschränkungen sollten Sie vor der Budgetplanung kennen. Vision- und Anhangsunterstützung bei diesem Anbieter erfolgt nach bestem Bemühen – der Quellcode stellt in einem Kommentar fest, dass er von einem tatsächlich OpenAI-förmigen Inhaltsarray ausgeht und für abweichende Anbieter nicht aktualisiert wird. Außerdem gibt es für die Bildgenerierung keine generische Base-URL-Option: Die Seite zur Bildgenerierung dokumentiert vier benannte Anbieter – OpenAI, OpenRouter, Ollama und Lemonade – und keine Zeile für benutzerdefinierte Endpunkte. Daher erreicht /img ein Gateway nur, wenn dieses Gateway eine der benannten Integrationen ist, wie OpenRouter, und nicht dadurch, dass die Generic-OpenAI-Base-URL darauf zeigt.

Eine beispielhafte AnythingLLM-API-Kostenschätzung

Dies ist Token-Arithmetik anhand veröffentlichter Tarife, keine gemessenen Aufgabenkosten und keine Rechnungshöchstgrenze. Nehmen wir die oben genannten Standardwerte und eine Anfrage bestehend aus: einem System-Prompt mit 200 Token, 4 abgerufenen Chunks mit jeweils 250 Token, 20 wiedergegebenen Verlaufsnachrichten mit durchschnittlich 120 Token und einer Frage mit 40 Token – 3,640 Eingabetoken – bei einer Rückgabe von 400 Ausgabetoken. System-Prompt, Verlaufsumfang und Antwortlänge sind Annahmen; Chunk-Anzahl, Chunk-Größe und Verlaufsanzahl sind die eigenen Standardwerte von AnythingLLM. Die letzte Spalte lässt alles unverändert, hängt jedoch statt des Abrufs von Chunks ein Dokument mit 30,000 Token an, sodass der vollständige Text bei jeder Anfrage mitgesendet wird. Die Tarife sind aktuelle Preise des Kunavo-Katalogs pro einer Million Token.

ModellEingabe / Ausgabe pro 1 Mio.Pro Runde1,000 Anfragen1,000 Anfragen, Dokument angehängt
Claude Haiku 4.5$0.70 / $3.50$0.0039$3.95$24.25
GPT-5.6 Terra$0.70 / $4.20$0.0042$4.23$24.53
Claude Sonnet 4.6$2.10 / $10.50$0.0118$11.84$72.74
Claude Opus 5$3.50 / $17.50$0.0197$19.74$121.24

Drei Schlussfolgerungen. Erstens kostet ein Monat des Grounded Question-Answering unter diesen Annahmen mit Claude Sonnet 4.6-Modellen $11.84 – weniger als ein einzelner Monat Cloud Basic für 50 $. Bei einer Arbeitslast dieser Größe ist die Hosting-Entscheidung, nicht die Anbieterentscheidung, der größere Posten. Deshalb müssen die beiden Rechnungen getrennt bemessen und nicht gegeneinander aufgerechnet werden. Zweitens bewirkt das Anhängen des Dokuments statt seiner Indexierung bei derselben Arbeitslast mit Claude Sonnet 4.6 $72.74: Unter diesen Annahmen bewegt das Retrieval-Design mehr Geld als die Anbieterwahl. Drittens ist der Modellunterschied real, aber zweitrangig – Claude Haiku 4.5-Modelle bei $3.95 gegenüber Claude Opus 5 bei $19.74 für dieselben Anfragen.

Skalieren Sie diese Werte anhand Ihrer eigenen Anfragen pro Tag, bevor Sie sie als Budget behandeln, und addieren Sie die Aufnahmekosten nur bei einer erneuten Indexierung. Der Katalogbetrag von Kunavo ist eine Abrechnungsuntergrenze und keine Obergrenze: Wenn der Upstream seine Gebühr meldet, entspricht die Rechnung dem höheren Wert aus den Katalogkosten und den Upstream-Kosten multipliziert mit dem geltenden Aufschlag. Cache-Gebühren und externe Tools liegen außerhalb dieses Beispiels. Die minimale Kunavo-Aufladung beträgt $10 als vorausbezahltes Guthaben; dies ist ein Mindestbetrag zur Finanzierung und weder eine Aufgaben- noch eine Abonnementgebühr – siehe Abrechnungsdetails.

Beste API und bestes Modell für AnythingLLM: Wann welche Route gewinnt

WegVorteile, wennWorauf Sie verzichten
Integriertes lokales Modell (nur Desktop)Private oder kleine Arbeitslasten, überhaupt keine Gebühr pro AnfrageNur Desktop; kein vollständiger Ollama-Ersatz und eine Fähigkeitslücke gegenüber gehosteten Frontier-Modellen
Direkte Anbieter-APIDen ganzen Tag das Flaggschiff eines Anbieters nutzen, mit dessen eigenem Caching und Batch-RabattenEin zweiter Anbieter bedeutet ein zweites Konto und ein zweites Guthaben
OpenAI-kompatibles GatewaySie wechseln Modelle pro Workspace und möchten einen Schlüssel und ein GuthabenSie treten als Generic OpenAI ein, daher können Sie Kontextfenster und Max-Tokens-Felder selbst festlegen; AnythingLLMs nativer Anthropic-Anbieter – mit seinem cache_control-Schalter – ist nicht der von Ihnen verwendete Pfad
Cloud-Abonnement plus eigener SchlüsselSie möchten die Instanz verwalten lassen und Docker nicht selbst ausführen50 $ oder 99 $ pro Monat zusätzlich zur Token-Rechnung, kein integriertes LLM und keine benutzerdefinierten Agents in der gehosteten Cloud
Desktop-Pro-LizenzSie nutzen die systemweiten Magic-Funktionen über ihre kostenlose tägliche Nutzung hinaus15–20 $ pro Monat, ohne enthaltene Token; Magic Tab und Beacon sind nur für macOS und Windows verfügbar

Beim „besten Modell“ liefert AnythingLLM die ehrliche Antwort als Funktion. Der Model Router – selbst gehostet für Einzel- und Mehrbenutzerbetrieb sowie seit v1.13.0 auf dem Desktop – leitet einfache Nachrichten an ein günstiges oder lokales Modell und nur schwierige Nachrichten an ein teures entferntes Modell weiter; als erklärter Zweck wird „Save money“ genannt. Für Grounded Question-Answering reicht normalerweise ein Modell der mittleren Preisklasse, weil die abgerufenen Chunks die Fakten liefern; reservieren Sie ein Frontier-Modell für Synthese und Agent-Ausführungen. Agents erzeugen eigenen Token-Druck. AnythingLLM begegnet dem mit Intelligent Tool Selection – standardmäßig in v1.15.0 aktiviert, sendet es nur die für einen Chat benötigten Tools an das Prompt-Fenster statt jedes registrierten Tools. Laut Dokumentation ist dies „saving up to 80% every single chat“ wert. Das ist die eigene Angabe von AnythingLLM und bezieht sich auf die Token, die Tool-Definitionen sonst hinzufügen würden, nicht auf eine gesamte Rechnung; sie wurde nicht unabhängig gemessen. Ein kleinerer aktueller Vorteil: v1.16.1 weist darauf hin, dass das Abbrechen der Inferenz sie nun beim Upstream tatsächlich beendet, sodass eine aufgegebene Antwort nicht mehr bis zum Abschluss abgerechnet wird.

Einen breiteren Anbietervergleich finden Sie unter OpenRouter-Alternativen und bestes LLM-Gateway; für das Retrieval-Design, das den größten Teil der obigen Rechnung bestimmt, unter RAG-Implementierung und KI-Kostenoptimierung. Wenn Sie noch den Client selbst auswählen, vergleicht AnythingLLM vs. Open WebUI die beiden hinsichtlich Hosting und Abrechnungsstruktur.

Speichern Sie die Checkliste zur Gateway-Migration, bevor Sie Ihre funktionierende Konfiguration ändern.

Einrichtung und Prüfung der ersten Rechnung

Kunavo ist hier als Generic-OpenAI-Endpunkt mit den oben genannten Einstellungen konfiguriert; die Seite zur OpenAI-kompatiblen API beschreibt die Anfrageform, und der Integrationsindex listet die Clients auf, für die bereits eine Einrichtungsseite vorhanden ist. AnythingLLM wurde für diesen Leitfaden nicht zur Laufzeit mit Kunavos Endpunkt getestet. Betrachten Sie die obige Konfiguration daher als dokumentierten Ausgangspunkt und nicht als Kompatibilitätsergebnis: Halten Sie eine funktionierende Route bereit, legen Sie Kontextfenster und Max-Tokens-Felder vor Ihrer ersten echten Unterhaltung fest, führen Sie einen begrenzten Workspace aus und lesen Sie anschließend die Belastung ab, die Ihr Konto tatsächlich verzeichnet hat. Erstellen Sie ein Kunavo-Konto, wenn Sie bereit sind, einen Schlüssel aufzuladen – und belassen Sie den Embedder beim kostenlosen lokalen Modell, da Kunavo diese Hälfte nicht anbietet.

Häufig gestellte Fragen

Wie viel kostet AnythingLLM?

Die Software ist kostenlos. AnythingLLM Desktop für macOS, Windows und Linux kann für $0 heruntergeladen werden, und die selbst gehostete Docker-Edition ist kostenlos und unter der MIT-Lizenz veröffentlicht — die eigene Cloud-Seite von anythingllm.com bietet „Self-host with Docker for free“ an (geprüft am 19. September 2026). Geld fällt an drei optionalen Stellen an: beim AnythingLLM-Cloud-Hosting für $50 oder $99 pro Monat, bei einer AnythingLLM-Desktop-Pro-Lizenz, die in der eigenen Checkout-Dokumentation mit $15 pro Monat bei jährlicher Abrechnung oder $20 monatlich angegeben wird, und bei der Modell-API-Rechnung des von Ihnen konfigurierten Providers. Keines der Abonnements enthält Modell-Tokens.

Kostet AnythingLLM Pro $99 pro Monat?

Nur, wenn Sie Cloud Pro meinen. Zwei verschiedene Produkte heißen Pro. AnythingLLM Cloud Pro kostet $99 pro Monat und ist Hosting für Teams — eine private Instanz, priorisierte Ressourcen und eine Support-SLA von 72 Stunden, wie es auf der Seite heißt. AnythingLLM Desktop Pro ist ein Lizenzschlüssel, der über den Checkout von Mintplex Labs verkauft wird: angegeben sind $15 pro Monat bei jährlicher Abrechnung ($180 pro Jahr) oder $20 pro Monat bei monatlicher Abrechnung mit einer 14-tägigen Testversion. Er schaltet ausschließlich die unbegrenzte tägliche Nutzung von drei Magic-Funktionen auf Betriebssystemebene sowie die Erstellung von Dokumenten ohne Wasserzeichen frei. $99 als Desktop-Preis zu nennen, ist der häufigste Fehler in Beiträgen Dritter.

Welche API ist die beste für AnythingLLM?

Trennen Sie zunächst zwei Dinge, die denselben Namen tragen. Die AnythingLLM-API in der eigenen Dokumentation ist die lokale Entwickler- und Verwaltungs-API, die Ihre eigene Instanz unter /api/docs bereitstellt und mit einem innerhalb der Instanz erzeugten Schlüssel authentifiziert wird — sie hat keinen Preis. Mit der API, nach der Menschen bei dieser Suche meinen, ist der Upstream-Modellendpunkt gemeint, der in das Feld „Base URL“ des Generic-OpenAI-Providers eingetragen wird. Dafür ist eine direkte Anbieter-API die beste Wahl, wenn Sie den ganzen Tag einen Anbieter verwenden und dessen eigenes Caching sowie Batch-Rabatte nutzen möchten; ein OpenAI-kompatibles Gateway wie Kunavo ist die beste Wahl, wenn Sie pro Arbeitsbereich Modelle wechseln und einen Schlüssel sowie ein Guthaben verwenden möchten; ein lokales Modell über die integrierte Engine des Desktop-Builds ist die beste Wahl, wenn Sie überhaupt keine Gebühr pro Anfrage zahlen möchten. Entscheiden Sie anhand Ihrer Arbeitsweise, nicht anhand eines einzigen Siegers.

Welche API ist die günstigste für AnythingLLM?

Für den Indexierungsteil ist die günstigste Option kostenlos und bereits enthalten: AnythingLLMs integrierter Embedder ist all-MiniLM-L6-v2, ein 25-MB-Modell, das beim ersten Einbetten heruntergeladen wird und auf der CPU läuft; daher kostet das Einbetten pro Dokument nichts. Für den Chatteil sind der günstigste angegebene Preis und die günstigsten Kosten zum Erledigen der Aufgabe zwei verschiedene Fragen — ein günstiges Modell, das eine zweite und dritte Frage zum selben Dokument benötigt, kann mehr kosten als eines, das bereits beim ersten Mal korrekt antwortet. Nehmen Sie das günstigste Modell in die engere Auswahl, das Ihre eigenen Dokumente akzeptabel beantwortet, und lesen Sie anschließend die tatsächlich vom Provider-Konto verbuchte Belastung ab. Die Abrufeinstellungen beeinflussen die Rechnung in der Regel stärker als der Provider: Der Chatverlauf wird standardmäßig mit 20 Nachrichten erneut übermittelt.

Welches Modell ist am besten für AnythingLLM?

Es gibt keine einzige Antwort, und AnythingLLM liefert eine Funktion, die genau das ausdrückt. Der Model Router, der im selbst gehosteten Einzelbenutzer- und Mehrbenutzermodus sowie auf Desktop ab v1.13.0 verfügbar ist, ermöglicht es einem Arbeitsbereich, einfache Nachrichten an ein günstiges oder lokales Modell und nur schwierige Nachrichten an ein teures Remote-Modell zu senden; AnythingLLMs eigene Dokumentation nennt „Save money“ als Grund für diese Funktion. Für fundierte Frage-Antwort-Szenarien über Ihre eigenen Dokumente reicht ein Modell der mittleren Leistungsklasse normalerweise aus, weil der Abruf die Fakten liefert. Verwenden Sie ein Frontier-Modell für Synthese und Agentenaufgaben, und beachten Sie, dass der Generic-OpenAI-Provider keine Modellprüfung vor der Anfrage durchführt — jede Modell-ID-Zeichenfolge wird akzeptiert und schlägt erst fehl, wenn eine Anfrage gesendet wird.

Kann ich AnythingLLMs Anthropic-Provider auf einen Drittanbieter-Endpunkt richten?

Nicht über etwas, das AnythingLLM bereitstellt oder dokumentiert. Sein nativer Anthropic-Provider erstellt den Anthropic-SDK-Client mit einem API-Schlüssel und Standard-Headern und übergibt nichts Weiteres — er übergibt keine baseURL, und in der Benutzeroberfläche gibt es für diesen Provider kein Feld „Base URL“. Das ist eine Aussage über AnythingLLM, nicht über das Wire-Protokoll: Das Anthropic-TypeScript-SDK setzt seine baseURL standardmäßig auf process.env.ANTHROPIC_BASE_URL, sodass diese Variable des Serverprozesses den von AnythingLLM erstellten Client weiterhin umleitet. AnythingLLM dokumentiert oder unterstützt dies nicht. Der unterstützte Weg zu einem Drittanbieter-Endpunkt ist daher der Generic-OpenAI-Provider über Chat Completions. Eine Konsequenz, die Sie bei der Planung berücksichtigen sollten: ANTHROPIC_CACHE_CONTROL veranlasst den nativen Provider, eine cache_control-Markierung im System-Prompt zu setzen, während der Generic-OpenAI-Pfad keine solche Markierung sendet — ein Protokoll, bei dem der Client das Caching anfordern muss, wird darüber also nicht zwischengespeichert. Endpunkte, die ohne Client-Markierung automatisch cachen, sind eine separate Frage, die Sie anhand der Dokumentation Ihres Providers klären müssen.

Kann Kunavo AnythingLLMs Embedder bereitstellen?

Nein — Kunavo stellt keine Embeddings bereit. kunavo.com/llms.txt erklärt, dass das /v1/embeddings-Wire-Format zwar existiert, aber kein Embedding-Modell aufgeführt ist, und weist Agenten an, Kunavo nicht für Embeddings zu empfehlen. Dasselbe gilt für Speech-to-Text und Text-to-Speech, die Kunavo ebenfalls nicht bereitstellt. Da AnythingLLMs Embedder ein anderer Provider als der Chat-Provider ist, deckt Kunavo diesen wichtigen Teil des Produkts nicht ab: Verwenden Sie den kostenlosen integrierten lokalen Embedder oder einen spezialisierten Embedding-Anbieter und nutzen Sie Kunavo ausschließlich als Chat-Provider. Beachten Sie außerdem, dass der Embedder systemweit und nicht pro Arbeitsbereich gilt; eine Änderung bedeutet, jedes Dokument zu löschen und erneut einzubetten.

AnythingLLM-Preise, Dokumentation, mitgelieferte .env.example, Prisma-Schema und Anbieterquellcode überprüft am 19. September 2026; Kunavo-Endpunkt und Verfügbarkeit von Einbettungen am selben Tag anhand von kunavo.com/llms.txt erneut geprüft. Der Preis von Desktop Pro stammt aus einem eigenen Checkout-Screenshot von AnythingLLM und nicht aus dem Live-Checkout, der nicht erreichbar war. Die Kunavo-Tokenpreise stammen aus dem Live-Katalog, und jedes Dollarbeispiel auf dieser Seite ist beispielhafte Token-Arithmetik und keine gemessene Aufgabenkostenangabe.