SillyTavern 不販售 API,也不提供訂閱,因此為 SillyTavern 選擇最佳 API,其實是購買模型與供應商服務——決定性數字是依你的 Context Size 計算的一輪成本,而不是每百萬 Token 的醒目價格。 SillyTavern 在每次生成時都會重新傳送角色卡、系統提示以及能容納的所有歷史內容,因此即使費率不變,帳單仍會隨對話增加。
1.19.0 版於 2026 年 9 月 14 日以 AGPL-3.0 授權發布,儲存庫最後一次推送也是 2026 年 9 月 14 日(於 2026 年 9 月 18 日檢查)。以下兩者都不是 SillyTavern:TavernAI 是獨立的前身專案——文件將 SillyTavern 的起源標示為「2023 年 2 月,從 TavernAI 1.2.8 分支而來」——以及 SillyTavern-Extras,其儲存庫描述目前以「[OBSOLETE]」開頭。告訴你安裝 Extras 的教學都已過時。
哪些免費,哪些不免費
| 你購買的是什麼 | 價格 | 來源 |
|---|---|---|
| SillyTavern,所有平台 | $0、AGPL-3.0、沒有付費層,也沒有由專案販售的代管服務 | 文件表示它「將永遠免費並以開放原始碼提供」 |
| 用來執行它的環境 | Node.js 20 或更新版本 | package.json 宣告 "engines": { "node": ">= 20" } |
| 產生回覆的模型 | 這就是全部的週期性帳單 | 文件稱它是「一個本機安裝的使用者介面,讓你能與文字生成 LLM 互動」 |
| 第三方「SillyTavern 代管」或付費行動應用程式 | 他人的產品 | sillytavern.app 沒有公布任何價格 |
資料檢查日期為 2026 年 9 月 18 日:專案儲存庫與官方常見問題。常見問題將後端分為自行託管的模型(執行時免費)與付費網路服務,後者按其原文為「使用時需要付費」。
SillyTavern 聊天如何產生帳單
SillyTavern 的 Context Size 文件將此設定定義為 SillyTavern 將作為提示傳送給 API 的最大 Token 數,扣除回應長度,並表示上下文「包含角色資訊、系統提示、聊天記錄等」。聊天中虛線以上的訊息會直接不予傳送,而不是進行摘要。因此,一輪成本約為 context tokens × input rate + reply tokens × output rate,而重新生成回覆時,輸入部分會再次完整計費。
預設的 Chat Completion 上下文為 4,095 個 Token,設定於隨附的預設值中(於 2026 年 9 月 18 日讀取);滑桿可將其提高數個數量級,解鎖上下文後還能進一步提高。因此,Context Size 是應用程式中最大的預算控制項:在相同費率下,將其提高至四倍,後續每則訊息的輸入費用大致也會提高至四倍。
模型候選清單與各自費用
每百萬輸入/輸出 Token 的美元價格:目前的 Kunavo 目錄費率與供應商自行公布的牌價並列,全部檢查於 2026 年 9 月 18 日。
| 模型 | Kunavo:輸入/輸出 | 供應商牌價:輸入/輸出 | 適用情境 |
|---|---|---|---|
| GPT-5.6 Terra | $0.70 / $4.20 | $2.00 / $12.00 | 非 Claude 的聲音,可用於針對同一張角色卡取得第二意見 |
| Claude Haiku 4.5 | $0.70 / $3.50 | $1.00 / $5.00 | 此處價格最低的一列——平價的 Claude,適合每輪成本以輸入為主的長時間工作階段 |
| Claude Sonnet 5 | $1.40 / $7.00 | $2.00 / $10.00 | 品質與每輪成本的日常平衡 |
| Claude Opus 5 | $3.50 / $17.50 | $5.00 / $25.00 | 較高階的 Claude 層級;請先比較其列項,再假定它更昂貴 |
| Claude Fable 5.1 | $7.00 / $35.00 | $10.00 / $50.00 | 本表中每輪最昂貴的模型,在目錄價與牌價下皆然 |
供應商價格來自 Anthropic 的定價頁面與 OpenAI 的開發者定價。
一個每月估算範例
假設每月生成 100 次,提示已增長至約 16,000 個 Token,每次回覆 300 個 Token,且不重新生成。這就是 160 萬個輸入 Token 與 30,000 個輸出 Token。依上述目錄費率:
| 模型 | 100 輪的估計總額 |
|---|---|
| GPT-5.6 Terra | $1.25 |
| Claude Haiku 4.5 | $1.22 |
| Claude Sonnet 5 | $2.45 |
| Claude Fable 5.1 | $12.25 |
這是基於假設數字的 Token 計算,不是實測工作階段,也不是你將被收取費用的上限。改變任何假設,答案都會變動:提高 Context Size、重新生成回覆,或將 100 輪改為 500 輪,都會按比例增加輸入部分。此估算也不包含快取費用,下一節將說明這部分。
決定長對話成本的快取差距
這是從 UI 內部看不出來的部分。在 其聊天完成後端的 1.19.0 版本分支中(於 2026 年 9 月 18 日讀取),每個 cache_control 標記都受限於內建來源檢查:Claude 來源、針對 claude- 模型 ID 的 ElectronHub 來源、針對 anthropic/claude 模型 ID 的 OpenRouter 來源、同樣針對其判定可快取的 google/gemini ID 的 OpenRouter 來源,以及 NanoGPT 旗標。Custom (OpenAI-compatible) 分支不在上述任何檢查中,也不會設定任何 cache_control 欄位——它設定的是 logprobs、若你設定 JSON schema 則設定 response_format、你的 Include Headers 與 Include Body Parameters,以及你要求的 reasoning_effort 或 verbosity。此外,隨附的設定中也沒有 custom: 區段;claude:與gemini:快取開關位於該設定中。
其結果特別適用於 Anthropic 的通訊協定:Custom 來源永遠不會設定 cache_control 標記,因此在 Claude 模型上,每輪整段歷史都會按完整輸入價格重新計費,除非端點自行插入斷點。這不代表此路徑完全不會快取。OpenAI 的提示快取對支援的模型預設啟用,且不要求用戶端進行任何設定,因此透過相同 Custom 來源的 GPT 路由可以快取,而 Claude 路由則不行。快取由模型與端點決定,而不是由 SillyTavern 傳送的內容決定。Kunavo 的 OpenAI-to-Anthropic 轉譯會插入這些標記——位於工具與系統區塊,以及當對話已包含助理回合後、位於最後一則訊息上的滾動斷點;這正是 SillyTavern 在第一輪之後的聊天形態。提示必須達到 8,192 個字元才會啟用,而且永遠不會超過供應商的四個斷點上限。詳細資訊請參閱快取文件,該文件是為自行設定斷點的呼叫端撰寫。
以下說明其在最佳情況下的價值,而不是預測:如果 16,000 個提示 Token 中,每輪有 12,000 個按 Kunavo 對 Claude Sonnet 5 的快取讀取費率(每百萬個為 $0.14)從快取讀取,相同的 100 輪總費用約為 $0.94,而不是 $2.45。請將此視為可取得的最大節省,而不是你將支付的上限:它假設每輪都命中快取,且不計算任何快取寫入費用,因此實際帳單會高於此數字。Anthropic對快取讀取收取基本輸入費率的 0.1 倍(Fable 5.1 為 0.025 倍),而有效期為五分鐘的快取寫入收取 1.25 倍——如果角色扮演者兩則訊息之間的間隔超過這段時間,便會再次支付寫入費,而不是讀取費。Anthropic 也提供有效期為一小時的快取寫入,費率為 2 倍。本指南沒有透過閘道對任何實際的 SillyTavern 聊天工作階段進行計費,因此在根據快取命中規劃預算前,請先檢查你自己第一次長對話的用量回報。
直接連線、使用閘道、訂閱或本機方案何時更合適
| 方式 | 適合購買的情況 | 取捨 |
|---|---|---|
| 直接供應商(Anthropic、OpenAI、Google) | 你想使用單一供應商及 SillyTavern 針對該供應商的內建來源 | 內建 Claude 來源提供 Custom 來源沒有程式碼路徑可用的快取設定;每個供應商各使用一個帳戶 |
| 多模型閘道 | 你想將 Claude 與 GPT ID 放在同一組金鑰與同一個餘額後方 | SillyTavern 以純 OpenAI 聊天格式與其通訊,因此它提供的供應商專用控制項仍停留在內建來源中 |
| 固定費率的開放權重託管服務 | 你每天聊天,並希望每月金額可預測 | 檢查方案的上限:Arli AI 的方案依最大上下文長度區分,而長對話消耗的正是這項資源 |
| 免費託管服務 | 想試用應用程式,或聊天內容能容忍排隊 | 付出優先順序與速率限制,而不是帳單 |
| 本機模型 | 你擁有硬體,想要沒有內容篩選器,也不想使用金鑰 | 你的機器、你的維護工作、你的品質上限 |
以下具體數字於 2026 年 9 月 18 日核查。OpenRouter按供應商原價計費,並在使用卡片購買額度時收取 5.5% 的費用(最低 $0.80);免費模型每天限制 50 次請求,購買至少 $10 的額度後則為 1,000 次。NanoGPT提供隨用隨付方案及可選的每月 $12 訂閱,使用加密貨幣儲值的最低金額為 $0.10,使用卡片則為 $1。Arli AI提供免費層,以及每月 $10、$15、$20、$30 與 $160 的方案;各方案依最大上下文長度(免費方案為 12K,最高方案為 512K)、模型大小與平行請求數量而異;Infermatic列出免費方案,以及 $9、$16 與 $20 的方案;Featherless列出每月 $25 的 Chat 方案與 $50 的 Developer 方案。AI Horde將自己描述為「免費 · 社群營運 · 開放原始碼」;其常見問題說明,佇列位置取決於你的總 kudos 餘額,而匿名使用者從零開始,因此註冊使用者的排名高於匿名使用者。Google 發布免費的 Gemini 層,但其速率限制頁面沒有列出免費層按模型區分的數字,並將你引導至 AI Studio,因此你在其他地方看到的任何具體免費層配額,都應視為未經驗證。
Kunavo 沒有免費層,也沒有註冊贈金:最低金額為$10 的預付額度,不提供訂閱,餘額也不會過期。目錄估算同樣不是價格上限——費用如何結算,請參閱計費。
價格之前,先看內容規則
SillyTavern 自己的常見問題表示,付費網路服務「經常會進行內容審查,並拒絕與你討論某些主題」。這是第一方資訊,也是應該設定的正確預期。Anthropic 的 Usage Policy禁止色情聊天與露骨性內容生成,對成年使用者也沒有例外;閘道不會改變模型所遵循的政策——Kunavo 自身的政策表示,上游供應商政策適用於你傳送的內容。本頁任何內容都不應被解讀為提供未經過濾的端點。如果你的需求是不受限制的成人角色扮演,誠實的答案是本機模型或開放權重託管服務,而上方的模型候選清單並不是適合你的選項。
完成設定,再控制帳單
文件記載的路徑是 Chat Completion → Custom (OpenAI-compatible),填入 Custom Endpoint (Base URL) 與 Custom API Key。不要附加 /chat/completions;如果連線失敗,請加入 /v1。第一次進行長聊天前,以下四點值得了解:
- 除非模型 ID 位於剔除清單中,否則取樣參數會被傳送出去。 前端請求建構器會將
temperature、top_p、frequency_penalty與presence_penalty放入每個 Chat Completion 請求。在 1.19.0 版本分支中,對於符合claude-fable、claude-opus-5或claude-sonnet-5的任何模型 ID,它接著會刪除上述四項以及top_k——該規則只依模型 ID 判定,不檢查來源,因此也會在 Custom 來源上觸發。它不涵蓋 Claude Haiku 4.5,而旁邊相應的 GPT-5 規則只對內建 OpenAI、Azure 與 OpenRouter 來源執行,因此這些 ID 仍會透過自訂端點傳送取樣欄位。Kunavo 的目錄另外將temperature、top_p與top_k標示為上方列出的 Claude 5 模型不支援,並會在上游呼叫前移除它們;若端點不會移除,請在 Additional Parameters 抽屜中的 Exclude Body Parameters 將其留白,否則拒絕這些欄位的模型會回傳 400。 - 將 Start Prompt Post-Processing 設為 None。 Anthropic 的 Messages API會自行合併連續的相同角色回合,而且沒有 system 角色,因此轉譯閘道會將系統訊息提升至頂層參數。SillyTavern 文件將 None 定義為「除非 API 嚴格要求,否則不套用明確處理」,Semi-strict 定義為合併角色,並只允許一則可選的系統訊息;Strict 則進一步要求第一則訊息必須是使用者訊息——因此如果看到關於訊息角色的 400 錯誤,請提高至 Semi-strict。請注意,Merge、Semi-strict 與 Strict 也會移除工具呼叫,除非你選擇「with tools」變體。
- Token 計數器僅為估算值。 SillyTavern 的 tokenizer 文件指出,當後端未提供 tokenizer 時,計數「會依所選 tokenizer 類型估算」,而其最佳比對規則列出的是特定供應商,而非任意自訂端點。Anthropic表示,Claude 4.7 及後續模型使用較新的 tokenizer,對相同文字產生「約多 30% 的 token」,因此舊 tokenizer 產生的計數,與這些模型實際計費時採用的數量相比會偏低。
- 反向 Proxy 抽屜是另一項功能。 隨附的 UI中的警告區塊僅針對內建來源 (
data-source="openai,claude,mistralai,…"),內容為「如果您使用 proxy,任何支援請求都將被拒絕。」同名的文件頁面則是關於讓 SillyTavern 本身置於 Traefik、NGINX 或 Caddy 後方,又是不同主題。Custom source 才是受支援的途徑,並不是該抽屜。
Kunavo 提供一份 SillyTavern 設定指南,列出各欄位的確切值 — 這是書面設定說明,並非代您執行的執行階段相容性測試。如果上述費率符合您的聊天需求,請建立帳號,以最低金額 $10 開始使用,而無須訂閱。
常見問題
SillyTavern 的費用是多少?
SillyTavern 本身不收費。它是採用 AGPL-3.0 授權、由你安裝並在本機執行的軟體;1.19.0 版於 2026 年 9 月 14 日發布,專案文件表示它「將永遠免費並以開放原始碼提供」。真正需要付費的是它連接的模型 API,由你選擇的供應商按 Token 計費;如果你在本機執行模型,則成本是硬體與電費。任何宣稱 SillyTavern 價格的頁面,販售的是代管服務或 API 訂閱,而不是應用程式本身。
SillyTavern 最便宜的 API 是哪一個?
完全不會產生帳單的路由包括本機推論(KoboldCpp、llama.cpp、Ollama、Oobabooga)以及 AI Horde。AI Horde 是由志願者營運的服務,SillyTavern 開箱即可連線;你付出的代價是佇列優先順序,而不是金錢。部分供應商也會提供自有免費層。在付費端點中,列出的最低費率與完成一次聊天的最低成本是不同的說法:SillyTavern 每次生成都會重新傳送完整提示,因此,某個需要多次重新生成的模型即使每 Token 費率較低,也可能比一次就產生理想回覆的較昂貴模型更花錢。請依你實際的 Context Size 比較每輪成本,不要只看醒目的費率。
SillyTavern 最適合使用哪個模型?
本頁沒有依文字品質為模型排名,因為沒有測量文字品質——請根據你實際能定價的限制來選擇,也就是每輪成本。若要讓長對話的每輪成本最低,可考慮 Claude Haiku 4.5 這類便宜層級。若要兼顧日常使用,可選 Claude Sonnet 5 或 Claude Opus 5。Claude Fable 5.1 是本頁比較模型中每輪最昂貴的,因此只有在你能從自己的聊天中分辨出差異時才值得使用。SillyTavern 1.19.0 的版本說明記錄了對 Claude Fable 5 與 5.1、Claude Opus 4.8 與 5、Claude Sonnet 5 以及 GPT-5.6 模型的後端支援,因此其內建的 Anthropic 與 OpenAI 來源已經認得這些 ID。
SillyTavern 支援自訂的 OpenAI 相容 API 嗎?
支援,而且這是文件明確記載的一級路徑,不是權宜解法。將 API 設為 Chat Completion,將 Chat Completion Source 設為 Custom (OpenAI-compatible),然後填入 Custom Endpoint (Base URL) 與 Custom API Key。SillyTavern 文件表示,基礎 URL 不要加上 /chat/completions 字尾;如果連線失敗,請嘗試加上 /v1。如果端點實作了 GET /v1/models,Available Models 下拉式選單會自動填入;否則請手動輸入模型 ID。
為什麼 SillyTavern 的帳單會隨著聊天變長而增加?
因為提示內容變長了。SillyTavern 每次生成都會傳送角色卡、系統提示,以及 Context Size 容量所能容納的全部聊天記錄,因此在相同每 Token 費率下,第 200 輪的輸入費用遠高於第 2 輪。提示快取是能改變這種情況的關鍵,但在 1.19.0 版本分支中,SillyTavern 傳送的每個 cache_control 都受限於內建來源:自有 Claude 來源、針對 claude-* 模型 ID 的 ElectronHub 來源、針對 anthropic/claude 模型 ID 及可快取 google/gemini 模型的 OpenRouter 來源,以及 NanoGPT 專用旗標。Custom (OpenAI-compatible) 來源不在其中,因此在自訂端點上,快取必須由端點本身提供。
我可以使用付費 API 進行不受審查的角色扮演嗎?
無法使用前沿供應商的服務。SillyTavern 自己的常見問題警告,付費網路服務通常會進行內容審查,並拒絕某些主題;Anthropic 的 Usage Policy 更明確禁止色情聊天與露骨性內容生成。透過閘道轉送相同請求,不會改變模型所遵循的政策,而 Kunavo 的可接受使用政策表示,上游供應商政策適用於透過 Kunavo 傳送的內容。如果需求是不受限制的成人內容,應選擇本機模型或開放權重託管服務,而不是 Claude、GPT 或 Gemini 端點。
SillyTavern 的發布狀態、文件、隨附原始碼及競爭對手價格已於 2026 年 9 月 18 日查核。Kunavo 費率取自即時目錄;本文所有總額都是基於所述假設進行的 token 算術,而非實際工作階段的測量結果。