五種技術可以疊加。每種技術都能削減帳單中的不同部分——實際堆疊其中三種即可在不損失品質的情況下降低 70%;五種全部使用則可接近 85–90%。本指南提供完整選項、實測節省金額,以及每種技術可執行的程式碼。每種技術都在底部連結到專題深度解析。
五種技術,依投資報酬率排序
| # | 技術 | 削減的項目 | 實際可達的節省 |
|---|---|---|---|
| 1 | 提示快取 | 重複提示中的輸入 token | 輸入費用降低 60–90% |
| 2 | 模型分級 | 簡單工作每次呼叫的價格 | 便宜約 10 倍 |
| 3 | 輸出上限 | 輸出 token,創意工作中的主要成本 | 輸出是輸入的 4–5 倍 |
| 4 | 平行處理 + 批次處理 | 實際時間,而非每 token 成本 | 可設定更嚴格的逾時,減少重試 |
| 5 | 重試管理 | 失控的重試支出 | 限制尾端成本,而非平均成本 |
1. 提示快取——迄今投資報酬率最高的技術
如果您的系統提示超過 1,000 個 token,且在 5 分鐘內呼叫相同提示超過兩次,提示快取就是免費的節省。Anthropic 對快取輸入按10%的輸入價格 (2.5% on Claude Fable 5.1, 5% on Claude Opus 5.5)計費;OpenAI 會在10%自動套用等效機制。只需新增一個欄位:
# Prompt caching: 1 extra field = 10% rate on cached input
resp = client.messages.create(
model="claude-sonnet-5",
max_tokens=600,
system=[{
"type": "text",
"text": LONG_SYSTEM_PROMPT,
"cache_control": {"type": "ephemeral"}, # cache this part
}],
messages=[{"role": "user", "content": question}],
)實際節省:如果系統提示很大且穩定,輸入費用可降低 60–90%。查看您的/app/usage儀表板——如果cache_read_input_tokens為 0,您接下來有 30 分鐘的工作要做,而這項投資之後會持續回本。深度解析。
2. 模型分級——使用夠好的最便宜模型
Claude Haiku 4.5 的成本約為 Claude Opus 4.7 的 10%。對分類、格式化、路由決策與簡單摘要而言,Haiku 綽綽有餘。只有真正困難的推理呼叫才使用 Opus。
# Pick the cheapest model that's still good enough for the task.
# Escalate by difficulty: cheap (Haiku 4.5 / GPT-5.6 Terra) -> Sonnet 5 -> Opus 4.7
def pick_model(difficulty: int) -> str:
if difficulty <= 2: return "claude-haiku-4-5" # ~10x cheaper than Opus
if difficulty <= 4: return "gpt-5-6-terra" # a second family, cheap output
if difficulty <= 7: return "claude-sonnet-5"
return "claude-opus-4-7"建立分級決策的方法:先使用小型分類器(Haiku 本身即可用 100 個輸入 token 完成),再進行路由。使用保留評估集測量輸出品質。不要憑直覺選擇——請進行基準測試。
- 第 0 級(Haiku 4.5):分類、擷取、翻譯、<2K 輸入的摘要——每次呼叫成本為幾美分
- 第 1 級(GPT-5.6 Terra):較長摘要、程式碼補全、簡單工具使用——同樣只需幾美分,但較擅長長內容
- 第 2 級(Sonnet 5):真正的推理、多步驟代理程式、視覺工作——生產環境主力
- 第 3 級(Opus 4.7):只有在確認 Sonnet 無法正確完成時才使用
3. 輸出上限——限制生成內容,而不只是讀取內容
輸出 token 通常比輸入 token 貴 4–5 倍。寬鬆的max_tokens=4096預設值會讓模型冗長作答。請嚴格限制輸出長度,並使用停止序列在正確標記處截斷:
# Two-layer caps: per-call max_tokens + per-key wallet cap
client.chat.completions.create(
model="claude-sonnet-5",
messages=[...],
max_tokens=800, # cap each call
stop=["</answer>"], # cut at terminator
)
# /app/keys → set "Spending limit" per key:
# Production: $50/day · Experiment: $5/day · CI: $1/day將每次呼叫的max_tokens與/app/keys中的每個金鑰錢包支出上限搭配使用——失控的迴圈或錯誤無法超過您的每日上限。兩層限制都很重要。
4. 平行處理——適用於批次型工作負載
如果您要處理 1,000 個彼此獨立的項目(分類回饋、評分潛在客戶、產生描述),序列呼叫需要一小時。使用AsyncOpenAI的非同步處理與並行限制,可在不到一分鐘內完成——更嚴格的逾時也能讓您對緩慢的上游服務快速失敗。平行處理不會降低每 token 成本,但能啟用冪等處理、更嚴格的重試預算等架構模式。
5. 重試管理——不要為失控的重試付費
天真的程式碼會針對每個錯誤重試,包括 400。這是在為失敗付費(Kunavo 不會對 4xx 請求計費,但您仍會消耗速率限制額度與實際時間)。正確策略:只重試 408/429/5xx,使用帶抖動的指數退避,最多嘗試 5 次,總等待時間最多 30 秒。其他情況都應快速失敗並呈現錯誤。
實際節省金額
一個每月支出 $5,000 且使用 Kunavo 的 SaaS,其實測可達的節省金額:
- 新增提示快取:節省 $2,000(−40%)
- 用 Haiku 分級處理分類:節省 $800(−16%)
- 更嚴格的
max_tokens:節省 $400(−8%) - 合計:每月節省 $3,200,支出 $1,800(總計 −64%)
這些技術可以疊加——每項後續技術都會在已降低的基準上發揮作用。如果先套用快取,其他技術的節省會減少。順序很重要:先從第 1 項開始,再到第 2 項,然後第 3 項。
宣稱有效但實際無效的方法
- 「所有事情都使用嵌入」——嵌入可節省文字搜尋成本,但不會降低生成成本。它們很便宜,卻不會減少 LLM 呼叫成本
- 「為了節省成本而進行本機微調」——只有在狹窄任務上每天處理超過 10M token 時才合理。對大多數團隊而言,提示快取 + Haiku 分級勝過自行託管的營運複雜度
- 「更便宜的聚合服務」——Kunavo 對大多數模型的定價已低於供應商官方價格。更便宜的聚合服務通常是透過暗中將您要求的模型換成更便宜的模型來取勝
接下來可以查看
先套用快取——每小時投入的投資報酬率最高。接著按模型與分級分析您的/app/usage儀表板。然後進行分級。將每月每位活躍使用者的成本作為北極星指標——如果使用者互動增加時該數值持平或下降,表示您做對了。
常見問題
提示快取能讓 LLM 帳單降低多少?
Anthropic 對快取輸入按10%的正常輸入價格 (2.5% on Claude Fable 5.1, 5% on Claude Opus 5.5)計費,而 OpenAI 會在10%自動套用等效機制。對於具有大型且穩定系統提示的工作負載,這可讓輸入成本降低 60–90%。請先套用這項技術——之後的每種技術都會在降低後的基準上發揮作用。請參閱提示快取深度解析,了解確切的請求格式。
Claude Haiku 比 Claude Opus 便宜多少?
Claude Haiku 4.5 的成本約為 Claude Opus 4.7 的 10%——便宜約 10 倍。對分類、擷取、翻譯與短摘要而言,Haiku 已經足夠;只有在確認 Claude Sonnet 5 會出錯的推理工作上才使用 Opus。目前各模型的價格請見Claude API 價格指南。
輸出 token 比輸入 token 貴嗎?
是——輸出 token 通常比輸入 token 貴 4–5 倍。這就是寬鬆的 max_tokens=4096 預設值很昂貴的原因:它會讓模型在帳單中最昂貴的項目上冗長作答。為每次呼叫設定 max_tokens 上限,並使用停止序列在正確標記處截斷。
實際上總共能讓 LLM 帳單降低多少?
實際堆疊五種技術中的三種即可在不損失品質的情況下達到 70% 的降幅,五種全部使用則可接近 85–90%。以每月 $5,000 的實測工作負載為例:提示快取節省 $2,000(−40%)、用 Haiku 分類節省 $800(−16%),更嚴格的 max_tokens 節省 $400(−8%)——節省 $3,200、支出 $1,800,總降幅為 64%。
LLM API 呼叫的正確重試策略是什麼?
只重試 408、429 與 5xx 回應,使用指數退避加抖動,最多重試 5 次,總等待時間上限為 30 秒。其他情況都應快速失敗。重試 400 永遠不會成功——而且雖然 Kunavo 不會對失敗的 4xx 請求計費,它們仍會消耗速率限制額度與實際時間。