Die Kosten eines Workflows entsprechen seiner Verteilung, und keine der Anleitungen zu Workflows erwähnt das. Die eigene Dokumentation von Anthropic ist die richtige Quelle, um zu lernen, was dynamische Workflows sind und wie man einen schreibt. Diese Seite beantwortet die unmittelbar anschließende Frage: Was kostet die Ausführung und welcher Regler verändert das?
Kurzfassung — ein Workflow, der auf fünf Subagenten verteilt, verbraucht ungefähr die Tokens von fünf Agenten, nicht von einem. Das ist sein Zweck und zugleich die Rechnung.
Die Rechnung
# A workflow's cost is not "one task". It is the fan-out.
#
# workflow_cost = orchestrator_steps x step_cost
# + subagents x subagent_steps x step_cost
#
# A step is 25,000 in / 1,200 out — the same sizing used on
# every other cost page here, so these numbers are comparable.
#
# Claude Sonnet 5 $0.043 / step
# Claude Haiku 4.5 $0.022 / step
#
# Same job, three shapes:
#
# one thread, 20 steps, all Sonnet
# = 20 x $0.043 = $0.868
#
# 5 subagents x 8 steps + 6 orchestrator steps, all Sonnet
# = 46 x $0.043 = $2.00
#
# same fan-out, subagents on Haiku, orchestrator on Sonnet
# = 40 x $0.022 + 6 x $0.043 = $1.13
#
# The fan-out costs more than the single thread. Mapping the fan-out
# to the cheap tier is what buys most of it back.Lesen Sie die drei Formen als dieselbe Aufgabe, die auf drei Arten erledigt wird. Die Verteilung ist in jedem Fall teurer als der einzelne Thread — was sich ändert, ist das Ausmaß, und das wird fast vollständig dadurch bestimmt, auf welcher Stufe die Subagenten laufen.
Die eine Zeile, die es verändert
Subagent-Arbeit in einem Workflow ist meist begrenzt und mechanisch: eine Datei lesen, einen Diff zusammenfassen, eine Bedingung prüfen, Bericht erstatten. Dafür ist ein kleines Modell gedacht. Der Orchestrator ist das Gegenteil — er hält den Plan, und ein schlechter Plan verschwendet die Arbeit jedes darunterliegenden Subagenten; dort verdient eine starke Stufe ihren Preis.
# The one line that changes every workflow run: the tier the
# background and sub-task work lands on.
export ANTHROPIC_BASE_URL=https://api.kunavo.com
export ANTHROPIC_AUTH_TOKEN=sk-kn-...
export ANTHROPIC_MODEL=claude-sonnet-5 # orchestration
export ANTHROPIC_DEFAULT_OPUS_MODEL=claude-opus-5-5 # agents that ask for opus
export ANTHROPIC_DEFAULT_SONNET_MODEL=claude-sonnet-5 # agents that ask for sonnet
export ANTHROPIC_DEFAULT_HAIKU_MODEL=claude-haiku-4-5 # the fan-outClaude Code leitet seine automatischen Aufrufe für Teilaufgaben an das weiter, was der Haiku-Stufe zugeordnet ist. Diese Zuordnung ist daher bei jedem Lauf aktiv, unabhängig davon, ob Sie Workflows ausdrücklich verwenden. Die Opus-Zeile ist erforderlich, weil der integrierte Standard von Claude Code und sein Alias opus beide auf das neueste Opus verweisen. Wenn Kunavo dieses Modell noch nicht anbietet, gibt alles, was darauf zurückfällt, 404 zurück. Die Zeile legt beides auf Opus 5.5 (claude-opus-5-5), wofür Claude Code v2.1.280 oder höher erforderlich ist (führen Sie bei einer älteren Version claude update aus). Die Sonnet-Zeile ist für Workflows noch wichtiger: Der Alias sonnet fordert Sonnet 5.5 an, das Kunavo nicht anbietet. Ohne diese Zeile geben alle Subagenten mit model: sonnet, die Ausführungsphase von opusplan und /model sonnet 404 zurück. Den Break-even für die Stufe des Orchestrators – wie viel schlechter ein günstigeres Modell sein darf, bevor es nicht mehr günstiger ist – finden Sie unter Opus vs Sonnet vs Haiku.
Zwei Dinge, die der Kostenvoranschlag verfehlt
Wiederholungsversuche. Ein Subagent, der fehlschlägt und erneut ausgeführt wird, wird zweimal berechnet; durch die Verteilung steigt die Wahrscheinlichkeit, dass dies mindestens einmal geschieht. In jeder Schätzung zum Planungszeitpunkt ist das unsichtbar und erscheint erst im Nutzungsdatensatz.
Gecachter Kontext. In die andere Richtung: Von demselben Orchestrator gestartete Subagenten teilen häufig ein stabiles Präfix, und ein Cache-Treffer wird zu einem Bruchteil des Eingabepreises berechnet. Bei einem langen Workflow ist dies die größte einzelne mögliche Reduzierung — größer als der Wechsel der Stufe oben. Die Funktionsweise und die drei Arten, wie das Routing über ein Gateway den Cache unterbricht, finden Sie unter Claude Prompt-Caching.
Entscheiden, ob überhaupt verteilt werden soll
Workflows sind keine Kostenoptimierung. Das sollte klar sein, weil diese Einordnung die Antwort bestimmt. Sie kaufen Latenz und Bandbreite: Mehrere Subagenten arbeiten gleichzeitig, werden schneller fertig und decken mehr ab als ein einzelner Thread, der dieselbe Liste abarbeitet. Die Frage ist, ob dies das Vielfache wert ist; die obige Rechnung liefert das Vielfache für Ihr eigenes Muster.
Für die Funktion selbst — wie man einen Workflow definiert, wie Subagenten orchestriert werden und wie die Syntax lautet — ist die Dokumentation von Anthropic maßgeblich; diese Seite versucht nicht, sie zu wiederholen. Für die Ausführung der Modelle darunter benötigen Sie eine Basis-URL und einen Schlüssel; die Seite zu Abonnement- und Tokenlimits finden Sie unter Claude Pro und Max Limits.
Häufig gestellte Fragen
Was kostet ein Claude-Code-Workflow?
Mehr als bei derselben Arbeit in einem einzigen Thread, denn die Kosten eines Workflows werden durch seine Verzweigung bestimmt. Modellieren Sie ihn als Orchestrator-Schritte plus Subagenten multipliziert mit deren Schrittanzahl, alles multipliziert mit den Kosten eines einzelnen Schritts. Zu Kunavo-Tarifen kostet ein Schritt mit 25.000 Input- und 1.200 Output-Tokens auf Claude Sonnet 5 $0.043: Ein einzelner Thread mit 20 Schritten kostet etwa $0.868, während fünf Subagenten mit jeweils acht Schritten plus sechs Orchestrator-Schritte 46 Schritte und etwa $2.00 ergeben. Die Verzweigung bringt Parallelität und größere Breite, aber keinen Rabatt.
Wie kann ich Workflows günstiger machen, ohne die Verteilung aufzugeben?
Legen Sie die Verteilung auf die günstigste Stufe und die Orchestrierung auf eine leistungsfähige. Teilaufgaben in einem Workflow sind normalerweise begrenzt und mechanisch — dies lesen, jenes zusammenfassen, das andere prüfen — genau dafür ist ein kleines Modell gedacht, während der Orchestrator den Plan hält und korrekt sein muss. Wenn man dasselbe 46-Schritte-Beispiel so abbildet, kostet es etwa $1.13 statt $2.00, und die Änderung besteht in einer Umgebungsvariablen statt einer Neuentwicklung.
Lohnen sich Workflows, wenn sie mehr kosten?
Oft ja, aber entscheiden Sie anhand der richtigen Achse. Ein Workflow ist keine Kostenoptimierung, sondern eine Optimierung von Latenz und Bandbreite: Mehrere Subagenten arbeiten gleichzeitig, werden schneller fertig und decken mehr ab als ein einzelner Thread, der dieselbe Arbeit nacheinander erledigt. Die Frage lautet, ob die Parallelität das Vielfache wert ist, nicht, ob es dieses Vielfache gibt — es gibt es, und jede Seite, die etwas anderes behauptet, hat nicht nachgerechnet.
Welches Modell sollte der Orchestrator verwenden?
Der Orchestrator erstellt den Plan und liest die Ergebnisse, daher kostet ein schwaches Modell an dieser Stelle am meisten – ein schlechter Plan verschwendet die Arbeit jedes nachgeordneten Subagenten. Claude Sonnet 5 zu $1.40 / $7.00 pro 1M Tokens ist die praktische Standardeinstellung; Claude Opus 5.5 zu $2.80 / $14.00 rechtfertigt seinen Preis bei wirklich mehrdeutigen Aufgaben. Der Break-even-Punkt bei der Anzahl der Versuche zwischen den Tarifen steht auf der Vergleichsseite.
Funktionieren Workflows über einen benutzerdefinierten API-Endpunkt?
Ja — Workflows sind eine clientseitige Orchestrierungsfunktion. Sie laufen daher überall dort, wo Claude Code läuft, und Claude Code liest ANTHROPIC_BASE_URL nativ. Jeder Subagent-Aufruf geht an denselben Endpunkt wie der des Orchestrators. Dadurch werden die Kosten an einer Stelle sichtbar: Die Verteilung eines Workflows erscheint als Burst von Anfragen in einer Nutzungsansicht, statt auf mehrere Konten verteilt zu sein.
Wie sehe ich, was ein Workflow tatsächlich gekostet hat?
Lesen Sie die Kosten pro Anfrage ab, statt sie anhand des Plans zu schätzen, da die Anzahl der Subagent-Schritte zur Laufzeit festgelegt wird und selten Ihrer Schätzung entspricht. Bei einem Token-Schlüssel ist jeder Aufruf der Verteilung eine addierbare Zeile, einschließlich der von einem fehlschlagenden Subagenten erzeugten Wiederholungsversuche — diese werden berechnet und sind in jeder Vorabschätzung unsichtbar.