Zurück zu den Anwendungsfällen
Vertrauen und Sicherheit

KI-Content-Moderation — multimodale Trust & Safety mit Claude

Moderne Moderation ist nicht nur Regex — es geht um Nuancen: Sarkasmus, Dog Whistles, missbräuchliche Nutzung im Markenkontext sowie Bild-Text-Kombinationen. LLMs leisten dies deutlich besser als regelbasierte Systeme, zu skalierbaren Kosten.

Zuletzt überprüft am .

Warum LLMs regelbasierte Moderation übertreffen

Sarkasmus. Verdeckte Botschaften. Markenmissbrauch im Kontext („Ich liebe dieses Produkt, aber ich hasse den Kundendienst“). Mehrsprachige Nuancen. Kombinationen aus Bild und Bildunterschrift, bei denen jedes Element einzeln unauffällig ist, zusammen aber nicht. Regelbasierte Moderation bewältigt vielleicht 60 % der Trust-&-Safety-Fälle. Die schwierigen 40 % sind genau der Bereich, in dem LLMs glänzen — sie verstehen Kontext, Absicht und die Lücke zwischen wörtlichen Wörtern und Bedeutung.

Moderne Moderationspipelines kombinieren beides: Regeln für die einfachen 60 % (Regex, URL-Blocklisten, per Hash abgeglichene CSAM-Inhalte) und LLMs für die 40 %, die eine Beurteilung erfordern.

Textmoderation — Claude Haiku 4.5

Haiku ist günstig und schnell — ideal für Moderation mit hohem Volumen:

moderate_text.py
import json
from openai import OpenAI
client = OpenAI(api_key="sk-kn-...", base_url="https://api.kunavo.com/v1")

POLICY = """You are a content moderator. Judge the content against these
categories: toxic, spam, harassment, sexual, violence, self_harm, deception,
brand_unsafe. Be conservative — when in doubt, flag for human review."""

# Claude enforces a json_schema response_format; json_object it does not.
VERDICT = {
    "type": "object",
    "properties": {
        "verdict": {"type": "string", "enum": ["allow", "review", "block"]},
        "categories": {"type": "array", "items": {"type": "string", "enum": [
            "toxic", "spam", "harassment", "sexual", "violence",
            "self_harm", "deception", "brand_unsafe"]}},
        "confidence": {"type": "number"},  # 0.0-1.0
        "rationale": {"type": "string"},   # one sentence
    },
    "required": ["verdict", "categories", "confidence", "rationale"],
    "additionalProperties": False,
}
RESPONSE_FORMAT = {"type": "json_schema",
                   "json_schema": {"name": "verdict", "schema": VERDICT}}

def moderate_text(text: str) -> dict:
    resp = client.chat.completions.create(
        model="claude-haiku-4-5",  # cheap + fast for high-volume
        messages=[
            {"role": "system", "content": POLICY},
            {"role": "user", "content": text},
        ],
        response_format=RESPONSE_FORMAT,
        max_tokens=200,
    )
    return json.loads(resp.choices[0].message.content)

Kosten pro Aufruf: ca. 0,0001–0,0003 $, abhängig von der Eingabelänge. Bei 1M Moderationsereignissen pro Monat: ca. 100–300 $. Zum Vergleich: kommerzielle Moderations-APIs (Perspective ca. 0,0005 $/Aufruf, Hive ca. 0,002 $/Aufruf, Sightengine 0,003 $/Aufruf) — LLM-basierte Moderation ist vergleichbar günstig oder günstiger und bietet ein deutlich besseres Kontextverständnis.

Bildmoderation — Claude Haiku 4.5

Für Bilder ist Claude Haiku 4.5 das günstigste Vision-Modell im Katalog und schnell genug, um direkt in den Veröffentlichungsweg eingebunden zu werden:

moderate_image.py
def moderate_image(image_url: str) -> dict:
    resp = client.chat.completions.create(
        model="claude-haiku-4-5",  # vision + cheap
        messages=[
            {"role": "system", "content": POLICY},
            {"role": "user", "content": [
                {"type": "text", "text": "Moderate this image:"},
                {"type": "image_url", "image_url": {"url": image_url}},
            ]},
        ],
        response_format=RESPONSE_FORMAT,
        max_tokens=200,
    )
    return json.loads(resp.choices[0].message.content)

Kosten pro Bild: ca. 0,001–0,003 $. Kombinierte Text- und Bildmoderation für soziale Plattformen mit 100K Beiträgen pro Tag: ca. 3.000–9.000 $/Monat.

Das dreistufige Bewertungsmuster

  • allow: geringe Wahrscheinlichkeit eines Verstoßes → sofort veröffentlichen
  • review: mittlere Wahrscheinlichkeit → zur Prüfung durch Moderatoren in eine Warteschlange stellen. Die meisten LLM-Bewertungen landen hier, sind aber kostengünstig zu prüfen
  • block: hohe Wahrscheinlichkeit eines schweren Verstoßes (CSAM, glaubwürdige Drohungen, Doxxing) → ablehnen + protokollieren + eskalieren

Blockieren Sie nicht allein aufgrund eines LLM-Urteils automatisch, es sei denn, es handelt sich um eine Kategorie mit Nulltoleranz. Fehlalarme kosten Nutzer; lassen Sie Menschen über die Grauzone entscheiden.

Vergleich mit Alternativen

WerkzeugKosten / 1M AufrufeStärke
Perspective API (Google)Kostenlos (ratenbegrenzt)Bewertung englischer Toxizität
Hive Moderation~$2,000Bild, Video, Audio — stark
Sightengine~$3,000Spezialist für Bilder
OpenAI ModerationKostenlosNur Text, begrenzte Kategorien
Kunavo + Haikuca. 100–300 $ Text / ca. 1.000 $ BildKontextbezogen + mehrsprachig + benutzerdefinierte Richtlinie

Der Vorteil von LLMs liegt in der Anpassung der Richtlinie. Hive und Sightengine bieten feste Kategorien. Mit Claude schreiben Sie die Richtlinie auf Englisch (oder in einer beliebigen Sprache), und das Modell passt sich an. Eine neue eingeschränkte Kategorie hinzufügen? Aktualisieren Sie den Systemprompt. Kein erneutes Modelltraining.

Aspekte der Compliance

  • DSA (EU Digital Services Act): Plattformen müssen Transparenzberichte zur Moderation veröffentlichen. Das Feld rationale im obigen JSON ist das, was Sie protokollieren
  • CSAM: Niemals über ein LLM leiten. Verwenden Sie Hash-Abgleich (NCMEC, IWF) — LLMs sind für bekannte illegale Inhalte nicht das geeignete Werkzeug
  • Personenbezogene Daten in moderierten Inhalten: Hashen oder pseudonymisieren Sie sie vor dem Senden an ein LLM, wenn es um private DMs/Nachrichten geht — siehe den Compliance-Leitfaden

Erste Schritte: kostenlos registrieren, anschließend die Referenz unter /docs/chat lesen, um zu erfahren, was response_format für jede Modellfamilie erzwingt.

FAQ

How much does AI content moderation cost per call?

A text moderation call on Claude Haiku 4.5 costs about $0.0002, and an image-plus-text call on the same model about $0.001 — comparable to or cheaper than Hive or Sightengine.

Is an LLM better than a rule-based moderation system?

On clear-cut content both work. The difference shows on the hard 40% — sarcasm, dog whistles, brand-context misuse and multilingual nuance — where LLM moderation is substantially better than rules.

Should an AI moderation system auto-block content?

Only for zero-tolerance categories. The three-tier verdict pattern routes allow to publish, review to a human queue, and block to reject-and-log, which leaves the gray zone with humans.

How do I improve moderation accuracy over time?

Review the human-queue decisions weekly, identify mis-classifications, and update the system prompt. No model retraining is involved.