Volver a los casos de uso
Confianza y seguridad

Moderación de contenido con IA — confianza y seguridad multimodales con Claude

La moderación moderna no consiste solo en expresiones regulares: requiere matices como sarcasmo, alusiones indirectas, uso indebido del contexto de marca y combinaciones de imagen y texto. Los LLM lo hacen mucho mejor que los sistemas basados en reglas, a un precio que escala.

Última revisión: .

Por qué los LLM superan a la moderación basada en reglas

Sarcasmo. Mensajes en clave para un grupo específico. Uso indebido en el contexto de una marca ("Me encanta este producto, pero odio el servicio de atención al cliente"). Matices multilingües. Combinaciones de imagen y pie de foto en las que cada elemento pasa por separado, pero no juntos. La moderación basada en reglas gestiona quizá el 60 % de los casos de confianza y seguridad. El 40 % difícil es precisamente donde destacan los LLM: entienden el contexto, la intención y la diferencia entre las palabras literales y el significado.

Las canalizaciones modernas de moderación combinan ambas cosas: reglas para el 60 % sencillo (regex, listas de bloqueo de URL, CSAM identificado por hash) y un LLM para el 40 % que requiere criterio.

Moderación de texto — Claude Haiku 4.5

Haiku es barato y rápido, ideal para moderación de gran volumen:

moderate_text.py
import json
from openai import OpenAI
client = OpenAI(api_key="sk-kn-...", base_url="https://api.kunavo.com/v1")

POLICY = """You are a content moderator. Judge the content against these
categories: toxic, spam, harassment, sexual, violence, self_harm, deception,
brand_unsafe. Be conservative — when in doubt, flag for human review."""

# Claude enforces a json_schema response_format; json_object it does not.
VERDICT = {
    "type": "object",
    "properties": {
        "verdict": {"type": "string", "enum": ["allow", "review", "block"]},
        "categories": {"type": "array", "items": {"type": "string", "enum": [
            "toxic", "spam", "harassment", "sexual", "violence",
            "self_harm", "deception", "brand_unsafe"]}},
        "confidence": {"type": "number"},  # 0.0-1.0
        "rationale": {"type": "string"},   # one sentence
    },
    "required": ["verdict", "categories", "confidence", "rationale"],
    "additionalProperties": False,
}
RESPONSE_FORMAT = {"type": "json_schema",
                   "json_schema": {"name": "verdict", "schema": VERDICT}}

def moderate_text(text: str) -> dict:
    resp = client.chat.completions.create(
        model="claude-haiku-4-5",  # cheap + fast for high-volume
        messages=[
            {"role": "system", "content": POLICY},
            {"role": "user", "content": text},
        ],
        response_format=RESPONSE_FORMAT,
        max_tokens=200,
    )
    return json.loads(resp.choices[0].message.content)

Coste por llamada: ~0,0001-0,0003 $, según la longitud de la entrada. Con 1 M de eventos de moderación al mes: ~100-300 $. En comparación con las API comerciales de moderación (Perspective ~0,0005 $/llamada, Hive ~0,002 $/llamada, Sightengine 0,003 $/llamada), la moderación basada en LLM tiene un coste similar o inferior y una comprensión contextual mucho mejor.

Moderación de imágenes — Claude Haiku 4.5

Para imágenes, Claude Haiku 4.5 es el modelo de visión más barato del catálogo y lo bastante rápido para integrarse en el flujo de publicación:

moderate_image.py
def moderate_image(image_url: str) -> dict:
    resp = client.chat.completions.create(
        model="claude-haiku-4-5",  # vision + cheap
        messages=[
            {"role": "system", "content": POLICY},
            {"role": "user", "content": [
                {"type": "text", "text": "Moderate this image:"},
                {"type": "image_url", "image_url": {"url": image_url}},
            ]},
        ],
        response_format=RESPONSE_FORMAT,
        max_tokens=200,
    )
    return json.loads(resp.choices[0].message.content)

Coste por imagen: ~0,001-0,003 $. Moderación combinada de texto e imágenes para plataformas sociales con 100.000 publicaciones al día: ~3.000-9.000 $/mes.

El patrón de veredicto de tres niveles

  • allow: baja confianza de que exista una infracción → publicar inmediatamente
  • review: confianza media → poner en cola para un moderador humano. La mayoría de los veredictos de LLM están aquí, pero son baratos de revisar
  • block: alta confianza de una infracción grave (CSAM, amenazas creíbles, doxxing) → rechazar + registrar + escalar

No bloquees automáticamente basándote solo en el veredicto del LLM, salvo que se trate de una categoría de tolerancia cero. Los falsos positivos te hacen perder usuarios; deja que los humanos decidan en la zona gris.

Comparación con alternativas

HerramientaCoste / 1 M de llamadasFortaleza
Perspective API (Google)Gratis (con límite de frecuencia)Puntuación de toxicidad en inglés
Hive Moderation~$2,000Imagen, vídeo y audio — potente
Sightengine~$3,000Especialista en imágenes
OpenAI ModerationGratisSolo texto, categorías limitadas
Kunavo + Haiku~100-300 $ texto / ~1.000 $ imagenContextual + multilingüe + política personalizada

La ventaja del LLM es la personalización de políticas. Hive y Sightengine te ofrecen categorías fijas. Con Claude, escribes la política en inglés (o en cualquier idioma) y el modelo se adapta. ¿Añades una nueva categoría restringida? Actualiza el prompt del sistema. No hace falta volver a entrenar el modelo.

Aspectos de cumplimiento

  • DSA (Ley de Servicios Digitales de la UE): exige a las plataformas publicar informes de transparencia sobre moderación. El campo rationale del JSON anterior es lo que debes registrar
  • CSAM: nunca lo enrutes a través de un LLM. Usa coincidencia de hashes (NCMEC, IWF); los LLM no son la herramienta adecuada para contenido ilegal conocido
  • PII en contenido moderado: aplica hash o pseudonimiza antes de enviarlo al LLM si tratas con mensajes privados o DMs; consulta la guía de cumplimiento

Empieza: registro gratuito y después consulta la referencia /docs/chat para saber qué aplica response_format en cada familia de modelos.

Preguntas frecuentes

How much does AI content moderation cost per call?

A text moderation call on Claude Haiku 4.5 costs about $0.0002, and an image-plus-text call on the same model about $0.001 — comparable to or cheaper than Hive or Sightengine.

Is an LLM better than a rule-based moderation system?

On clear-cut content both work. The difference shows on the hard 40% — sarcasm, dog whistles, brand-context misuse and multilingual nuance — where LLM moderation is substantially better than rules.

Should an AI moderation system auto-block content?

Only for zero-tolerance categories. The three-tier verdict pattern routes allow to publish, review to a human queue, and block to reject-and-log, which leaves the gray zone with humans.

How do I improve moderation accuracy over time?

Review the human-queue decisions weekly, identify mis-classifications, and update the system prompt. No model retraining is involved.