Volver a las guías
Proveedores de API·18 de septiembre de 2026·Actualizado el 24 de septiembre de 2026·7 min de lectura

Mejor API para SillyTavern: elección del modelo, contexto y coste mensual

SillyTavern no cuesta nada; el endpoint del modelo es toda la factura. Compara los modelos por coste por turno y decide cuándo conviene una opción directa, una pasarela, una tarifa plana o una local.

Última revisión: .

SillyTavern no vende ninguna API ni suscripción, así que elegir la mejor API para SillyTavern es comprar un modelo y un proveedor —y la cifra decisiva es el coste de un turno con tu Context Size, no el precio destacado por millón de tokens. SillyTavern vuelve a enviar la tarjeta del personaje, el prompt del sistema y tanto historial como quepa en cada generación, por lo que la factura crece con la conversación aunque la tarifa nunca cambie.

La versión 1.19.0 se publicó el 14 de septiembre de 2026 bajo AGPL-3.0, y el último push del repositorio fue el 14 de septiembre de 2026 (comprobado el 18 de septiembre de 2026). Dos cosas que no son SillyTavern: TavernAI, el proyecto antecesor separado —la documentación fecha SillyTavern en «febrero de 2023 como fork de TavernAI 1.2.8»—, y SillyTavern-Extras, cuya descripción del repositorio comienza ahora con «[OBSOLETE]». Los tutoriales que indican instalar Extras están desactualizados.

Qué es gratis y qué no

Qué estás comprandoPrecioFuente
SillyTavern, todas las plataformas$0, AGPL-3.0, sin nivel de pago y sin servicio alojado vendido por el proyectoLa documentación afirma que «siempre será gratuita y de código abierto»
Algo donde ejecutarloNode.js 20 o posteriorpackage.json declara "engines": { "node": ">= 20" }
El modelo que escribe las respuestasEsta es toda la factura recurrenteLa documentación lo denomina «una interfaz de usuario instalada localmente que permite interactuar con LLM de generación de texto»
«Alojamiento de SillyTavern» de terceros o aplicaciones móviles de pagoEl producto de otra personasillytavern.app no publica ningún precio

Fuentes comprobadas el 18 de septiembre de 2026: el repositorio del proyecto y la FAQ oficial. La FAQ divide los backends entre modelos autoalojados, gratuitos de ejecutar, y servicios web de pago que, en sus palabras, «cuestan dinero usar».

Cómo genera su factura un chat de SillyTavern

La documentación de Context Size de SillyTavern define el ajuste como el número máximo de tokens que SillyTavern enviará a la API como prompt, menos la longitud de la respuesta, y afirma que el contexto «comprende información del personaje, prompts del sistema, historial del chat, etc.». Los mensajes por encima de la línea de puntos del chat simplemente no se envían, en lugar de resumirse. Por tanto, un turno cuesta aproximadamente context tokens × input rate + reply tokens × output rate, y una respuesta regenerada vuelve a pagar íntegramente la parte de input.

El contexto predeterminado de Chat Completion es de 4.095 tokens, establecido en los valores predeterminados incluidos (leídos el 18 de septiembre de 2026); el control deslizante lo aumenta en varios órdenes de magnitud, y aún más con el contexto desbloqueado. Por tanto, Context Size es el mayor control presupuestario de la aplicación: cuadruplicarlo multiplica aproximadamente por cuatro el cargo de input de cada mensaje posterior con la misma tarifa.

Selección de modelos y cuánto cuesta cada uno

USD por millón de tokens de input / output: tarifas actuales del catálogo de Kunavo junto al precio de lista publicado por el propio proveedor, todo comprobado el 18 de septiembre de 2026.

ModeloKunavo: input / outputLista del proveedor: input / outputUso recomendado
GPT-5.6 Terra$0,70 / $4,20$2,00 / $12,00Una voz que no es Claude, útil para obtener una segunda opinión sobre la misma tarjeta de personaje
Claude Haiku 4.5$0,70 / $3,50$1,00 / $5,00La fila de menor precio aquí: el Claude barato para sesiones largas en las que domina el input por turno
Claude Sonnet 5$1,40 / $7,00$2,00 / $10,00Equilibrio cotidiano entre calidad y coste por turno
Claude Opus 5$3,50 / $17,50$5,00 / $25,00Nivel superior de Claude; compara su fila antes de asumir que cuesta más
Claude Fable 5.1$7,00 / $35,00$10,00 / $50,00El más caro por turno de esta tabla, tanto al precio de catálogo como al de lista

Los precios de los proveedores proceden de la página de precios de Anthropic y de los precios para desarrolladores de OpenAI.

Una estimación mensual calculada

Supón 100 generaciones en un mes, un prompt que ha crecido hasta aproximadamente 16.000 tokens, respuestas de 300 tokens y ninguna repetición. Eso equivale a 1,6 millones de tokens de input y 30.000 tokens de output. Con las tarifas de catálogo anteriores:

ModeloTotal estimado para 100 turnos
GPT-5.6 Terra$1,25
Claude Haiku 4.5$1,22
Claude Sonnet 5$2,45
Claude Fable 5.1$12,25

Esto es aritmética de tokens basada en cifras supuestas, no una sesión medida ni un límite máximo de lo que se te cobrará. Cambia cualquier supuesto y cambia la respuesta: aumentar Context Size, repetir respuestas o ejecutar 500 turnos en lugar de 100 escala también la parte de input. Además, excluye los cargos de caché, de los que trata la siguiente sección.

La diferencia de caché que decide un chat largo

Esta es la parte invisible desde la interfaz. En la rama de lanzamiento 1.19.0 de su backend de chat-completions (leída el 18 de septiembre de 2026), cada marcador cache_control está detrás de una comprobación de fuente integrada: la fuente Claude, la fuente ElectronHub para IDs de modelo claude-, la fuente OpenRouter para IDs de modelo anthropic/claude, de nuevo la fuente OpenRouter para los IDs google/gemini que considera aptos para caché, y un indicador de NanoGPT. La rama Custom (OpenAI-compatible) no aparece en ninguna de esas comprobaciones y no establece ningún campo cache_control —lo que sí establece es logprobs, un response_format si configuraste un esquema JSON, tus Include Headers e Include Body Parameters, y reasoning_effort o verbosity donde los solicitaste. Tampoco hay una sección custom: en la configuración incluida, donde viven los interruptores de caché claude: y gemini:.

La consecuencia es específica del protocolo de Anthropic: la fuente Custom nunca establece un marcador cache_control, por lo que, en un modelo Claude, todo el historial vuelve a facturarse al precio completo de entrada en cada turno, salvo que el endpoint inserte los puntos de ruptura por sí mismo. Eso no significa que nada se almacene en caché en esta ruta. El almacenamiento en caché de prompts de OpenAI está habilitado de forma predeterminada para los modelos compatibles y no exige nada al cliente, por lo que una ruta GPT a través de la misma fuente Custom puede usar caché mientras que una ruta Claude no. El almacenamiento en caché lo deciden el modelo y el endpoint, no lo que envía SillyTavern. La traducción de OpenAI a Anthropic de Kunavo sí los inserta: en los bloques de herramientas y del sistema, además de un punto de ruptura móvil en el mensaje final cuando la conversación ya contiene un turno del asistente, que es la estructura de un chat de SillyTavern después del primer turno. Necesita 8.192 caracteres de prompt para activarse y nunca supera el límite de cuatro puntos de ruptura del proveedor. Un mensaje del sistema enviado después de la primera respuesta del modelo, como una Author's Note insertada en el chat a cierta profundidad, permanece en la conversación, y los puntos de ruptura se colocan en función de él: cuando el prompt termina con uno, el punto de ruptura móvil va en el bloque justo anterior a él, y los puntos de ruptura que quedan libres van delante de los últimos mensajes de ese tipo a los que todavía les sigue algo. Detalles en la documentación de caché, escrita para clientes que establecen los puntos de ruptura por sí mismos.

Qué valor tiene eso, como mejor caso y no como pronóstico: si 12.000 de esos 16.000 tokens del prompt se leyeran de la caché en cada turno con la tarifa de lectura de caché de Kunavo para Claude Sonnet 5 ($0,14 por millón), los mismos 100 turnos costarían aproximadamente $0,94 en lugar de $2,45. Considéralo el mayor ahorro disponible, no un límite máximo de lo que pagarás: supone un acierto de caché en cada turno y no cuenta las escrituras de caché, por lo que una factura real será superior. Anthropic fija la lectura de caché en 0,1× del input base (0,025× en Fable 5.1), pero la escritura en 1,25× durante una ventana de cinco minutos; un usuario de roleplay que tarde más que eso entre mensajes vuelve a pagar la escritura en lugar de la lectura. Anthropic también vende una escritura de una hora a 2×. Ninguna sesión real de SillyTavern se facturó a través de la pasarela para esta guía, así que comprueba primero el uso indicado en tu propio primer chat largo antes de presupuestar suponiendo aciertos de caché.

Cuándo gana la conexión directa, una pasarela, una suscripción o lo local

RutaCómpralo cuandoLa contrapartida
Proveedor directo (Anthropic, OpenAI, Google)Quieres un proveedor y la fuente integrada de SillyTavern para élLa fuente Claude integrada expone ajustes de caché para los que la fuente Custom no tiene ruta de código; una cuenta por proveedor
Pasarela multimodeloQuieres IDs de Claude y GPT detrás de una clave y un saldoSillyTavern le habla en chat OpenAI simple, por lo que los controles específicos del proveedor que expone permanecen en las fuentes integradas
Host de pesos abiertos con tarifa planaChateas a diario y quieres una cifra mensual predecibleComprueba qué limita el nivel: los planes de Arli AI están separados por la longitud máxima de contexto, el recurso exacto que consume un chat largo
Alojamiento gratuitoEstás probando la aplicación o tienes chats que toleran una colaPrioridad y límites de velocidad en lugar de una factura
Modelo localTienes el hardware y no quieres filtro de contenido ni claveTu máquina, tu mantenimiento, tu techo de calidad

Cifras concretas, comprobadas el 18 de septiembre de 2026. OpenRouter repercute los precios de los proveedores y cobra un 5,5 % (mínimo $0,80) en compras de crédito con tarjeta, con modelos gratuitos limitados a 50 solicitudes al día, o 1.000 después de comprar al menos $10 en créditos. NanoGPT vende pago por uso más una suscripción opcional de $12 al mes, con un depósito mínimo de $0,10 en criptomonedas o $1 con tarjeta. Arli AI ofrece un nivel gratuito más niveles mensuales de $10, $15, $20, $30 y $160, que difieren por longitud máxima de contexto (12K en el gratuito hasta 512K en el nivel superior), tamaño del modelo y solicitudes paralelas; Infermatic anuncia un plan gratuito más planes de $9, $16 y $20; Featherless anuncia Chat a $25 al mes y Developer a $50. AI Horde se describe como «Gratis · gestionado por la comunidad · de código abierto»; su FAQ explica que la posición en la cola depende de tu saldo total de kudos y que los usuarios anónimos comienzan en cero, por lo que los usuarios registrados quedan por encima. Google publica un nivel gratuito de Gemini, pero su página de límites de solicitudes no indica cifras del nivel gratuito por modelo y remite a AI Studio, así que considera no verificada cualquier cuota específica del nivel gratuito que leas en otro lugar.

Kunavo no tiene nivel gratuito ni crédito de registro: el mínimo es $10 en crédito prepago, sin suscripción y con un saldo que no caduca. Una estimación de catálogo tampoco es un límite máximo de precio; consulta facturación para saber cómo se liquida un cargo.

Las reglas de contenido van antes que el precio

La propia FAQ de SillyTavern afirma que los servicios web de pago «suelen estar censurados y se negarán a hablar contigo sobre ciertos temas». Es información de primera mano y la expectativa correcta que debes tener. La Usage Policy de Anthropic prohíbe el chat erótico y la generación sexualmente explícita, sin excepción para usuarios adultos, y una pasarela no modifica la política bajo la que se ofrece el modelo; la propia política de Kunavo establece que las políticas de los proveedores ascendentes se aplican a lo que envías. Nada de esta página debe interpretarse como una oferta de un endpoint sin filtros. Si necesitas roleplay adulto sin restricciones, la respuesta honesta es un modelo local o un host de pesos abiertos, y la selección de modelos anterior no es la sección adecuada.

Configúralo y después controla la factura

La ruta documentada es Chat Completion → Custom (OpenAI-compatible), rellenando Custom Endpoint (Base URL) y Custom API Key. No añadas /chat/completions; añade /v1 si la conexión falla. Cuatro cosas que conviene saber antes de tu primer chat largo:

  1. Los parámetros de muestreo se envían salvo que el ID del modelo esté en una lista de exclusión. El generador de solicitudes del frontend incluye temperature, top_p, frequency_penalty y presence_penalty en cada solicitud de Chat Completion. En la rama de lanzamiento 1.19.0 elimina después esos cuatro más top_k para cualquier ID de modelo que coincida con claude-fable, claude-opus-5 o claude-sonnet-5; esa regla se basa en el ID del modelo sin comprobar la fuente, por lo que también se activa en la fuente Custom. No cubre Claude Haiku 4.5, y la regla equivalente de GPT-5 junto a ella solo se ejecuta para las fuentes integradas OpenAI, Azure y OpenRouter, así que esos IDs siguen llevando campos de muestreo a través de un endpoint personalizado. El catálogo de Kunavo marca por separado temperature, top_p y top_k como no compatibles con los modelos Claude 5 indicados arriba y los elimina antes de la llamada ascendente; en un endpoint que no lo haga, déjalos en blanco mediante Exclude Body Parameters en el panel Additional Parameters, o un modelo que rechace esos campos responderá con un 400.
  2. Inicia Prompt Post-Processing en None. La API Messages de Anthropic combina por sí misma los turnos consecutivos del mismo rol y recibe el prompt del sistema como parámetro de nivel superior, por lo que es la pasarela de traducción la que decide dónde va cada mensaje del sistema. Kunavo coloca en ese parámetro los que se envían antes de la primera respuesta del modelo y deja uno enviado después, como una Author's Note o una entrada de World Info insertada en el chat a cierta profundidad, en el turno en que se envió. La documentación de SillyTavern define None como «ningún procesamiento explícito aplicado salvo que la API lo requiera estrictamente», Semi-strict como la combinación de roles y la posibilidad de un único mensaje de sistema opcional, y Strict como la exigencia adicional de que haya primero un mensaje de usuario; por tanto, si ves un 400 sobre roles de mensajes, sube a Semi-strict. Ten en cuenta que Merge, Semi-strict y Strict también eliminan las llamadas a herramientas salvo que elijas la variante «with tools».
  3. El contador de tokens es una estimación. La documentación del tokenizador de SillyTavern afirma que los recuentos se «estiman según el tipo de tokenizador seleccionado» cuando el backend no proporciona uno, y sus reglas Best-match nombran proveedores específicos, no un endpoint personalizado arbitrario. Anthropic declara que los modelos Claude 4.7 y posteriores utilizan un tokenizador más nuevo que produce «aproximadamente un 30 % más de tokens para el mismo texto», por lo que un recuento producido por un tokenizador antiguo resulta inferior al que facturan esos modelos.
  4. El panel Reverse Proxy es una función diferente. Su bloque de advertencia en la interfaz incluida se limita a las fuentes integradas (data-source="openai,claude,mistralai,…") y dice «ANY support requests will be REFUSED if you are using a proxy.» La página de documentación con ese nombre trata de poner el propio SillyTavern detrás de Traefik, NGINX o Caddy, que vuelve a ser otro tema. La fuente Custom es la vía compatible y no es ese panel.

Kunavo publica una guía de configuración de SillyTavern con los valores exactos de los campos: una configuración escrita, no una prueba de compatibilidad en tiempo de ejecución realizada en tu nombre. Si las tarifas anteriores encajan con tus chats, crea una cuenta y comienza con el mínimo de $10 en lugar de una suscripción.

Preguntas frecuentes

¿Cuánto cuesta SillyTavern?

SillyTavern no cuesta nada. Es software AGPL-3.0 que instalas y ejecutas localmente; la versión 1.19.0 se publicó el 14 de septiembre de 2026, y la documentación del proyecto dice que «will always be free and open-sourced». Lo que cuesta dinero es la API del modelo a la que se conecta, facturada por token por el proveedor que elijas, o el hardware y la electricidad si ejecutas un modelo localmente. Una página que anuncie un precio para SillyTavern vende alojamiento o una suscripción de API, no la aplicación.

¿Cuál es la API más barata para SillyTavern?

Entre las rutas que no generan ninguna factura se incluyen la inferencia local (KoboldCpp, llama.cpp, Ollama, Oobabooga) y AI Horde, un servicio gestionado por voluntarios al que SillyTavern puede acceder desde el principio, donde el coste se intercambia por prioridad en la cola; algunos proveedores también publican su propio nivel gratuito. Entre los endpoints de pago, la tarifa más barata publicada y el chat terminado más barato son afirmaciones distintas: SillyTavern vuelve a enviar el prompt completo en cada generación, por lo que una tarifa baja por token en un modelo que necesita varias regeneraciones puede costar más que un modelo más caro que acierta la respuesta al primer intento. Compara el coste por turno con tu Context Size real, no con la tarifa destacada.

¿Cuál es el mejor modelo para SillyTavern?

Esta página no clasifica ningún modelo por calidad de prosa, porque no midió ninguna; elige según la restricción que realmente puedas valorar, que es el coste por turno. Para el menor coste por turno en chats largos, considera un nivel barato como Claude Haiku 4.5. Para un equilibrio cotidiano, Claude Sonnet 5 o Claude Opus 5. Claude Fable 5.1 es el más caro por turno de los modelos comparados en esta página, así que solo merece la pena si puedes notar la diferencia en tus propios chats. Las notas de versión de SillyTavern 1.19.0 registran compatibilidad añadida del backend con Claude Fable 5 y 5.1, Claude Opus 4.8 y 5, Claude Sonnet 5 y los modelos GPT-5.6, por lo que sus fuentes integradas de Anthropic y OpenAI ya conocen esos ID.

¿Funciona SillyTavern con una API personalizada compatible con OpenAI?

Sí, y es una vía documentada de primera clase, no una solución improvisada. Configura API como Chat Completion, establece Chat Completion Source en Custom (OpenAI-compatible) y completa Custom Endpoint (Base URL) y Custom API Key. La documentación de SillyTavern indica que no debes añadir el sufijo /chat/completions a la URL base y que debes probar añadiendo /v1 si la conexión falla. Si el endpoint implementa GET /v1/models, el menú desplegable Available Models se completa automáticamente; de lo contrario, escribes manualmente el ID del modelo.

¿Por qué aumenta la factura de SillyTavern a medida que se alarga un chat?

Porque aumenta el prompt. SillyTavern envía la tarjeta del personaje, el prompt del sistema y tanto historial del chat como quepa en Context Size en cada generación, por lo que el turno 200 factura mucho más input que el turno 2 con la misma tarifa por token. El almacenamiento en caché del prompt es el factor que cambia esto, pero en la rama de lanzamiento 1.19.0 cada cache_control que envía SillyTavern está condicionado a una fuente integrada: su propia fuente Claude, su fuente ElectronHub para IDs de modelo claude-*, su fuente OpenRouter para IDs de modelo anthropic/claude y para los google/gemini que admiten caché, además de un indicador específico de NanoGPT. La fuente Custom (OpenAI-compatible) no está entre ellas, así que, en un endpoint personalizado, el almacenamiento en caché debe proceder del propio endpoint.

¿Puedo usar una API de pago para roleplay sin censura?

No con los proveedores principales. La propia FAQ de SillyTavern advierte que los servicios web de pago suelen estar censurados y rechazan ciertos temas, y la Usage Policy de Anthropic prohíbe por completo el chat erótico y la generación sexualmente explícita. Enrutar la misma solicitud mediante una pasarela no cambia la política bajo la que se ofrece el modelo, y la política de uso aceptable de Kunavo establece que se aplican las políticas de los proveedores ascendentes al contenido enviado a través de ella. Si el requisito es contenido adulto sin restricciones, esa decisión corresponde a los modelos locales o a los hosts de pesos abiertos, no a un endpoint de Claude, GPT o Gemini.

Estado de lanzamiento, documentación, código incluido y precios de competidores de SillyTavern comprobados el 18 de septiembre de 2026. Las tarifas de Kunavo se leen del catálogo activo; todos los totales aquí son aritmética de tokens basada en los supuestos indicados, no sesiones medidas.