El software de AnythingLLM es gratuito — la aplicación Desktop se descarga por $0 y la edición Docker autohospedada es gratuita bajo la licencia MIT del repositorio del proyecto — por lo que «precios de AnythingLLM» en la práctica significa dos facturas que nadie publica: una suscripción opcional de alojamiento o licencia, y los tokens de la API del modelo que aportas tú mismo. La única lista oficial de precios, anythingllm.com/cloud, establece el precio del alojamiento y lo indica en una de sus propias viñetas: «Just bring an LLM API Key». Ten en cuenta que anythingllm.com/pricing no es una página real: redirige a esa misma página de nube.
Esta guía separa las tres capas: lo que cobra AnythingLLM, lo que incrementa la factura de tokens y qué ruta de proveedor gana para cada tipo de carga de trabajo. Cada cifra tiene una fuente y una fecha, y la aritmética está etiquetada como tal.
¿Ya tiene un espacio de trabajo? Vaya directamente a la configuración del proveedor de chat y la comprobación de la primera factura. Mantenga separado su proveedor de embeddings; Kunavo actualmente no ofrece ningún modelo de embeddings.
Dos cosas diferentes reciben el nombre de «API de AnythingLLM»
Aclara esto antes de comparar precios, porque no tienen nada que ver entre sí.
En la documentación propia de AnythingLLM, la API es la API local de desarrollador y administración que tu instancia sirve en /api/docs —crear espacios de trabajo, cargar documentos y chatear con un espacio de trabajo—, autenticada mediante una clave que generas dentro de tu propia instancia. No tiene precio, porque es tu servidor hablando consigo mismo.
La API a la que casi siempre se refiere un comprador que busca «la mejor API para AnythingLLM» es el endpoint del modelo ascendente que se introduce en el campo URL base del proveedor de chat. Esa sí tiene un precio por token y es la única parte de una implementación de AnythingLLM que escala con el uso. Todo lo que sigue trata sobre la segunda.
Lo que cobra AnythingLLM
| Producto | Precio publicado | Qué obtienes y qué excluye |
|---|---|---|
| Escritorio (macOS / Windows / Linux) | $0 | Descarga gratuita. Incluye un motor LLM local integrado y un embedder local integrado |
| Docker autohospedado | $0, MIT | «Autohospédate con Docker gratis». Pagas la máquina y cualquier API de modelo a la que la dirijas |
| Desktop Pro — anual | 15 $/mes, facturados anualmente (180 $/año) | Uso diario ilimitado de tres funciones Magic para todo el sistema, además de documentos sin marca de agua. Cero tokens de modelo |
| Desktop Pro — mensual | $20/mes | Las mismas funciones, prueba gratuita de 14 días y sin compromiso anual |
| Cloud — Basic | $50/mes | Instancia privada, subdominio personalizado y «Solo trae una clave de API de LLM». Solo alojamiento |
| Cloud — Pro | 99 $/mes | Recursos prioritarios y un SLA de soporte de 72 horas. Sigue siendo solo alojamiento |
| Cloud — Enterprise | Contáctanos | Implementación local, SSO y RBAC. No hay precio publicado |
| Móvil (Android) | No publicado | La documentación móvil no contiene ninguna declaración de precios; esta página no comprobó la ficha de la tienda |
| Community Hub | Sin precio publicado | Los elementos públicos no necesitan una clave de Connection; solo la necesitan los privados. Sigue en fase beta |
Los precios de Cloud se consultaron en anythingllm.com/cloud el 19 de septiembre de 2026. Las cifras de Desktop Pro requieren una salvedad: proceden de la captura de pantalla del checkout que AnythingLLM inserta en su propia documentación, porque el checkout activo de Mintplex Labs está detrás de un desafío contra bots que no se pudo superar. La imagen incluye su propia salvedad: el precio «no refleja promociones, pruebas gratuitas elegibles ni cupones aplicados en el checkout». Considera 15/20/180 $ como la cifra publicada por AnythingLLM y confirma el importe en el checkout antes de comprar.
Hay dos trampas en torno a la palabra «Pro». Cloud Pro, con un precio de 99 $, no es Desktop Pro. Son productos independientes, y varios resúmenes de terceros citan el precio del alojamiento como si fuera la licencia de escritorio. Además, Desktop Pro es más limitado de lo que su nombre sugiere: la descripción general de Pro de AnythingLLM afirma que «AnythingLLM Desktop será y seguirá siendo gratuito para usar el 99 % de nuestras funciones» y que Pro «simplemente elimina esos límites diarios» de las funciones Magic. No bloquea el chat, RAG, los agentes ni el acceso a modelos. La asignación diaria gratuita de cada función Magic se describe únicamente como «generosa» —no se publica ninguna cifra, por lo que no se cita aquí—. Por separado, Magic Tab y Magic Beacon solo están disponibles para macOS y Windows; la página de Beacon indica que Linux «no es compatible actualmente».
Una aclaración más: editores no relacionados revenden imágenes de VM de AnythingLLM en los marketplaces de Microsoft y AWS con sus propias tarifas por hora. Esas ofertas no las publica Mintplex Labs y sus precios no son precios de AnythingLLM. Esta página no consultó sus cifras —las páginas de los marketplaces devolvieron 403—, por lo que no aparece ninguna aquí.
Lo que ninguno de esos precios incluye
Ningún plan de AnythingLLM incluye tokens de modelo, y los planes Cloud lo explicitan. La página de limitaciones de Cloud afirma que «la nube alojada de AnythingLLM no incluye un LLM integrado que puedas usar como en nuestra instancia de escritorio», por lo que un suscriptor de Cloud debe aportar un endpoint externo, lo que convierte los 50 o 99 $ en un mínimo, no en un total. La misma página advierte que el embedder integrado «no te impedirá intentar incrustar un PDF de 5.000 páginas, pero hará que tu instancia se bloquee», y que los agentes personalizados no son compatibles con Cloud alojado.
Desktop Pro cuenta la misma historia en miniatura. Su documentación de Magic Tab dice que la generación de sugerencias se «realiza en el dispositivo mediante el proveedor y el modelo de LLM configurados», así que una suscripción Pro no compra inferencia: compra la eliminación de un límite diario en funciones que después consumen tu propio presupuesto de tokens.
La ruta auténtica de cero tokens existe y es exclusiva de Desktop: el proveedor integrado ejecuta un modelo local mediante el motor de Ollama con licencia MIT, marcado como «¡SOLO ESCRITORIO!» en la documentación. Si un modelo local responde suficientemente bien sobre tus documentos, esa mitad de la factura es de 0 $ para siempre.
De dónde procede realmente la factura de tokens
Una factura de AnythingLLM tiene dos mitades independientes, facturadas por dos proveedores distintos que configuras por separado.
La ingesta es única: cada documento se divide en fragmentos y se incrusta una vez. El chat es recurrente: cada turno vuelve a enviar un mensaje del sistema, el historial reproducido, los fragmentos recuperados y la pregunta. La mitad recurrente es la importante, y los valores predeterminados incluidos son los que determinan su tamaño.
| Valor predeterminado incluido | Valor | Qué multiplica |
|---|---|---|
| Tamaño del fragmento de texto | 1.000 caracteres (~250 tokens) | El tamaño de cada fragmento recuperado de esos documentos, hasta que se eliminan y se vuelven a incrustar |
| Solapamiento de fragmentos | 20 caracteres | Cuánto texto duplicado llega al índice |
Fragmentos recuperados (topN) | 4 | Contexto de fundamentación por turno |
| Historial de chat | 20 mensajes | Entrada reproducida por turno —normalmente el término más grande |
| Umbral de similitud | 0.25 | Cuántos fragmentos superan el umbral |
El tamaño y el solapamiento de los fragmentos proceden de la documentación sobre división de texto, que también proporciona la conversión de ~4 caracteres por token utilizada arriba, nombra a LangChain RecursiveCharacterTextSplitter como la única estrategia y advierte que los cambios solo se aplican a los documentos incrustados posteriormente. Los otros tres valores se leen del esquema de Prisma incluido (topN 4, openAiHistory 20, similarityThreshold 0.25), que es la fuente de autoridad. Hay un conflicto que debes conocer: la página de RAG de AnythingLLM dice «4-6 fragmentos de texto», pero esa página se identifica a sí misma como documentación heredada sustituida en v1.8.5. El valor predeterminado del esquema es 4 y el usuario puede ajustarlo.
El error costoso aquí no es una configuración. Adjuntar un documento no equivale a incrustarlo. La introducción al chat con documentos de AnythingLLM dice que, de forma predeterminada, «insertará el texto completo de tus documentos en la ventana de chat», y que si superas la ventana de contexto al añadir documentos te preguntará si quieres dividirlos en fragmentos; es decir, incrustarlos. Hasta que aceptes esa opción, la ruta de adjuntos vuelve a enviar el documento completo en cada turno en lugar de cuatro fragmentos, y la diferencia de coste es de un orden de magnitud, como se cuantifica más abajo.
La mitad de incrustación y la parte que Kunavo no ofrece
Hay que ser claros al respecto: Kunavo no tiene habilitado ningún modelo de incrustación. kunavo.com/llms.txt indica que el formato de transferencia /v1/embeddings está implementado, pero que actualmente no aparece ningún modelo de incrustación, y pide a los agentes que no recomienden Kunavo para incrustaciones; lo mismo ocurre con la conversión de voz a texto y de texto a voz (comprobado el 19 de septiembre de 2026). Como el embedder de AnythingLLM es un proveedor independiente del modelo de chat, se configura para todo el sistema y no por espacio de trabajo, por lo que la compatibilidad con el chat nunca implica compatibilidad con incrustaciones. Ejecuta la mitad de la ingesta localmente o mediante un proveedor de incrustaciones dedicado.
La opción más barata para esa mitad también es la predeterminada. El embedder integrado de AnythingLLM es all-MiniLM-L6-v2, un modelo de CPU de 25 MB que necesita aproximadamente 2 GB de RAM y está entrenado principalmente en inglés. No cuesta nada por documento. Si necesitas un embedder alojado, AnythingLLM publica su propio valor de referencia de coste en páginas por dólar.
| Opción de incrustación | ~Páginas por dólar | Entrada máxima |
|---|---|---|
| Local integrado (all-MiniLM-L6-v2) | Sin cargo por página | Se ejecuta en tu propia CPU |
| text-embedding-3-small | 62,500 | 8,191 |
| text-embedding-ada-002 | 12,500 | 8,191 |
| text-embedding-3-large | 9,615 | 8,191 |
Kunavo no ofrece este paso ni publica un precio para él; cada tarifa de esa tabla se factura directamente a OpenAI, en la propia cuenta de OpenAI. Las cifras de páginas por dólar son propias de AnythingLLM y proceden de su página del embedder de OpenAI (comprobada el 19 de septiembre de 2026); la misma página indica que la aplicación muestra una estimación del precio antes de ejecutarse. Coinciden con las tarifas publicadas por OpenAI de 0,02 $, 0,10 $ y 0,13 $ por millón de tokens, respectivamente. En la fila superior, una ingesta de 500 páginas cuesta aproximadamente 0,008 $, que es el punto clave: la fase de ingesta casi nunca concentra el coste de una factura de AnythingLLM.
La única excepción es la reindexación. La descripción general del embedder advierte que, una vez que empiezas a incrustar, «es mejor no cambiarlo», porque cambiarlo implica eliminar y volver a incrustar todos los documentos. Presupuesta una reindexación como una repetición del coste de ingesta y recuerda que un embedder local hace que esa repetición sea gratuita.
La mitad del chat: un proveedor y dos valores predeterminados costosos
Un endpoint compatible con OpenAI para el que AnythingLLM no incluye ninguna integración con nombre se configura mediante el proveedor denominado literalmente Generic OpenAI. Su página de configuración advierte que es «un proveedor de llm orientado a desarrolladores; no deberías usarlo a menos que sepas lo que haces», y lo describe como la forma de acceder a «cualquier proveedor de LLM con el que no nos integremos explícitamente». Consulta primero la lista de proveedores: varios servicios con formato de OpenAI tienen proveedores con nombre propio y sus propios campos de URL base en el .env.example incluido —entre ellos LM Studio, LocalAI, LiteLLM, KoboldCpp y Text Generation WebUI— y conservan sus propios valores predeterminados en lugar de los genéricos que aparecen a continuación.
| Campo de la interfaz | Clave de entorno | Por qué importa para el coste |
|---|---|---|
| URL base | GENERIC_OPEN_AI_BASE_PATH | Se pasa literalmente al SDK de OpenAI, por lo que se requiere el sufijo /v1, aunque el marcador de posición lo omita |
| Clave API | GENERIC_OPEN_AI_API_KEY | Tu clave de gateway o proveedor |
| Selected Model | GENERIC_OPEN_AI_MODEL_PREF | Sin validación previa: la comprobación siempre devuelve true, por lo que un error tipográfico falla al realizar la llamada |
| Ventana de contexto del modelo | GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT | Se presupone 4096 cuando está vacío. Después, el historial y los presupuestos del sistema y del usuario se calculan contra una ventana ficticia |
| Max Tokens | GENERIC_OPEN_AI_MAX_TOKENS | El valor predeterminado es 1024, lo que trunca las respuestas largas hasta que se aumente |
Los nombres de los campos y los valores predeterminados se obtuvieron de server/.env.example incluido en AnythingLLM y del código fuente del proveedor Generic OpenAI en master, el 19 de septiembre de 2026; la clave MAX_TOKENS solo aparece en el código fuente, no en .env.example. Hay dos elementos adicionales: GENERIC_OPEN_AI_CUSTOM_HEADERS, documentado en .env.example para gateways que necesitan encabezados adicionales, y GENERIC_OPENAI_STREAMING_DISABLED en el código fuente del proveedor, que fuerza respuestas sin streaming.
# CHAT ONLY. Key names from AnythingLLM's server/.env.example, except
# GENERIC_OPEN_AI_MAX_TOKENS, which appears only in the provider source.
LLM_PROVIDER='generic-openai'
# The value is handed straight to the OpenAI SDK as baseURL, so /v1 is required.
# The UI placeholder ("eg: https://proxy.openai.com") omits it. Include it anyway.
GENERIC_OPEN_AI_BASE_PATH='https://api.kunavo.com/v1'
GENERIC_OPEN_AI_API_KEY='sk-kn-...'
# Any string is accepted here: the provider's pre-flight check always returns
# true, so a typo fails at call time rather than at save time.
GENERIC_OPEN_AI_MODEL_PREF='claude-sonnet-4-6'
# Leave this empty and AnythingLLM assumes 4096 — not your model's real window —
# then budgets history and context against that made-up number.
GENERIC_OPEN_AI_MODEL_TOKEN_LIMIT=1000000
# Defaults to 1024, which truncates long answers until you raise it.
GENERIC_OPEN_AI_MAX_TOKENS=8192Hay un límite que conviene tener en cuenta, expresado de forma estricta. El proveedor nativo de Anthropic de AnythingLLM construye su cliente SDK únicamente con una clave de API y encabezados predeterminados: no pasa ninguna URL base, y AnythingLLM no expone ningún campo Base URL ni documenta ninguna anulación para ese proveedor. Eso es todo lo que ofrece la propia superficie de AnythingLLM; no significa que el tráfico no pueda redirigirse, porque el SDK de Anthropic para TypeScript que construye establece de forma predeterminada su baseURL en process.env.ANTHROPIC_BASE_URL, por lo que esa variable del proceso del servidor sí llega hasta él. AnythingLLM no documenta ni admite esto, así que considéralo indocumentado y no una ruta: la forma compatible de acceder a un endpoint de terceros es Generic OpenAI mediante chat completions.
La consecuencia para la caché es igual de concreta. ANTHROPIC_CACHE_CONTROL es el interruptor que hace que el proveedor nativo añada un marcador cache_control al mensaje del sistema, y nada en la ruta Generic OpenAI envía ese marcador; por tanto, una ruta cuyo protocolo exige que el cliente solicite el almacenamiento en caché no obtiene aciertos de caché a través de ella. Esto no dice nada sobre los endpoints que almacenan en caché automáticamente sin un marcador del cliente; si el tuyo lo hace es una cuestión para la documentación de tu proveedor. El almacenamiento en caché de prompts explica cuánto vale ese control cuando una ruta lo admite.
Hay otros dos límites que conviene conocer antes de hacer el presupuesto. La compatibilidad con visión y archivos adjuntos en este proveedor funciona según disponibilidad: el código fuente indica en un comentario que presupone una matriz de contenido con formato auténticamente OpenAI y que no se actualizará para proveedores que difieran. Además, la generación de imágenes no tiene una opción de URL base genérica: la página de generación de imágenes documenta cuatro proveedores con nombre —OpenAI, OpenRouter, Ollama y Lemonade— y ninguna fila para endpoints personalizados, por lo que /img solo llega a un gateway cuando ese gateway es una de las integraciones con nombre, como OpenRouter, y no al dirigir hacia él la Base URL de Generic OpenAI.
Una estimación práctica del coste de la API de AnythingLLM
Esto es aritmética de tokens basada en tarifas publicadas, no el coste medido de una tarea ni un límite máximo de facturación. Supón los valores predeterminados incluidos arriba y un turno compuesto por: un mensaje del sistema de 200 tokens, 4 fragmentos recuperados de 250 tokens cada uno, 20 mensajes de historial reproducidos con un promedio de 120 tokens y una pregunta de 40 tokens —3,640 tokens de entrada—, que devuelve 400 tokens de salida. El mensaje del sistema, la longitud del historial y la longitud de la respuesta son supuestos; el número de fragmentos, el tamaño de los fragmentos y el número de mensajes del historial son valores predeterminados propios de AnythingLLM. La última columna mantiene todo igual, pero adjunta un documento de 30,000 tokens en lugar de recuperar fragmentos, por lo que el texto completo se transporta en cada turno. Las tarifas son precios actuales del catálogo de Kunavo por millón de tokens.
| Modelo | Entrada/salida por 1M | Por turno | 1,000 turnos | 1,000 turnos, documento adjunto |
|---|---|---|---|---|
| Claude Haiku 4.5 | $0.70 / $3.50 | $0.0039 | $3.95 | $24.25 |
| GPT-5.6 Terra | $0.70 / $4.20 | $0.0042 | $4.23 | $24.53 |
| Claude Sonnet 4.6 | $2.10 / $10.50 | $0.0118 | $11.84 | $72.74 |
| Claude Opus 5 | $3.50 / $17.50 | $0.0197 | $19.74 | $121.24 |
Tres lecturas. Primero, con estos supuestos, un mes de preguntas y respuestas fundamentadas en modelos Claude Sonnet 4.6 asciende a $11.84, menos que un solo mes de Cloud Basic a 50 $. Para una carga de trabajo de este tamaño, la decisión sobre el alojamiento, no la decisión sobre el proveedor, representa la partida mayor; por eso hay que dimensionar las dos facturas por separado en lugar de intercambiarlas. Segundo, adjuntar el documento en lugar de indexarlo lleva la misma carga de trabajo en Claude Sonnet 4.6 a $72.74: con estos supuestos, el diseño de recuperación mueve más dinero que la elección del proveedor. Tercero, la diferencia entre modelos es real, pero secundaria: modelos Claude Haiku 4.5 a $3.95 frente a Claude Opus 5 a $19.74 para los mismos turnos.
Escala estas cifras según tus propios turnos diarios antes de tratarlas como un presupuesto y añade el coste de ingesta solo cuando vuelvas a indexar. El importe del catálogo de Kunavo es un mínimo de facturación, no un límite: cuando el upstream comunica su cargo, la factura es el mayor valor entre el coste del catálogo y el coste del upstream multiplicado por el margen aplicable. Los cargos de caché y las herramientas externas quedan fuera de este ejemplo. La recarga mínima de Kunavo es de $10 en crédito prepago, lo que constituye un mínimo de financiación, no una tarifa por tarea ni una suscripción; consulta los detalles de facturación.
La mejor API y el mejor modelo para AnythingLLM: qué ruta gana y cuándo
| Ruta | Cuándo gana | A qué renuncias |
|---|---|---|
| Modelo local integrado (solo Desktop) | Cargas de trabajo privadas o pequeñas, sin ningún cargo por solicitud | Solo Desktop; no es un reemplazo completo de Ollama y presenta una brecha de capacidades frente a los modelos frontier alojados |
| API directa del proveedor | El modelo insignia de un proveedor durante todo el día, con sus propios descuentos por caché y procesamiento por lotes | Un segundo proveedor implica una segunda cuenta y un segundo saldo |
| Puerta de enlace compatible con OpenAI | Cambias de modelo por espacio de trabajo y quieres una sola clave y un solo saldo | Entras como Generic OpenAI, por lo que la ventana de contexto y los campos de max-tokens los configuras tú, y el proveedor nativo de Anthropic de AnythingLLM —con su interruptor cache_control— no es la ruta que estás utilizando |
| Suscripción Cloud más tu propia clave | Quieres que la instancia sea administrada y no quieres ejecutar Docker | 50 o 99 $ al mes además de la factura de tokens, sin LLM integrado y sin agentes personalizados en Cloud alojado |
| Licencia de Desktop Pro | Utilizas las funciones Magic para todo el sistema después de superar su asignación diaria gratuita | 15–20 $ al mes sin incluir tokens; Magic Tab y Beacon solo están disponibles para macOS y Windows |
Sobre el «mejor modelo», AnythingLLM ofrece la respuesta honesta como una función. El Model Router —autohospedado para un solo usuario y para varios usuarios, y disponible en Desktop desde v1.13.0— dirige los mensajes sencillos a un modelo barato o local y solo los difíciles a uno remoto costoso, con «Ahorrar dinero» como propósito declarado. Para preguntas y respuestas fundamentadas, un modelo de gama media suele ser suficiente, porque los fragmentos recuperados aportan los datos; reserva un modelo de vanguardia para la síntesis y las ejecuciones de agentes. Los agentes añaden su propia presión sobre los tokens, algo que AnythingLLM aborda con Intelligent Tool Selection: activada de forma predeterminada en v1.15.0, envía a la ventana de contexto solo las herramientas que necesita un chat en lugar de todas las herramientas registradas, lo que, según su documentación, equivale a «ahorrar hasta un 80 % en cada chat». Esa es una cifra propia de AnythingLLM, referida a los tokens que de otro modo añadirían las definiciones de herramientas y no a una factura completa, y no se ha medido de forma independiente. Un logro reciente más pequeño: v1.16.1 señala que cancelar la inferencia ahora realmente la detiene en el proveedor, por lo que una respuesta abandonada ya no se sigue facturando hasta completarse.
Para una comparación más amplia de proveedores, consulta Alternativas a OpenRouter y el mejor gateway de LLM; para el diseño de recuperación que impulsa la mayor parte de la factura anterior, Implementación de RAG y Optimización de costes de IA. Si todavía estás eligiendo el propio cliente, AnythingLLM frente a Open WebUI compara ambos en cuanto al alojamiento y la estructura de facturación.
Guarde la lista de comprobación para la migración del gateway antes de cambiar su configuración operativa.
Configurarlo y comprobar la primera factura
Kunavo se configura aquí como un endpoint Generic OpenAI mediante los ajustes anteriores; la página de API compatible con OpenAI cubre la estructura de la solicitud, y el índice de integraciones enumera los clientes que ya tienen una página de configuración escrita. AnythingLLM no se ha probado en tiempo de ejecución contra el endpoint de Kunavo para esta guía, así que considera la configuración anterior un punto de partida documentado, no un resultado de compatibilidad: mantén disponible una ruta funcional, establece los campos de ventana de contexto y max-tokens antes de tu primera conversación real, ejecuta un espacio de trabajo acotado y después lee el cargo que realmente haya registrado tu cuenta. Crea una cuenta de Kunavo cuando estés listo para financiar una clave, y mantén el embedder en el modelo local gratuito, porque Kunavo no vende esa mitad.
Preguntas frecuentes
¿Cuánto cuesta AnythingLLM?
El software es gratuito. AnythingLLM Desktop para macOS, Windows y Linux se descarga por $0, y la edición Docker autohospedada es gratuita y tiene licencia MIT — la propia página de nube de anythingllm.com ofrece «Self-host with Docker for free» (comprobado el 19 de septiembre de 2026). El dinero aparece en tres lugares opcionales: el alojamiento de AnythingLLM Cloud a $50 o $99 al mes, una licencia de AnythingLLM Desktop Pro mostrada a $15 al mes con facturación anual o $20 al mes en la documentación de compra de AnythingLLM, y la factura de la API del modelo del proveedor que configures. Ninguna de las suscripciones incluye tokens de ningún modelo.
¿AnythingLLM Pro cuesta $99 al mes?
Solo si te refieres a Cloud Pro. Dos productos distintos se llaman Pro. AnythingLLM Cloud Pro cuesta $99 al mes y es alojamiento para equipos — una instancia privada, recursos prioritarios y lo que la página denomina un SLA de soporte de 72 horas. AnythingLLM Desktop Pro es una clave de licencia vendida mediante el proceso de compra de Mintplex Labs, mostrada a $15 al mes con facturación anual ($180 al año) o $20 al mes con facturación mensual y una prueba de 14 días, y desbloquea únicamente el uso diario ilimitado de tres funciones Magic para todo el sistema operativo, además de documentos generados sin marca de agua. Citar $99 como precio de escritorio es el error más común en los artículos de terceros.
¿Cuál es la mejor API para AnythingLLM?
Primero hay que separar dos cosas que comparten el nombre. La API de AnythingLLM en su propia documentación es la API local de desarrollo y gestión que sirve tu propia instancia en /api/docs, autenticada mediante una clave que generas dentro de la instancia — no tiene precio. La API a la que se refiere la gente al buscar esto es el endpoint del modelo ascendente que se introduce en el campo Base URL del proveedor Generic OpenAI. Para eso, una API directa del proveedor gana cuando usas un proveedor todo el día y quieres sus propios descuentos de caché y procesamiento por lotes; un gateway compatible con OpenAI como Kunavo gana cuando cambias de modelo por espacio de trabajo y quieres una clave y un saldo; un modelo local mediante el motor integrado de la versión Desktop gana cuando no quieres ningún cargo por solicitud. Elige según tu forma de trabajar, no según un ganador único.
¿Cuál es la API más barata para AnythingLLM?
Para la parte de indexación, la opción más barata es gratuita y viene incluida: el embedder integrado de AnythingLLM es all-MiniLM-L6-v2, un modelo de 25MB que se descarga en el primer embedding y se ejecuta en la CPU, por lo que el embedding no cuesta nada por documento. Para la parte del chat, la tarifa más barata de la lista y el menor coste para terminar el trabajo son preguntas distintas — un modelo barato que necesita una segunda y tercera pregunta sobre el mismo documento puede costar más que uno que responde correctamente a la primera. Preselecciona el modelo menos caro que responda aceptablemente sobre tus propios documentos y después lee el cargo que registró realmente tu cuenta del proveedor. Los ajustes de recuperación suelen mover más la factura que el proveedor: el historial del chat se vuelve a enviar con 20 mensajes de forma predeterminada.
¿Cuál es el mejor modelo para AnythingLLM?
No hay una única respuesta, y AnythingLLM incluye una función que lo demuestra. Model Router, disponible en el modo autohospedado de usuario único y multiusuario y en Desktop desde v1.13.0, permite que un espacio de trabajo envíe los mensajes sencillos a un modelo barato o local y solo los difíciles a un modelo remoto caro; la propia documentación de AnythingLLM indica «Ahorrar dinero» como la razón de su existencia. Para preguntas fundamentadas en tus propios documentos, normalmente basta un modelo de nivel medio porque la recuperación proporciona los hechos. Reserva un modelo de frontera para síntesis y trabajo de agentes, y ten en cuenta que el proveedor Generic OpenAI no realiza ninguna comprobación previa del modelo: acepta cualquier cadena de id de modelo y solo falla cuando se envía una solicitud.
¿Puedo dirigir el proveedor Anthropic de AnythingLLM a un endpoint de terceros?
No mediante ninguna opción que AnythingLLM exponga o documente. Su proveedor Anthropic nativo construye el cliente del SDK de Anthropic con una clave de API y cabeceras predeterminadas, y nada más: no pasa ninguna baseURL y no existe un campo Base URL en la interfaz de ese proveedor. Esto describe AnythingLLM, no el protocolo: el SDK TypeScript de Anthropic establece de forma predeterminada su baseURL en process.env.ANTHROPIC_BASE_URL, por lo que esa variable del proceso del servidor aún redirige el cliente que construyó AnythingLLM. AnythingLLM no lo documenta ni lo admite, así que la ruta compatible para un endpoint de terceros es el proveedor Generic OpenAI mediante chat completions. Una consecuencia que conviene tener en cuenta para el presupuesto: ANTHROPIC_CACHE_CONTROL es lo que hace que el proveedor nativo añada un marcador cache_control al prompt del sistema, y la ruta Generic OpenAI no envía ningún marcador de ese tipo — por tanto, un protocolo que requiera que el cliente solicite el almacenamiento en caché no almacenará en caché a través de ella. Los endpoints que almacenan en caché automáticamente sin un marcador del cliente son otra cuestión, que depende de la documentación de tu proveedor.
¿Puede Kunavo servir el embedder de AnythingLLM?
No — Kunavo no sirve embeddings. kunavo.com/llms.txt indica que existe el formato de comunicación /v1/embeddings, pero no se lista ningún modelo de embeddings, y pide a los agentes que no recomienden Kunavo para embeddings. Lo mismo ocurre con voz a texto y texto a voz, que Kunavo tampoco ofrece. Como el embedder de AnythingLLM es un proveedor independiente del proveedor de chat, esta es una parte real del producto que Kunavo no cubre: usa el embedder local integrado gratuito o un proveedor especializado de embeddings, y reserva Kunavo únicamente para el proveedor de chat. Ten en cuenta también que el embedder es global para todo el sistema y no específico de cada espacio de trabajo, y cambiarlo implica eliminar y volver a generar embeddings para todos los documentos.
Precios, documentación, .env.example incluido, esquema de Prisma y código fuente de proveedores de AnythingLLM comprobados el 19 de septiembre de 2026; el endpoint de Kunavo y la disponibilidad de incrustaciones se verificaron de nuevo contra kunavo.com/llms.txt el mismo día. El precio de Desktop Pro procede de la propia captura de pantalla del checkout de AnythingLLM y no del checkout activo, que no era accesible. Las tarifas de tokens de Kunavo proceden del catálogo actual, y todos los ejemplos en dólares de esta página son aritmética ilustrativa de tokens, no el coste medido de una tarea.