Como criar um assistente RAG em italiano para sua pequena ou média empresa — guia prático para startups e empresas italianas que querem colocar o Claude em produção com base de conhecimento em italiano. Código funcional, custos mensais realistas, considerações sobre o GDPR e faturamento eletrônico.
A pilha básica
- Geração de embeddings dos documentos com text-embedding-3-large, chamado diretamente na OpenAI —— a Kunavo não fornece embeddings, apenas a etapa de geração
- Pesquisa vetorial (pgvector / Pinecone / Qdrant)
- Geração da resposta com Claude Sonnet 4.6 + cache de prompts
- Fallback para Gemini 2.5 Flash para alta concorrência / custos mínimos
Código essencial
from openai import OpenAI
client = OpenAI(
api_key="sk-kn-...",
base_url="https://api.kunavo.com/v1",
)
def rispondere(domanda: str, contesto: list[str]) -> str:
"""Risponde in italiano basandosi solo sul contesto recuperato dalla KB."""
resp = client.chat.completions.create(
model="claude-sonnet-4-6",
messages=[
{
"role": "system",
"content": [
{
"type": "text",
"text": (
"Sei un assistente che risponde in italiano formale "
"ma cordiale, basandoti esclusivamente sul contesto "
"fornito. Se la risposta non si trova nel contesto, "
"rispondi 'Non ho questa informazione' invece di "
"inventare. Cita sempre il documento di origine "
"quando possibile."
),
"cache_control": {"type": "ephemeral"},
},
],
},
{
"role": "user",
"content": (
f"## Contesto\n{chr(10).join(contesto)}\n\n"
f"## Domanda\n{domanda}"
),
},
],
max_tokens=600,
)
return resp.choices[0].message.contentCusto por consulta com o cache ativo: ~$0.004 (aproximadamente €0.004). Sem cache: ~$0.01. A diferença justifica a configuração correta de cache_control no system prompt estável.
Tokens em italiano
O italiano consome aproximadamente 1.3-1.5x mais tokens que o inglês para o mesmo conteúdo (artigos, terminações longas). Considere isso nos orçamentos: um contexto de 5K tokens em inglês se torna ~6.5K em italiano. Limite o contexto a 4K para manter os custos sob controle sem perder qualidade.
Anti-alucinação — o que realmente funciona
- System prompt explícito: "se a resposta não estiver no contexto, diga 'Não tenho essa informação'". O Claude respeita essa instrução em italiano de forma confiável
- Citar a fonte: peça ao modelo que retorne o ID do documento do qual extraiu cada afirmação. Se o ID for inventado, você encontrou uma alucinação
- Limitar a saída: max_tokens=400 reduz a tentação de adicionar conteúdo inventado como preenchimento
- Testes adversariais: prepare 50 perguntas do seu conjunto de dados marcadas como "não respondíveis com o contexto atual". O assistente deve recusar todas
Custo mensal estimado
- 100 consultas/dia: ~$11/mês (~€10) com cache
- 1.000 consultas/dia: ~$110/mês (~€100)
- 10.000 consultas/dia: ~$1.100/mês (~€1.000)
Comparação: um funcionário italiano de suporte ao cliente custa ~€2.500/mês para atender ~100 tickets/dia. Mesmo com 1.000 consultas/dia, o assistente de IA faz o trabalho de 10 pessoas por aproximadamente 4% do custo de um único funcionário.
Pagamento e faturamento
- Cartões: Visa, Mastercard, American Express, PostePay (via Visa)
- Apple Pay / Google Pay / Link
- Satispay, quando o checkout estiver em euros
Todos os preços estão em USD; a Stripe pode converter o valor para EUR no checkout, com uma taxa que inclui uma comissão de conversão de 2–4% paga por quem efetua o pagamento (ao pagar em USD, ela não é cobrada; documentação do Adaptive Pricing da Stripe, consultada em 2026-10-03). PayPal e SEPA Direct Debit não estão disponíveis. O checkout não exibe o IVA nem solicita o número de IVA. Faturamento eletrônico no SDI: no momento, não emitimos faturas eletrônicas para o SDI italiano. Para necessidades de faturamento, entre em contato pelo e-mail sales@kunavo.com.
GDPR — pontos críticos para pequenas e médias empresas italianas
- Pseudonimização de dados pessoais: remova nomes próprios, códigos fiscais, IBANs, e-mails e endereços do prompt antes de enviá-lo ao modelo
- DPA / Art. 28 do GDPR: o Kunavo não oferece DPA nem cláusulas contratuais padrão (CCT); as solicitações são processadas nos Estados Unidos e encaminhadas aos providers upstream. Se você precisar de um DPA com CCT para a transferência de dados para os EUA, celebre-o diretamente com o provider do modelo (termos empresariais da Anthropic, OpenAI ou Google).
- Política de privacidade atualizada: mencione explicitamente o uso de IA de terceiros por meio da Kunavo
- Direito ao esquecimento (Art. 17): certifique-se de que seus logs de aplicação possam ser excluídos. Não coloque prompts em arquivos imutáveis, como blockchain
Roteiro prático
- Semana 1: protótipo com 100 documentos, 10 consultas de teste
- Semana 2: integração com a base de conhecimento completa, testes com usuários internos
- Semana 3: ajuste fino do system prompt com casos reais, avaliação da qualidade
- Semana 4: implantação gradual, monitoramento dos custos em /app/usage
Pronto para começar? Cadastre-se gratuitamente, adicione $10 e pague apenas pelo que usar (suficiente para ~1.100 consultas de teste). Documentação completa: /docs/quickstart. Para perguntas em italiano, escreva diretamente para contact@kunavo.com.