contexto
Todo agente em produção sofre ajuste constante de prompt e fluxo. Cada ajuste pode quebrar silenciosamente algo que funcionava — e você só descobre quando o cliente reclama.
problema
Testar chatbot na mão não escala: validar uma mudança exige dezenas de conversas simulando perfis diferentes. Ninguém faz isso toda vez. Então ninguém testa — e regressão vira incidente.
solução
O Sentinela executa personas (curioso, apressado, indeciso) contra o agente em produção, pelo WhatsApp de verdade — mesmo transporte, mesma latência, mesmos bugs que o cliente encontraria. Um LLM-judge avalia cada resposta contra critérios por etapa (qualificou? ofereceu horário? não inventou preço?) e gera relatório com histórico.
arquitetura
- ▸Personas de teste com objetivos e comportamentos distintos (curioso, apressado, indeciso)
- ▸Transporte plugável: API real de WhatsApp ou mock para CI
- ▸Avaliação por LLM-judge com critérios por etapa da conversa
- ▸Histórico de execuções em Supabase para acompanhar evolução da qualidade
em imagens
Ilustração do sistema
imagem em breve
Relatório de execução com veredito por etapa
imagem em breve
Simulação de conversa persona × agente
imagem em breve
resultados
100% das mudanças de prompt validadas antes de tocar um cliente real
Regressão detectada em minutos de execução, não em dias de reclamação
Qualidade virou métrica com histórico: dá pra ver se o agente melhorou ou piorou a cada versão