← todos os cases
Agente de operaçãocase/sentinela

Sentinela — IA que testa IA

Antes de qualquer ajuste de prompt ir ao ar, uma IA-cliente conversa com o agente pelo WhatsApp real e um LLM-judge dá veredito por etapa. Regressão aparece no relatório, não na reclamação.

LangGraph.jsOpenRouterSupabaseCloudflare D1

contexto

Todo agente em produção sofre ajuste constante de prompt e fluxo. Cada ajuste pode quebrar silenciosamente algo que funcionava — e você só descobre quando o cliente reclama.

problema

Testar chatbot na mão não escala: validar uma mudança exige dezenas de conversas simulando perfis diferentes. Ninguém faz isso toda vez. Então ninguém testa — e regressão vira incidente.

solução

O Sentinela executa personas (curioso, apressado, indeciso) contra o agente em produção, pelo WhatsApp de verdade — mesmo transporte, mesma latência, mesmos bugs que o cliente encontraria. Um LLM-judge avalia cada resposta contra critérios por etapa (qualificou? ofereceu horário? não inventou preço?) e gera relatório com histórico.

arquitetura

  • Personas de teste com objetivos e comportamentos distintos (curioso, apressado, indeciso)
  • Transporte plugável: API real de WhatsApp ou mock para CI
  • Avaliação por LLM-judge com critérios por etapa da conversa
  • Histórico de execuções em Supabase para acompanhar evolução da qualidade

em imagens

[ ]

Ilustração do sistema

imagem em breve

[ ]

Relatório de execução com veredito por etapa

imagem em breve

[ ]

Simulação de conversa persona × agente

imagem em breve

resultados

100% das mudanças de prompt validadas antes de tocar um cliente real

Regressão detectada em minutos de execução, não em dias de reclamação

Qualidade virou métrica com histórico: dá pra ver se o agente melhorou ou piorou a cada versão

Me manda uma mensagem. Em 48h você tem escopo e preço.

Sem call de descoberta de 1 hora, sem proposta de 40 páginas. Você descreve o problema, eu respondo com plano, prazo e número.