o metodo
Qualquer um entrega IA que funciona na demo.
A conta chega no mês 6: o prompt já foi ajustado trinta vezes, o modelo mudou de versão duas, ninguém sabe dizer qual mudança quebrou o quê — e quem vendeu já está vendendo pra outro. Este método existe pra esse mês, não pra apresentação de vendas.
build
A IA constrói
Agentes de código trabalham comigo dentro do repositório de verdade: escrevem, revisam e refatoram sob revisão minha, com convenções e portão de revisão definidos por projeto. É daí que sai o prazo — você conversa com o protótipo em duas semanas em vez de aprovar um cronograma de dois meses. E o portão existe justamente pra velocidade não virar dívida que aparece depois.
→Protótipo em 2 semanas, no seu repositório, versionado e documentado desde o primeiro commit — seu desde o começo.
verify
A IA testa
O Sentinela roda personas de cliente contra o agente real — mesmo canal, mesma latência, mesmos defeitos que o seu cliente encontraria. Um juiz avalia resposta por resposta contra critérios definidos com você: qualificou, ofereceu horário que existe, não inventou preço. Nenhum ajuste de prompt chega no seu cliente sem passar antes.
→Relatório com veredito por etapa e histórico: "melhorou ou piorou" deixa de ser opinião e vira linha num gráfico.
observe
A IA opera
Em produção, cada chamada fica registrada: o que entrou, o que saiu, quanto custou e quanto demorou — por cliente e por conversa. Quando a qualidade cai, isso aparece no meu relatório antes de aparecer no seu WhatsApp em forma de reclamação.
→Custo por conversa visível no painel e relatório mensal do que a IA resolveu sozinha, onde travou e o que muda no ciclo seguinte.
sentinela
Uma IA fingindo ser seu cliente pra descobrir onde a outra falha.
Validar uma mudança de prompt direito exige dezenas de conversas, cada uma com um perfil diferente de cliente. Ninguém tem estômago pra fazer isso na sexta às seis da tarde — então, na prática, quase ninguém testa. O agente sobe no palpite, e o teste de verdade acaba sendo o seu cliente. É esse buraco que o Sentinela fecha.
Uma IA simula o cliente
persona: apressadoUm juiz dá nota por critério
- ✓não inventou preço
- ✓transferiu com histórico completo
- ✓respeitou o tom configurado
- ✗ofereceu horário fora da agenda
E cada resposta deixa rastro
Personas com objetivo
Curioso, apressado, indeciso — os mesmos perfis que entram no seu WhatsApp todo dia. Cada persona tem objetivo próprio e plano de conversa adaptativo: responde ao que o agente perguntar, insiste quando ele foge do assunto e encerra quando consegue o que queria. É teste com cliente difícil, não com pergunta fácil.
Transporte real
A conversa acontece pelo mesmo canal do cliente final, com a mesma latência e os mesmos defeitos de integração. Testar em ambiente limpo esconde exatamente os erros que aparecem em produção. Também roda em modo simulado na integração contínua, sem tocar em ninguém de verdade.
Juiz por critério
Um LLM-judge avalia cada etapa contra as regras do seu negócio, escritas com você: qualificou? ofereceu horário que a agenda tem? não inventou preço? não prometeu prazo que a operação não cumpre? A nota sai por critério, então reprovação vira tarefa específica — não "achei que ficou ruim".
Veredito com histórico
Cada execução fica registrada e comparável com a anterior. A qualidade vira série temporal, então dá pra apontar a versão exata em que alguma coisa piorou — e a regressão aparece em minutos de execução, não em dias de cliente reclamando.
$ o que ele pega antes do seu cliente
✕Preço inventado que não existe na sua tabela — e que seu cliente vai cobrar de você
✕Handoff que não acontece: o cliente pede um humano e continua falando com a máquina
✕Horário oferecido que a agenda não tem, gerando remarcação e desculpa
✕Promessa de prazo que a operação não cumpre
✕Regressão silenciosa depois de um ajuste de prompt que parecia inofensivo
QA runner em produção · roda contra agente meu ou de terceiro
rastro
Se você não sabe quanto custa cada conversa, não tem IA: tem uma conta.
Rastro de LLM não é preciosismo de engenheiro. É a diferença entre negociar arquitetura com dado na mão e receber a fatura no fim do mês sem saber qual conversa gastou o quê. Quem não liga isso no primeiro dia raramente liga depois.
Custo por conversa
Quanto cada atendimento consumiu, por cliente e por período. É o número que transforma "a IA está cara" em decisão de arquitetura — trocar de modelo, encurtar o contexto, reescrever o prompt — em vez de discussão sem dado. Foi assim que uma reescrita cortou 50% dos tokens por resposta num agente em produção.
Latência por etapa
Onde a conversa demora: no modelo, na busca da base ou na integração que está lenta. Sem essa quebra, otimizar é chute caro — troca-se o modelo quando o gargalo estava no CRM.
Qualidade com série
A nota do Sentinela guardada versão a versão. "Melhorou ou piorou depois da última mudança" deixa de ser opinião de reunião e vira uma linha que sobe ou desce.
Já tem um agente no ar e nunca soube se ele está funcionando?
Em 2 semanas eu rodo o Sentinela contra ele e te mostro onde ele quebra — preço que não existe na sua tabela, handoff que não acontece, horário que a agenda não tem — e quanto está custando cada conversa. O relatório é seu, sem obrigação nenhuma: se der pra consertar com quem construiu, melhor pra você.
Me manda uma mensagem. Em 48h você tem escopo e preço.
Sem call de descoberta de 1 hora, sem proposta de 40 páginas. Você descreve o problema, eu respondo com plano, prazo e número.