Esta página foi traduzida automaticamente do inglês e pode estar desatualizada. Leia o original
Módulo · Intermediário
Qualidade, avaliação e observabilidade
Como testar e avaliar agentes, quais métricas são importantes, como registrar, rastrear e monitorar em produção, como melhorar a partir de conversas reais e como fazer testes A/B de prompts e modelos.
Você não pode melhorar o que não pode medir. Este módulo transforma parece funcionar em evidência.
- 1 Testando e avaliando agentes (avaliações) Crie testes repetíveis que mostrem se um agente atinge o resultado correto, segue suas regras e continua funcionando após alterações.
- 2 Métricas: precisão, latência, custo, satisfação Meça se um agente resolve o problema certo a uma velocidade e custo aceitáveis, proporcionando uma experiência útil às pessoas.
- 3 Logs, rastreamentos e monitoramento Acompanhe a solicitação de um agente desde a pergunta até o resultado, registre evidências úteis e investigue problemas sem coletar dados privados desnecessários.
- 4 Melhoria contínua a partir de conversas reais Use conversas reais para encontrar causas raiz, fazer correções direcionadas e verificar se cada lançamento melhora o agente sem quebrar outros trabalhos.
- 5 Testes A/B de prompts e modelos Compare duas variantes de agente de forma justa, interprete resultados incertos e implemente uma mudança sem confundir chance ou tráfego tendencioso com melhoria.