Como avaliar um agente de IA antes de dar trabalho real a ele
Monte testes de agentes de IA com tarefas representativas, resultados observáveis, casos de falha e critérios de lançamento adequados ao processo.
Avalie um agente de IA verificando se ele conclui a tarefa sob as restrições corretas. Uma resposta fluente, um JSON válido ou uma chamada bem-sucedida não demonstram, sozinhos, que o resultado de negócio está correto.
Comece com critérios observáveis e um ambiente em que seja possível inspecionar as ações. Inclua casos nos quais o correto é perguntar, parar ou encaminhar a uma pessoa.
Defina sucesso para uma tarefa
Um assistente investiga entregas danificadas e prepara uma recomendação de substituição. Ele precisa identificar o pedido correto, consultar a política aplicável, citar evidências e deixar a solicitação pronta para revisão.
Não deve criar uma substituição, a menos que essa ação faça parte de sua autorização. Avaliar apenas a mensagem final pode esconder uma alteração indevida realizada durante a investigação.
Defina o resultado esperado e os efeitos proibidos. Se o sistema executar ações, inspecione o estado da aplicação antes e depois.
Monte um conjunto de casos
Use casos históricos autorizados e dados sintéticos identificados como tais para controlar situações de borda. Remova informações pessoais desnecessárias.
| Caso | Comportamento esperado |
|---|---|
| Solicitação clara com pedido verificado | Recomendação sustentada |
| Dois pedidos possíveis | Pedir o identificador que falta |
| Política expirada ou conflitante | Resolver aplicabilidade ou encaminhar |
| Pedido de outro cliente | Bloquear acesso na ferramenta |
| Tempo de espera excedido | Preservar incerteza e respeitar limites |
| Solicitação repetida | Evitar ações duplicadas |
| Tarefa fora do escopo | Explicar o limite sem improvisar outro serviço |
Reserve alguns casos que não serão usados para ajustar as instruções. Caso contrário, você pode melhorar exemplos conhecidos sem melhorar solicitações novas.
Escolha a verificação adequada
Use verificações determinísticas para campos exatos, argumentos permitidos, quantidade de operações e estado da aplicação. Use revisão humana para qualidade de evidências, pertinência e interpretação ambígua de políticas.
Um modelo avaliador pode ajudar com o volume, mas precisa de uma rubrica e de calibração contra julgamentos humanos. A autoavaliação confiante do agente não deve ser a única prova de correção.
O guia de avaliação da Anthropic distingue métodos de avaliação e registros de execução. Use os registros para diagnosticar e o sistema correspondente para verificar o que aconteceu.
Evite uma média enganosa
Em um exemplo fictício com 50 tarefas, o agente resolve 48 de forma aceitável e executa uma ação proibida em duas. Um “96% de sucesso” esconde o problema mais importante para o lançamento.
Separe conclusão, efeitos incorretos, violações de permissão, afirmações sem apoio, encaminhamento, latência e custo. Defina condições bloqueadoras para seu processo em vez de adotar um percentual universal.
Repita alguns casos para observar variação. Uma tentativa correta não demonstra comportamento consistente. Registre a quantidade de tentativas e a configuração.
Transforme falhas em melhorias
Guarde tarefa, resultado esperado, versões, evidências e registros com controles de acesso adequados. Identifique se faltou contexto, uma ferramenta falhou, houve ambiguidade de política ou raciocínio incorreto.
Corrija o componente responsável e repita o caso que falhou e outros relacionados. Uma instrução nova pode melhorar uma exceção e piorar casos comuns.
Versione os testes e execute-os ao mudar modelo, contexto, esquemas de ferramentas, recuperação, permissões ou regras de negócio.
Avalie também a operação
Atribua um responsável às tarefas não resolvidas e meça revisão e correção. Teste indisponibilidade de serviços e revogação de acesso. Confirme se o agente consegue parar com um status incompleto honesto.
As evidências permitem decidir se é hora de ampliar acesso, reduzir a tarefa ou mudar o desenho. Continue com falhas em produção e custos de implementação. A Timewise Labs pode ajudar a implementar e avaliar o agente.
Adaptado do artigo da Dream Hatch Labs.