Timewise Labs
← Voltar ao blog
·3 min de leituraiaagentesavaliação

Como avaliar um agente de IA antes de dar trabalho real a ele

Monte testes de agentes de IA com tarefas representativas, resultados observáveis, casos de falha e critérios de lançamento adequados ao processo.

Avalie um agente de IA verificando se ele conclui a tarefa sob as restrições corretas. Uma resposta fluente, um JSON válido ou uma chamada bem-sucedida não demonstram, sozinhos, que o resultado de negócio está correto.

Comece com critérios observáveis e um ambiente em que seja possível inspecionar as ações. Inclua casos nos quais o correto é perguntar, parar ou encaminhar a uma pessoa.

Defina sucesso para uma tarefa

Um assistente investiga entregas danificadas e prepara uma recomendação de substituição. Ele precisa identificar o pedido correto, consultar a política aplicável, citar evidências e deixar a solicitação pronta para revisão.

Não deve criar uma substituição, a menos que essa ação faça parte de sua autorização. Avaliar apenas a mensagem final pode esconder uma alteração indevida realizada durante a investigação.

Defina o resultado esperado e os efeitos proibidos. Se o sistema executar ações, inspecione o estado da aplicação antes e depois.

Monte um conjunto de casos

Use casos históricos autorizados e dados sintéticos identificados como tais para controlar situações de borda. Remova informações pessoais desnecessárias.

CasoComportamento esperado
Solicitação clara com pedido verificadoRecomendação sustentada
Dois pedidos possíveisPedir o identificador que falta
Política expirada ou conflitanteResolver aplicabilidade ou encaminhar
Pedido de outro clienteBloquear acesso na ferramenta
Tempo de espera excedidoPreservar incerteza e respeitar limites
Solicitação repetidaEvitar ações duplicadas
Tarefa fora do escopoExplicar o limite sem improvisar outro serviço

Reserve alguns casos que não serão usados para ajustar as instruções. Caso contrário, você pode melhorar exemplos conhecidos sem melhorar solicitações novas.

Escolha a verificação adequada

Use verificações determinísticas para campos exatos, argumentos permitidos, quantidade de operações e estado da aplicação. Use revisão humana para qualidade de evidências, pertinência e interpretação ambígua de políticas.

Um modelo avaliador pode ajudar com o volume, mas precisa de uma rubrica e de calibração contra julgamentos humanos. A autoavaliação confiante do agente não deve ser a única prova de correção.

O guia de avaliação da Anthropic distingue métodos de avaliação e registros de execução. Use os registros para diagnosticar e o sistema correspondente para verificar o que aconteceu.

Evite uma média enganosa

Em um exemplo fictício com 50 tarefas, o agente resolve 48 de forma aceitável e executa uma ação proibida em duas. Um “96% de sucesso” esconde o problema mais importante para o lançamento.

Separe conclusão, efeitos incorretos, violações de permissão, afirmações sem apoio, encaminhamento, latência e custo. Defina condições bloqueadoras para seu processo em vez de adotar um percentual universal.

Repita alguns casos para observar variação. Uma tentativa correta não demonstra comportamento consistente. Registre a quantidade de tentativas e a configuração.

Transforme falhas em melhorias

Guarde tarefa, resultado esperado, versões, evidências e registros com controles de acesso adequados. Identifique se faltou contexto, uma ferramenta falhou, houve ambiguidade de política ou raciocínio incorreto.

Corrija o componente responsável e repita o caso que falhou e outros relacionados. Uma instrução nova pode melhorar uma exceção e piorar casos comuns.

Versione os testes e execute-os ao mudar modelo, contexto, esquemas de ferramentas, recuperação, permissões ou regras de negócio.

Avalie também a operação

Atribua um responsável às tarefas não resolvidas e meça revisão e correção. Teste indisponibilidade de serviços e revogação de acesso. Confirme se o agente consegue parar com um status incompleto honesto.

As evidências permitem decidir se é hora de ampliar acesso, reduzir a tarefa ou mudar o desenho. Continue com falhas em produção e custos de implementação. A Timewise Labs pode ajudar a implementar e avaliar o agente.

Adaptado do artigo da Dream Hatch Labs.

Pronto para começar?

Uma conversa de 30 minutos para entender o seu contexto e ver se faz sentido trabalharmos juntos.

Agendar conversa