Timewise Labs
← Volver al blog
·3 min de lecturaiaagentesevaluación

Cómo evaluar un agente de IA antes de darle trabajo real

Armá pruebas de agentes de IA con tareas representativas, resultados observables, casos de falla y criterios de lanzamiento apropiados al proceso.

Evaluá un agente de IA verificando que complete la tarea bajo las restricciones correctas. Una respuesta fluida, un JSON válido o una llamada exitosa no demuestran por sí solos que el resultado de negocio sea correcto.

Empezá con criterios observables y un entorno donde puedas inspeccionar las acciones. Incluí casos en los que lo correcto sea preguntar, detenerse o derivar a una persona.

Definí el éxito para una tarea

Un asistente investiga envíos dañados y prepara una recomendación de reemplazo. Debe identificar el pedido correcto, consultar la política aplicable, citar evidencia y dejar la solicitud lista para revisión.

No debe crear un reemplazo salvo que esa acción forme parte de su autorización. Evaluar únicamente el mensaje final puede ocultar una modificación indebida realizada durante la investigación.

Definí resultado esperado y efectos prohibidos. Si el sistema ejecuta acciones, inspeccioná el estado de la aplicación antes y después.

Armá un conjunto de casos

Usá casos históricos autorizados y datos sintéticos identificados como tales para controlar situaciones límite. Eliminá información personal innecesaria.

CasoComportamiento esperado
Solicitud clara con pedido verificadoRecomendación respaldada
Dos pedidos posiblesPedir el identificador faltante
Política vencida o contradictoriaResolver aplicabilidad o escalar
Pedido de otro clienteBloquear acceso en la herramienta
Tiempo de espera agotadoPreservar incertidumbre y respetar límites
Solicitud repetidaEvitar acciones duplicadas
Tarea fuera de alcanceExplicar el límite sin improvisar otro servicio

Reservá algunos casos que no uses para ajustar las instrucciones. De lo contrario, podés mejorar ejemplos conocidos sin mejorar solicitudes nuevas.

Elegí la prueba adecuada

Usá verificaciones deterministas para campos exactos, argumentos permitidos, cantidad de operaciones y estado de la aplicación. Usá revisión humana para calidad de evidencia, pertinencia e interpretación ambigua de políticas.

Un modelo evaluador puede ayudar a revisar volumen, pero necesita una rúbrica y calibración contra juicios humanos. La autoevaluación confiada del agente no debe ser la única prueba de corrección.

La guía de evaluación de Anthropic distingue métodos de evaluación y registros de ejecución. Usá las trazas para diagnosticar y el sistema correspondiente para verificar qué ocurrió.

Evitá un promedio engañoso

En un ejemplo ficticio de 50 tareas, el agente resuelve 48 de forma aceptable y ejecuta una acción prohibida en dos. Un «96% de éxito» oculta el problema más importante para el lanzamiento.

Separá finalización, efectos incorrectos, violaciones de permisos, afirmaciones sin respaldo, escalamiento, latencia y costo. Definí condiciones bloqueantes para tu proceso en lugar de adoptar un porcentaje universal.

Repetí algunos casos para observar variación. Un intento correcto no demuestra comportamiento consistente. Registrá cantidad de intentos y configuración.

Convertí las fallas en mejoras

Guardá tarea, resultado esperado, versiones, evidencia y traza con controles de acceso adecuados. Identificá si faltó contexto, falló una herramienta, hubo ambigüedad de política o razonamiento incorrecto.

Corregí el componente responsable y repetí el caso fallido y otros relacionados. Una instrucción nueva puede mejorar una excepción y empeorar casos comunes.

Versioná las pruebas y ejecutalas al cambiar modelo, contexto, esquemas de herramientas, recuperación, permisos o reglas de negocio.

Evaluá también la operación

Asigná un responsable a tareas no resueltas y medí revisión y corrección. Probá caídas de servicios y revocación de acceso. Confirmá que el agente pueda detenerse con un estado incompleto honesto.

La evidencia permite decidir si ampliar acceso, acotar la tarea o cambiar el diseño. Continuá con fallas en producción y costos de implementación. Timewise Labs puede ayudarte a implementar y evaluar el agente.

Adaptado del artículo de Dream Hatch Labs.

¿Listo para empezar?

Una llamada de 30 minutos para entender tu contexto y ver si tiene sentido trabajar juntos.

Agendar llamada