Los tests de software tradicionales no sirven para agentes.
El código convencional da resultados predecibles y un agente opera de forma probabilística y puede llegar al resultado correcto por un camino pésimo, o fallar por un camino razonable.
Lo que provoca que evaluar solo la respuesta final no sea suficiente.
En este capítulo del libro Agent Design Patterns exploramos cómo evaluar y monitorizar sistemas agénticos en producción, empezando por las métricas que hay que seguir.
El núcleo del capítulo es la monitorización de trayectorias, que consiste en evaluar no solo el resultado, sino qué herramientas eligió el agente, con qué estrategia y con qué eficiencia.
¡Observemos 👀!