Evals Agénticos
Cómo se prueba un sistema que nunca responde dos veces igual.
Un eval es una prueba reproducible para un sistema que no es determinista. El software clásico se prueba con un test que pasa o falla; un agente da una respuesta distinta en cada corrida, y por eso "probarlo" exige tres piezas: un conjunto curado de casos representativos, un criterio de éxito fijado ANTES de correrlos, y un evaluador independiente del agente que se evalúa. El eval no mide cómo va la operación — decide si el agente merece entrar en ella.
Ningún medicamento llega al mercado porque el laboratorio que lo fabricó diga que funciona. Pasa por un protocolo: una cohorte definida, un desenlace declarado antes de empezar y un evaluador que no es el fabricante. Los evals son ese protocolo aplicado a los agentes. Y el principio que los sostiene es el mismo: quien construye no certifica.
Sin evals, el rollout se aprueba con una demo que salió bien — gasto por vibra con firma de junta. Tres consecuencias: cada cambio de prompt o de modelo es una apuesta a ciegas, porque no hay línea base que distinga una mejora de una regresión; cuando el proveedor actualiza el modelo, el Model Drift no se detecta, se sufre; y cuando el cliente pregunta cómo se sabe que el agente funciona, la respuesta es una anécdota. Las Outcome y Trajectory Metrics observan al agente ya desplegado: llegan tarde para esta pregunta.
Cada agente del ecosistema VDA tiene su suite de evals y su ledger de veredictos, y el juez no es el agente que produce: es el CAE — la auditoría interna, independiente y de solo lectura. Ningún agente entra a operar en una cuenta sin pasar su corrida. Es la razón por la que VDA puede responder con evidencia, y no con confianza, cuando un comité pregunta qué tan fiable es lo que va a delegar.
¿Te resultó útil este término?