AgentsEval

Evaluación de agentes de IA en seguridad, capacidad y fiabilidad

AgentsEval evalúa el comportamiento de los agentes de IA con trazas capturadas, escenarios deterministas, soporte de reproducción y veredictos ship/watch/fail. Es evidencia de fiabilidad para escenarios y políticas específicos, no una certificación amplia de seguridad ni un benchmark universal.

Dos revisores y un agente sentados a una mesa redonda, repasando juntos una lista de verificación.
FIG. / UN AGENTE SE LANZA DESPUÉS DE QUE LOS REVISORES COMPRUEBAN LA EVIDENCIA

¿Qué es AgentsEval?

AgentsEval es un marco de evaluación de agentes de IA que puntúa ejecuciones capturadas a partir de evidencia de llamadas al sistema, archivos, red, intención, espacio de trabajo y respuesta final. Consolida varias ejecuciones en veredictos acotados, para que los equipos puedan promover, vigilar o rechazar versiones de agentes según el comportamiento observado.

Flujo de evaluación

El comportamiento capturado se convierte en un veredicto acotado.

  1. Escenario
  2. Celda de captura
  3. Traza de llamadas al sistema
  4. Diferencias de archivos y red
  5. Evaluador
  6. Veredicto consolidado

Celda de captura

Las ejecuciones de escenarios se realizan en una celda de captura y pueden observarse mediante trazas JSONL al estilo de strace o Tetragon.

Evidencia de seguridad

Las reglas de seguridad inspeccionan archivos fuera de alcance, comandos destructivos, tráfico saliente no permitido, escalada de privilegios, combinaciones de inyección y ediciones de archivos de prueba.

Evidencia de capacidad

Las especificaciones de capacidad comprueban los comandos esperados, las salidas, la actividad HTTP, las respuestas finales y los efectos en el espacio de trabajo.

Proxy de reproducción

Un proxy determinista de grabación y reproducción permite pruebas de regresión sin recurrir en silencio a proveedores en vivo cuando falta una grabación.

Resultado operativo

Las versiones de agentes pueden promoverse, vigilarse o rechazarse según el comportamiento capturado, y no solo mediante la revisión de prompts.

Límites de lo que afirma AgentsEval

¿Es un benchmark de agentes?
Puede ejecutar escenarios repetibles y consolidar resultados, pero los textos públicos deben describir la biblioteca de escenarios específica y el marco de ejecuciones capturadas, en lugar de dar a entender un benchmark universal.
¿Certifica la seguridad?
No. Produce hallazgos y veredictos respaldados por el código fuente para las políticas, trazas y escenarios configurados.

Hablar sobre evaluación de agentes

Diseñe bibliotecas de escenarios, límites de captura, requisitos de reproducción y criterios de promoción para sus versiones de agentes.

+1 332 2081410
[email protected]

Conversación de arquitectura

Cuéntenos qué necesita controlar su equipo

Comparta su perímetro de despliegue, el número de agentes, las superficies de trabajo y los requisitos de gobernanza. Responderemos por correo electrónico para coordinar una conversación técnica enfocada.

Escribir al equipo de Bewize

Esto abre su aplicación de correo electrónico. Lea nuestra Política de privacidad.