Todas las etiquetas
Etiqueta del catálogo

#agent-evaluation

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

7 registros
Con la etiqueta «agent-evaluation»Ordenado por índice de salud
PyPI
97Excepcionalíndice de salud
Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
Python★ 577528 ago 2026
Apache-2.028 ago 2026 · métricas 2.10.0
PyPI
90Excelenteíndice de salud
truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
Python★ 34876 ago 2026
MIT6 ago 2026 · métricas 2.10.0
PyPI · npm
89Excelenteíndice de salud
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/mes19 ago 2026
Apache-2.019 ago 2026 · métricas 2.10.0
PyPI · npm
88Excelenteíndice de salud
hidai25/eval-view
Regression testing for AI agents. Snapshot behavior,diff tool calls,catch regressions in CI. Works with LangGraph, CrewAI, OpenAI, Anthropic.
Python★ 124↓ 2207/mes26 jul 2026
Apache-2.026 jul 2026 · métricas 2.10.0
PyPI
80Excelenteíndice de salud
benchflow-ai/benchflow
Research infra for creating RL environments, post-training, and evals.
Python★ 317↓ 6133/mes9 ago 2026
Apache-2.09 ago 2026 · métricas 2.10.0
PyPI
77Buenoíndice de salud
alizahidraja/isnad
Grade every agent, scraper and model in a claim's chain — provenance, trust scoring and audit evidence for LLM pipelines
Python★ 37↓ 4204/mes29 ago 2026
Apache-2.029 ago 2026 · métricas 2.10.0
npm · PyPI
45Débilíndice de salud
SynthiaResearch/synthia-sdk
Synthia SDKs (npm + PyPI: synthiaresearch) and the synthia CLI — eval your AI agent against simulated users
TypeScript · Python★ 0↓ 3724/mes23 jul 2026
MIT23 jul 2026 · métricas 2.10.0