Усі теги
Тег каталогу

#agent-evaluation

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

7 записів
З тегом «agent-evaluation»Упорядковано за індексом здоров'я
PyPI
97Винятковийіндекс здоров'я
Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
Python★ 5 77528 серп. 2026 р.
Apache-2.028 серп. 2026 р. · метрики 2.10.0
PyPI
90Відміннийіндекс здоров'я
truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
Python★ 3 4876 серп. 2026 р.
MIT6 серп. 2026 р. · метрики 2.10.0
PyPI · npm
89Відміннийіндекс здоров'я
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/міс19 серп. 2026 р.
Apache-2.019 серп. 2026 р. · метрики 2.10.0
PyPI · npm
88Відміннийіндекс здоров'я
hidai25/eval-view
Regression testing for AI agents. Snapshot behavior,diff tool calls,catch regressions in CI. Works with LangGraph, CrewAI, OpenAI, Anthropic.
Python★ 124↓ 2 207/міс26 лип. 2026 р.
Apache-2.026 лип. 2026 р. · метрики 2.10.0
PyPI
80Відміннийіндекс здоров'я
benchflow-ai/benchflow
Research infra for creating RL environments, post-training, and evals.
Python★ 317↓ 6 133/міс9 серп. 2026 р.
Apache-2.09 серп. 2026 р. · метрики 2.10.0
PyPI
77Добрийіндекс здоров'я
alizahidraja/isnad
Grade every agent, scraper and model in a claim's chain — provenance, trust scoring and audit evidence for LLM pipelines
Python★ 37↓ 4 204/міс29 серп. 2026 р.
Apache-2.029 серп. 2026 р. · метрики 2.10.0
npm · PyPI
45Слабкийіндекс здоров'я
SynthiaResearch/synthia-sdk
Synthia SDKs (npm + PyPI: synthiaresearch) and the synthia CLI — eval your AI agent against simulated users
TypeScript · Python★ 0↓ 3 724/міс23 лип. 2026 р.
MIT23 лип. 2026 р. · метрики 2.10.0