Усі теги
Тег каталогу

#evals

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

14 записів
З тегом «evals»Упорядковано за індексом здоров'я
PyPI · npm
89Відміннийіндекс здоров'я
Arize-ai/phoenix
AI Observability & Evaluation
Python · TypeScript · Jupyter Notebook★ 10.6K17 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 1.13.0
PyPI · npm
86Відміннийіндекс здоров'я
pydantic/logfire
AI observability platform for production LLM and agent systems.
Python★ 4 380↓ 23.5M/міс18 лип. 2026 р.
MIT18 лип. 2026 р. · метрики 1.13.0
npm
84Добрийіндекс здоров'я
mastra-ai/mastra
Mastra is the modern TypeScript framework for AI-powered applications and agents.
TypeScript★ 26.2K↓ 0/міс14 лип. 2026 р.
Власна ліцензія14 лип. 2026 р. · метрики 1.13.0
PyPI · npm
76Добрийіндекс здоров'я
harbor-framework/harbor
Framework for evaluating and improving agents
Python★ 3 333↓ 9.3M/міс21 лип. 2026 р.
Apache-2.021 лип. 2026 р. · метрики 1.13.0
npm
75Добрийіндекс здоров'я
MCPJam/inspector
Testing and evaluation platform to chat, inspect, and debug MCP servers, MCP apps, and ChatGPT apps.
TypeScript★ 2 069↓ 55.8K/міс18 лип. 2026 р.
Власна ліцензія18 лип. 2026 р. · метрики 1.13.0
PyPI · npm
71Добрийіндекс здоров'я
AgentOps-AI/agentops
Python SDK for AI agent monitoring, LLM cost tracking, benchmarking, and more. Integrates with most LLMs and agent frameworks including CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, and CamelAI
Python · TypeScript★ 5 71621 лип. 2026 р.
MIT21 лип. 2026 р. · метрики 1.13.0
Go
67Помірнийіндекс здоров'я
realkarych/catacomb
Regression testing for Claude Code and Codex agents.
Go · Shell★ 220 лип. 2026 р.
Apache-2.020 лип. 2026 р. · метрики 1.13.0
npm
66Помірнийіндекс здоров'я
zernie/vigiles
Like Lighthouse for your agent harness - verify your CLAUDE.md/AGENTS.md, skills & hooks are real, then test and measure they actually work. Claude Code + Codex.
TypeScript · JavaScript★ 12↓ 4 369/міс19 лип. 2026 р.
MIT19 лип. 2026 р. · метрики 1.13.0
PyPI
64Помірнийіндекс здоров'я
kensa-sh/kensa
Kensa turns agent traces into evals that run in CI.
Python★ 2↓ 2 171/міс23 лип. 2026 р.
Apache-2.023 лип. 2026 р. · метрики 1.13.0
Hex
58Помірнийіндекс здоров'я
aryaminus/controlkeel
Agent control plane for governed AI coding: validate changes, enforce policy gates, track findings, proofs, and evals based on your habits.
Elixir★ 1017 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 1.13.0
npm
58Помірнийіндекс здоров'я
spences10/my-pi
Composable Pi coding agent with MCP, LSP, agent chains, prompt presets, and local eval telemetry
TypeScript★ 88↓ 5 088/міс18 лип. 2026 р.
MIT18 лип. 2026 р. · метрики 1.13.0
Go
55Помірнийіндекс здоров'я
farazhassan/gantry
A tiny testable, Go-native agent runtime for teams that want control, conformance, and no framework lock-ins.
Go★ 118 лип. 2026 р.
MIT18 лип. 2026 р. · метрики 1.13.0
npm
46У зоні ризикуіндекс здоров'я
eigenpal/cli
Create, evaluate, and deploy workflows from your terminal. Agent-ready.
TypeScript★ 2↓ 4 949/міс18 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 1.13.0
PyPI
43У зоні ризикуіндекс здоров'я
splox-ai/python-sdk
Official Splox SDK
Python★ 0↓ 3 588/міс16 лип. 2026 р.
MIT16 лип. 2026 р. · метрики 1.13.0