Усі теги
Тег каталогу

#evals

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

29 записів
З тегом «evals»Упорядковано за індексом здоров'я
PyPI · npm
100Винятковийіндекс здоров'я
Arize-ai/phoenix
AI Observability & Evaluation
Python · TypeScript★ 11.2K28 серп. 2026 р.
Власна ліцензія28 серп. 2026 р. · метрики 2.10.0
PyPI · npm
99Винятковийіндекс здоров'я
pydantic/logfire
AI observability platform for production LLM and agent systems.
Python★ 4 442↓ 14.6M/міс27 серп. 2026 р.
MIT27 серп. 2026 р. · метрики 2.10.0
npm
98Винятковийіндекс здоров'я
mastra-ai/mastra
Mastra is the modern TypeScript framework for AI-powered applications and agents.
TypeScript★ 26.9K↓ 61.2K/міс5 серп. 2026 р.
Власна ліцензія5 серп. 2026 р. · метрики 2.10.0
PyPI
94Винятковийіндекс здоров'я
langchain-ai/deepagents
The batteries-included agent harness.
Python★ 27.3K↓ 210.2K/міс5 серп. 2026 р.
MIT5 серп. 2026 р. · метрики 2.10.0
PyPI · npm
93Винятковийіндекс здоров'я
harbor-framework/harbor
Framework for evaluating and improving agents
Python★ 4 69427 серп. 2026 р.
Apache-2.027 серп. 2026 р. · метрики 2.10.0
npm
90Відміннийіндекс здоров'я
MCPJam/inspector
Testing and evaluation platform to chat, inspect, and debug MCP servers, MCP apps, and ChatGPT apps.
TypeScript★ 2 069↓ 55.8K/міс18 лип. 2026 р.
Власна ліцензія18 лип. 2026 р. · метрики 2.10.0
PyPI
90Відміннийіндекс здоров'я
truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
Python★ 3 4876 серп. 2026 р.
MIT6 серп. 2026 р. · метрики 2.10.0
PyPI · npm
89Відміннийіндекс здоров'я
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/міс19 серп. 2026 р.
Apache-2.019 серп. 2026 р. · метрики 2.10.0
npm
84Відміннийіндекс здоров'я
nearform/lastlight
Self-hostable, MIT Licensed, Enterprise AI Software Factory
TypeScript · Astro★ 18↓ 25.1K/міс26 лип. 2026 р.
MIT26 лип. 2026 р. · метрики 2.10.0
PyPI · npm
80Відміннийіндекс здоров'я
AgentOps-AI/agentops
Python SDK for AI agent monitoring, LLM cost tracking, benchmarking, and more. Integrates with most LLMs and agent frameworks including CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, and CamelAI
Python · TypeScript★ 5 801↓ 248.9K/міс28 серп. 2026 р.
MIT28 серп. 2026 р. · метрики 2.10.0
PyPI
80Відміннийіндекс здоров'я
benchflow-ai/benchflow
Research infra for creating RL environments, post-training, and evals.
Python★ 317↓ 6 133/міс9 серп. 2026 р.
Apache-2.09 серп. 2026 р. · метрики 2.10.0
npm
80Відміннийіндекс здоров'я
o-stepper/graphorin
Project Graphorin is a TypeScript framework for personal AI assistants and long-living agents with rich memory, durable workflow, and observability out of the box.
TypeScript★ 3↓ 43.5K/міс1 серп. 2026 р.
MIT1 серп. 2026 р. · метрики 2.10.0
Go
80Відміннийіндекс здоров'я
realkarych/catacomb
Regression testing for Claude Code and Codex agents.
Go · Shell★ 220 лип. 2026 р.
Apache-2.020 лип. 2026 р. · метрики 2.10.0
PyPI
78Добрийіндекс здоров'я
attenlabs/hotato
Find what broke in your agent calls. Pin it so it never ships again. Local voice-agent call forensics and regression guards.
Python★ 1↓ 1 680/міс22 серп. 2026 р.
MIT22 серп. 2026 р. · метрики 2.10.0
npm
78Добрийіндекс здоров'я
getlarge/themoltnet
Trusted context for AI agents
TypeScript · Go★ 15↓ 7 904/міс30 лип. 2026 р.
AGPL-3.030 лип. 2026 р. · метрики 2.10.0
PyPI
78Добрийіндекс здоров'я
superlinear-ai/raglite
🥤 RAGLite is a Python toolkit for Retrieval-Augmented Generation (RAG) with DuckDB or PostgreSQL
Python★ 1 20010 серп. 2026 р.
MPL-2.010 серп. 2026 р. · метрики 2.10.0
npm
77Добрийіндекс здоров'я
zernie/vigiles
Like Lighthouse for your agent harness - verify your CLAUDE.md/AGENTS.md, skills & hooks are real, then test and measure they actually work. Claude Code + Codex.
TypeScript · JavaScript★ 12↓ 4 369/міс19 лип. 2026 р.
MIT19 лип. 2026 р. · метрики 2.10.0
PyPI
73Добрийіндекс здоров'я
kensa-sh/kensa
Kensa turns agent traces into evals that run in CI.
Python★ 2↓ 2 171/міс23 лип. 2026 р.
Apache-2.023 лип. 2026 р. · метрики 2.10.0
Packagist
63Помірнийіндекс здоров'я
pestphp/pest-plugin-evals
Pest Browser Evals
PHP★ 4↓ 7 386/міс4 серп. 2026 р.
MIT4 серп. 2026 р. · метрики 2.10.0
Hex
62Помірнийіндекс здоров'я
aryaminus/controlkeel
Agent control plane for governed AI coding: validate changes, enforce policy gates, track findings, proofs, and evals based on your habits.
Elixir★ 1017 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 2.10.0
npm
62Помірнийіндекс здоров'я
shulmansj/teami
Control plane for orchestrating, evaluating, and improving agent work across a company
JavaScript★ 0↓ 2 136/міс30 лип. 2026 р.
Власна ліцензія30 лип. 2026 р. · метрики 2.10.0
npm
62Помірнийіндекс здоров'я
spences10/my-pi
Composable Pi coding agent with MCP, LSP, agent chains, prompt presets, and local eval telemetry
TypeScript★ 88↓ 5 088/міс18 лип. 2026 р.
MIT18 лип. 2026 р. · метрики 2.10.0
Go
57Помірнийіндекс здоров'я
farazhassan/gantry
A tiny testable, Go-native agent runtime for teams that want control, conformance, and no framework lock-ins.
Go★ 118 лип. 2026 р.
MIT18 лип. 2026 р. · метрики 2.10.0
npm
54Помірнийіндекс здоров'я
inferock/inferock-bench
Local LLM cost-tracking proxy for OpenAI, Anthropic, Gemini, and pinned OpenRouter calls with token usage, failure, and billing-integrity receipts.
TypeScript★ 123↓ 6 119/міс29 лип. 2026 р.
Власна ліцензія29 лип. 2026 р. · метрики 2.10.0
npm
53Помірнийіндекс здоров'я
mykim-aus/hey-llm-you-okay
Hey LLM, you okay? — pyramid-ordered LLM testing CLI for CI/CD. One YAML for every layer, LLM-as-a-judge gates, and A/B triage that tells prompt regressions from model drift.
TypeScript · JavaScript★ 1↓ 2 332/міс30 лип. 2026 р.
MIT30 лип. 2026 р. · метрики 2.10.0
npm
51Помірнийіндекс здоров'я
HolocronLab/botruntime-packages
botruntime public packages. Consumed by the botruntime platform.
TypeScript★ 0↓ 48.8K/міс29 лип. 2026 р.
Без ліцензії29 лип. 2026 р. · метрики 2.10.0
npm
50Помірнийіндекс здоров'я
LilMGenius/paperthin
Low-level agentic design patterns. Turning old engineering wisdom into reflexes your agent reaches for on its own—on any agent.
Shell · JavaScript★ 119↓ 4 136/міс31 лип. 2026 р.
MIT31 лип. 2026 р. · метрики 2.10.0
npm
47Слабкийіндекс здоров'я
eigenpal/cli
Create, evaluate, and deploy workflows from your terminal. Agent-ready.
TypeScript★ 2↓ 4 949/міс18 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 2.10.0
PyPI
39Слабкийіндекс здоров'я
splox-ai/python-sdk
Official Splox SDK
Python★ 0↓ 3 588/міс16 лип. 2026 р.
MIT16 лип. 2026 р. · метрики 2.10.0