Усі теги
Тег каталогу

#evaluation-framework

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

7 записів
З тегом «evaluation-framework»Упорядковано за індексом здоров'я
npm
96Винятковийіндекс здоров'я
promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
TypeScript★ 23.9K↓ 2.1M/міс5 серп. 2026 р.
MIT5 серп. 2026 р. · метрики 2.10.0
PyPI
94Винятковийіндекс здоров'я
EleutherAI/lm-evaluation-harness
A framework for few-shot evaluation of language models.
Python★ 13.8K↓ 1.8M/міс27 серп. 2026 р.
MIT27 серп. 2026 р. · метрики 2.10.0
PyPI · npm
94Винятковийіндекс здоров'я
confident-ai/deepeval
The LLM Evaluation Framework
Python · TypeScript★ 17.4K↓ 6.3M/міс5 серп. 2026 р.
Apache-2.05 серп. 2026 р. · метрики 2.10.0
PyPI · npm
89Відміннийіндекс здоров'я
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/міс19 серп. 2026 р.
Apache-2.019 серп. 2026 р. · метрики 2.10.0
RubyGems
67Добрийіндекс здоров'я
homemade-software-inc/completion-kit
Your prompts need tests too. Run prompts against real datasets, score outputs with LLM judges, version everything, and compare runs to see what got better.
Ruby · HTML★ 117 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 2.10.0
npm
50Помірнийіндекс здоров'я
empirical-run/empirical
Test and evaluate LLMs and model configurations, across all the scenarios that matter for your application
TypeScript★ 16715 лип. 2026 р.
MIT15 лип. 2026 р. · метрики 2.10.0
Go
41Слабкийіндекс здоров'я
CircleCI-Research/evalbench
Evaluate LLMs side-by-side. Benchmark AI models and coding agents across providers like OpenAI, Google, Anthropic, DeepSeek, and more. Supports custom tasks, structured JSON responses, tool use, and LLM-as-judge validation. Originally created by Petr Malik as MindTrial.
HTML★ 025 лип. 2026 р.
MPL-2.025 лип. 2026 р. · метрики 2.10.0