Усі теги
Тег каталогу

#llm-eval

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

9 записів
З тегом «llm-eval»Упорядковано за індексом здоров'я
PyPI · npm
100Винятковийіндекс здоров'я
Arize-ai/phoenix
AI Observability & Evaluation
Python · TypeScript★ 11.2K28 серп. 2026 р.
Власна ліцензія28 серп. 2026 р. · метрики 2.10.0
PyPI
97Винятковийіндекс здоров'я
Giskard-AI/giskard-oss
🐢 Open-Source Evaluation & Testing library for LLM Agents
Python★ 5 77528 серп. 2026 р.
Apache-2.028 серп. 2026 р. · метрики 2.10.0
npm
96Винятковийіндекс здоров'я
promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
TypeScript★ 23.9K↓ 2.1M/міс5 серп. 2026 р.
MIT5 серп. 2026 р. · метрики 2.10.0
PyPI
90Відміннийіндекс здоров'я
truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
Python★ 3 4876 серп. 2026 р.
MIT6 серп. 2026 р. · метрики 2.10.0
PyPI · npm
89Відміннийіндекс здоров'я
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/міс19 серп. 2026 р.
Apache-2.019 серп. 2026 р. · метрики 2.10.0
PyPI
78Добрийіндекс здоров'я
attenlabs/hotato
Find what broke in your agent calls. Pin it so it never ships again. Local voice-agent call forensics and regression guards.
Python★ 1↓ 1 680/міс22 серп. 2026 р.
MIT22 серп. 2026 р. · метрики 2.10.0
Go
69Добрийіндекс здоров'я
lehigh-university-libraries/htr
Handwritten Text Recognition llm eval tool
Go★ 23 серп. 2026 р.
Apache-2.03 серп. 2026 р. · метрики 2.10.0
RubyGems
67Добрийіндекс здоров'я
homemade-software-inc/completion-kit
Your prompts need tests too. Run prompts against real datasets, score outputs with LLM judges, version everything, and compare runs to see what got better.
Ruby · HTML★ 117 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 2.10.0
Go · npm
60Помірнийіндекс здоров'я
valbaudo/awf
Run agents you don't babysit, and trust the result. awf runs agentic workflows with independent gates that check every step and resumes after crashes.
Go★ 122 лип. 2026 р.
Apache-2.022 лип. 2026 р. · метрики 2.10.0