Усі теги
Тег каталогу

#evaluation-metrics

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

4 записи
З тегом «evaluation-metrics»Упорядковано за індексом здоров'я
PyPI · npm
94Винятковийіндекс здоров'я
confident-ai/deepeval
The LLM Evaluation Framework
Python · TypeScript★ 17.4K↓ 6.3M/міс5 серп. 2026 р.
Apache-2.05 серп. 2026 р. · метрики 2.10.0
PyPI · npm
80Відміннийіндекс здоров'я
AgentOps-AI/agentops
Python SDK for AI agent monitoring, LLM cost tracking, benchmarking, and more. Integrates with most LLMs and agent frameworks including CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, and CamelAI
Python · TypeScript★ 5 801↓ 248.9K/міс28 серп. 2026 р.
MIT28 серп. 2026 р. · метрики 2.10.0
RubyGems
67Добрийіндекс здоров'я
homemade-software-inc/completion-kit
Your prompts need tests too. Run prompts against real datasets, score outputs with LLM judges, version everything, and compare runs to see what got better.
Ruby · HTML★ 117 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 2.10.0
Go
41Слабкийіндекс здоров'я
CircleCI-Research/evalbench
Evaluate LLMs side-by-side. Benchmark AI models and coding agents across providers like OpenAI, Google, Anthropic, DeepSeek, and more. Supports custom tasks, structured JSON responses, tool use, and LLM-as-judge validation. Originally created by Petr Malik as MindTrial.
HTML★ 025 лип. 2026 р.
MPL-2.025 лип. 2026 р. · метрики 2.10.0