Todas las etiquetas
Etiqueta del catálogo

#evaluation-metrics

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

4 registros
Con la etiqueta «evaluation-metrics»Ordenado por índice de salud
PyPI · npm
94Excepcionalíndice de salud
confident-ai/deepeval
The LLM Evaluation Framework
Python · TypeScript★ 17.4K↓ 6.3M/mes5 ago 2026
Apache-2.05 ago 2026 · métricas 2.10.0
PyPI · npm
80Excelenteíndice de salud
AgentOps-AI/agentops
Python SDK for AI agent monitoring, LLM cost tracking, benchmarking, and more. Integrates with most LLMs and agent frameworks including CrewAI, Agno, OpenAI Agents SDK, Langchain, Autogen, AG2, and CamelAI
Python · TypeScript★ 5801↓ 248.9K/mes28 ago 2026
MIT28 ago 2026 · métricas 2.10.0
RubyGems
67Buenoíndice de salud
homemade-software-inc/completion-kit
Your prompts need tests too. Run prompts against real datasets, score outputs with LLM judges, version everything, and compare runs to see what got better.
Ruby · HTML★ 117 jul 2026
Licencia propia17 jul 2026 · métricas 2.10.0
Go
41Débilíndice de salud
CircleCI-Research/evalbench
Evaluate LLMs side-by-side. Benchmark AI models and coding agents across providers like OpenAI, Google, Anthropic, DeepSeek, and more. Supports custom tasks, structured JSON responses, tool use, and LLM-as-judge validation. Originally created by Petr Malik as MindTrial.
HTML★ 025 jul 2026
MPL-2.025 jul 2026 · métricas 2.10.0