Todas las etiquetas
Etiqueta del catálogo

#evaluation-framework

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

5 registros
Con la etiqueta «evaluation-framework»Ordenado por índice de salud
PyPI
83Buenoíndice de salud
EleutherAI/lm-evaluation-harness
A framework for few-shot evaluation of language models.
Python★ 13.3K↓ 1.5M/mes21 jul 2026
MIT21 jul 2026 · métricas 1.13.0
npm
80Buenoíndice de salud
promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
TypeScript★ 23.4K↓ 1.7M/mes17 jul 2026
MIT17 jul 2026 · métricas 1.13.0
npm · PyPI
78Buenoíndice de salud
confident-ai/deepeval
The LLM Evaluation Framework
Python · TypeScript★ 17K↓ 17.7K/mes20 jul 2026
Apache-2.020 jul 2026 · métricas 1.13.0
RubyGems
61Moderadoíndice de salud
homemade-software-inc/completion-kit
Your prompts need tests too. Run prompts against real datasets, score outputs with LLM judges, version everything, and compare runs to see what got better.
Ruby · HTML★ 117 jul 2026
Licencia propia17 jul 2026 · métricas 1.13.0
npm
48En riesgoíndice de salud
empirical-run/empirical
Test and evaluate LLMs and model configurations, across all the scenarios that matter for your application
TypeScript★ 16715 jul 2026
MIT15 jul 2026 · métricas 1.13.0