Todas las etiquetas
Etiqueta del catálogo

#ai-evaluation

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

4 registros
Con la etiqueta «ai-evaluation»Ordenado por índice de salud
PyPI · npm
89Excelenteíndice de salud
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/mes19 ago 2026
Apache-2.019 ago 2026 · métricas 2.10.0
PyPI
73Buenoíndice de salud
b7n0de/proofbundle
Offline cryptographic receipts for AI evaluation results — Ed25519 + RFC 6962 Merkle + optional SD-JWT. Integrity, not truth
Python★ 2↓ 6574/mes23 jul 2026
MIT23 jul 2026 · métricas 2.10.0
PyPI
59Moderadoíndice de salud
mrwersa/agentverity
Your agent test passed. Would it pass again? Checks whether AI agent test results are repeatable and varied enough to trust as a regression baseline. Reads Promptfoo and DeepEval runs you already have.
Python★ 15 ago 2026
Apache-2.05 ago 2026 · métricas 2.10.0
PyPI
50Moderadoíndice de salud
JarJarBeatyourattitude/evalt
Budget-bounded LLM routing that finds the cheapest model and prompt meeting your accuracy target.
Python★ 0↓ 2908/mes22 jul 2026
MIT22 jul 2026 · métricas 2.10.0