Todas las etiquetas
Etiqueta del catálogo

#eval

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

22 registros
Con la etiqueta «eval»Ordenado por índice de salud
PyPI
94Excepcionalíndice de salud
PrimeIntellect-ai/verifiers
Our library for RL environments + evals
Python★ 4565↓ 378.1K/mes28 ago 2026
MIT28 ago 2026 · métricas 2.10.0
PyPI · npm
89Excelenteíndice de salud
UiPath/coder_eval
Test that your Claude Code skills, MCP servers, and CLIs actually work when an agent uses them — sandboxed YAML suites, activation checks, A/B experiments, CI gates.
Python · TypeScript★ 116↓ 13.9K/mes19 ago 2026
Apache-2.019 ago 2026 · métricas 2.10.0
npm
78Buenoíndice de salud
vercel-labs/agent-eval
El repositorio no publica descripción.
TypeScript · JavaScript★ 229↓ 181.2K/mes31 jul 2026
Sin licencia31 jul 2026 · métricas 2.10.0
npm
77Buenoíndice de salud
justjake/quickjs-emscripten
Safely execute untrusted Javascript in your Javascript, and execute synchronous code that uses async functions
TypeScript · Makefile★ 1691↓ 21.5M/mes13 ago 2026
Licencia propia13 ago 2026 · métricas 2.10.0
PyPI
77Buenoíndice de salud
lmfit/asteval
minimalistic evaluator of python expression using ast module
Python★ 21921 jul 2026
MIT21 jul 2026 · métricas 2.10.0
npm
77Buenoíndice de salud
zernie/vigiles
Like Lighthouse for your agent harness - verify your CLAUDE.md/AGENTS.md, skills & hooks are real, then test and measure they actually work. Claude Code + Codex.
TypeScript · JavaScript★ 12↓ 4369/mes19 jul 2026
MIT19 jul 2026 · métricas 2.10.0
PyPI
73Buenoíndice de salud
phierceweb/pf-core
Python foundation for LLM apps whose prompts and spend you can actually see — versioned prompts, every call recorded and replayable, budgets, evals, jobs.
Python★ 2↓ 1160/mes5 sept 2026
MIT5 sept 2026 · métricas 2.10.0
Packagist
71Buenoíndice de salud
wp-cli/eval-command
Executes arbitrary PHP code or files.
Gherkin · PHP★ 10↓ 300.6K/mes20 jul 2026
MIT20 jul 2026 · métricas 2.10.0
npm
69Buenoíndice de salud
crewhaus/factory
Open-source compiler for AI agents. Write one crewhaus.yaml; compile it to a CLI, a Slack bot, and an eval harness from the same spec. Apache-2.0.
TypeScript★ 2↓ 25.7K/mes24 jul 2026
Apache-2.024 jul 2026 · métricas 2.10.0
npm
69Buenoíndice de salud
tangle-network/agent-app
A feature-full starting point for production agent applications on Tangle.
TypeScript★ 0↓ 47.2K/mes17 jul 2026
MIT17 jul 2026 · métricas 2.10.0
npm
67Buenoíndice de salud
peerigon/angular-expressions
Angular expressions as standalone module
JavaScript★ 100↓ 569.9K/mes5 sept 2026
Unlicense5 sept 2026 · métricas 2.10.0
npm
65Buenoíndice de salud
PruvoNet/json-expression-eval
json serializable rule engine / boolean expression evaluator
TypeScript★ 22↓ 6681/mes18 jul 2026
MIT18 jul 2026 · métricas 2.10.0
npm
63Moderadoíndice de salud
mgechev/skillgrade
"Unit tests" for your agent skills
TypeScript★ 661↓ 2290/mes5 ago 2026
MIT5 ago 2026 · métricas 2.10.0
Packagist
63Moderadoíndice de salud
pestphp/pest-plugin-evals
Pest Browser Evals
PHP★ 4↓ 7386/mes4 ago 2026
MIT4 ago 2026 · métricas 2.10.0
npm
62Moderadoíndice de salud
reggi/evalmd
:fishing_pole_and_fish: Evaluates javascript code blocks from markdown files.
JavaScript★ 47↓ 153.9K/mes29 jul 2026
MIT29 jul 2026 · métricas 2.10.0
crates.io
60Moderadoíndice de salud
AndyCappDev/stet
A PDF rendering engine and PostScript Level 3 interpreter written in pure Rust.
Rust★ 11↓ 91.6K/mes19 ago 2026
Apache-2.019 ago 2026 · métricas 2.10.0
npm
60Moderadoíndice de salud
gemstack-land/the-framework
Autonomous AI programming. Stop babysitting your coding agents. You make the important decisions; AI does the rest.
TypeScript★ 8↓ 5492/mes30 jul 2026
MIT30 jul 2026 · métricas 2.10.0
RubyGems
59Moderadoíndice de salud
justi/ruby_llm-contract
Validate and retry LLM outputs for ruby_llm. Describe the JSON response you expect, fall back to a stronger model when the cheaper one fails the rules, and gate CI on regressions — all as one contract object per step.
Ruby★ 3522 ago 2026
MIT22 ago 2026 · métricas 2.10.0
PyPI
56Moderadoíndice de salud
danthedeckie/simpleeval
Simple Safe Sandboxed Extensible Expression Evaluator for Python
Python★ 60721 jul 2026
Licencia propia21 jul 2026 · métricas 2.10.0
npm
53Moderadoíndice de salud
mykim-aus/hey-llm-you-okay
Hey LLM, you okay? — pyramid-ordered LLM testing CLI for CI/CD. One YAML for every layer, LLM-as-a-judge gates, and A/B triage that tells prompt regressions from model drift.
TypeScript · JavaScript★ 1↓ 2332/mes30 jul 2026
MIT30 jul 2026 · métricas 2.10.0
crates.io
45Débilíndice de salud
bugadani/somni
El repositorio no publica descripción.
Rust★ 2↓ 102.5K/mes22 ago 2026
Apache-2.022 ago 2026 · métricas 2.10.0
npm
34En riesgoíndice de salud
sindresorhus/define-lazy-prop
Define a lazily evaluated property on an object
JavaScript · TypeScript★ 67↓ 353M/mes4 ago 2026
MIT4 ago 2026 · métricas 2.10.0