Todas las etiquetas
Etiqueta del catálogo

#model-comparison

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

3 registros
Con la etiqueta «model-comparison»Ordenado por índice de salud
78Buenoíndice de salud
stan-dev/loo
loo R package for approximate leave-one-out cross-validation (LOO-CV) and Pareto smoothed importance sampling (PSIS)
R★ 15730 ago 2026
Licencia propia30 ago 2026 · métricas 2.10.0
RubyGems
59Moderadoíndice de salud
justi/ruby_llm-contract
Validate and retry LLM outputs for ruby_llm. Describe the JSON response you expect, fall back to a stronger model when the cheaper one fails the rules, and gate CI on regressions — all as one contract object per step.
Ruby★ 3522 ago 2026
MIT22 ago 2026 · métricas 2.10.0
Go
41Débilíndice de salud
CircleCI-Research/evalbench
Evaluate LLMs side-by-side. Benchmark AI models and coding agents across providers like OpenAI, Google, Anthropic, DeepSeek, and more. Supports custom tasks, structured JSON responses, tool use, and LLM-as-judge validation. Originally created by Petr Malik as MindTrial.
HTML★ 025 jul 2026
MPL-2.025 jul 2026 · métricas 2.10.0