Усі теги
Тег каталогу

#llm-evaluation

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

14 записів
З тегом «llm-evaluation»Упорядковано за індексом здоров'я
PyPI · npm
89Відміннийіндекс здоров'я
Arize-ai/phoenix
AI Observability & Evaluation
Python · TypeScript · Jupyter Notebook★ 10.6K17 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 1.13.0
npm · PyPI
87Відміннийіндекс здоров'я
Agenta-AI/agenta
The open-source workspace for building and running AI agents. Build agents through chat, share them with your team, and run background agents on schedules or app events.
TypeScript · Python★ 4 31520 лип. 2026 р.
Власна ліцензія20 лип. 2026 р. · метрики 1.13.0
PyPI · npm
83Добрийіндекс здоров'я
mlflow/mlflow
The open source AI engineering platform for agents, LLMs, and ML models. MLflow enables teams of all sizes to debug, evaluate, monitor, and optimize production-quality AI applications while controlling costs and managing access to models and data.
Python · TypeScript★ 27.1K↓ 40.1M/міс18 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 1.13.0
npm
81Добрийіндекс здоров'я
langfuse/langfuse
🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, and more. 🍊YC W23
TypeScript★ 31.3K17 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 1.13.0
npm
80Добрийіндекс здоров'я
promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
TypeScript★ 23.4K↓ 1.7M/міс17 лип. 2026 р.
MIT17 лип. 2026 р. · метрики 1.13.0
npm · PyPI
78Добрийіндекс здоров'я
confident-ai/deepeval
The LLM Evaluation Framework
Python · TypeScript★ 17K↓ 17.7K/міс20 лип. 2026 р.
Apache-2.020 лип. 2026 р. · метрики 1.13.0
Go · Maven · npm
66Помірнийіндекс здоров'я
hugalafutro/model-hotel
Multi-Provider AI Gateway - No personal logs by design. Model autodiscovery, Failover groups, High availabilty, Android companion app, and more. "Because we have LiteLLM at home"
Go · TypeScript★ 5018 лип. 2026 р.
MIT18 лип. 2026 р. · метрики 1.13.0
PyPI
64Помірнийіндекс здоров'я
b7n0de/proofbundle
Offline cryptographic receipts for AI evaluation results — Ed25519 + RFC 6962 Merkle + optional SD-JWT. Integrity, not truth
Python★ 2↓ 6 574/міс23 лип. 2026 р.
MIT23 лип. 2026 р. · метрики 1.13.0
Hex · npm
64Помірнийіндекс здоров'я
ccarvalho-eng/aludel
LLM Evaluation for Phoenix Apps
Elixir · JavaScript · HTML★ 34↓ 19.3K/міс17 лип. 2026 р.
Apache-2.017 лип. 2026 р. · метрики 1.13.0
RubyGems
61Помірнийіндекс здоров'я
homemade-software-inc/completion-kit
Your prompts need tests too. Run prompts against real datasets, score outputs with LLM judges, version everything, and compare runs to see what got better.
Ruby · HTML★ 117 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 1.13.0
PyPI · npm
60Помірнийіндекс здоров'я
fastaifoundry/fastaiagent-sdk
Опис репозиторію не опубліковано.
Python · TypeScript★ 0↓ 2 525/міс17 лип. 2026 р.
Apache-2.017 лип. 2026 р. · метрики 1.13.0
PyPI
52Помірнийіндекс здоров'я
attenlabs/hotato
Conversation QA for voice agents. Catch the calls that pass every text check but talk over the caller, skip a disclosure, or claim a task that never happened. Self-hosted, offline, MIT.
HTML★ 0↓ 2 575/міс13 лип. 2026 р.
MIT13 лип. 2026 р. · метрики 1.13.0
PyPI
50Помірнийіндекс здоров'я
JarJarBeatyourattitude/evalt
Budget-bounded LLM routing that finds the cheapest model and prompt meeting your accuracy target.
Python★ 0↓ 2 908/міс22 лип. 2026 р.
MIT22 лип. 2026 р. · метрики 1.13.0
PyPI
39У зоні ризикуіндекс здоров'я
waybarrios/crystal
CRYSTAL: Beyond Final Answers: Benchmark for Transparent Multimodal Reasoning Evaluation | arXiv 2603.13099
Python★ 217 лип. 2026 р.
Без ліцензії17 лип. 2026 р. · метрики 1.13.0