Усі теги
Тег каталогу

#evaluation

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

22 записи
З тегом «evaluation»Упорядковано за індексом здоров'я
npm · PyPI
88Відміннийіндекс здоров'я
langchain-ai/langsmith-sdk
LangSmith Client SDK Implementations
Python · TypeScript★ 971↓ 22.6M/міс17 лип. 2026 р.
MIT17 лип. 2026 р. · метрики 1.13.0
PyPI · npm
83Добрийіндекс здоров'я
mlflow/mlflow
The open source AI engineering platform for agents, LLMs, and ML models. MLflow enables teams of all sizes to debug, evaluate, monitor, and optimize production-quality AI applications while controlling costs and managing access to models and data.
Python · TypeScript★ 27.1K↓ 40.1M/міс18 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 1.13.0
PyPI
82Добрийіндекс здоров'я
embeddings-benchmark/mteb
MTEB: State-of-the-art evaluation of embeddings across languages and modalities
Python · Jupyter Notebook★ 3 36219 лип. 2026 р.
Apache-2.019 лип. 2026 р. · метрики 1.13.0
npm
81Добрийіндекс здоров'я
langfuse/langfuse
🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, and more. 🍊YC W23
TypeScript★ 31.3K17 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 1.13.0
Go
81Добрийіндекс здоров'я
trpc-group/trpc-agent-go
A Go framework for building production agent systems with graph workflows, tools, memory, A2A, AG-UI, MCP, evaluation, and observability.
Go★ 1 56119 лип. 2026 р.
Apache-2.019 лип. 2026 р. · метрики 1.13.0
npm
80Добрийіндекс здоров'я
promptfoo/promptfoo
Test your prompts, agents, and RAGs. Red teaming/pentesting/vulnerability scanning for AI. Compare performance of GPT, Claude, Gemini, DeepSeek, and more. Simple declarative configs with command line and CI/CD integration. Used by OpenAI and Anthropic.
TypeScript★ 23.4K↓ 1.7M/міс17 лип. 2026 р.
MIT17 лип. 2026 р. · метрики 1.13.0
PyPI · npm
79Добрийіндекс здоров'я
NVIDIA-NeMo/Gym
Evaluate and improve models and agents using environments
Python · MDX★ 1 055↓ 406.4K/міс18 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 1.13.0
Go · npm · PyPI
77Добрийіндекс здоров'я
Tencent/WeKnora
Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.
Go · Vue · TypeScript★ 18.7K21 лип. 2026 р.
Власна ліцензія21 лип. 2026 р. · метрики 1.13.0
npm
75Добрийіндекс здоров'я
MCPJam/inspector
Testing and evaluation platform to chat, inspect, and debug MCP servers, MCP apps, and ChatGPT apps.
TypeScript★ 2 069↓ 55.8K/міс18 лип. 2026 р.
Власна ліцензія18 лип. 2026 р. · метрики 1.13.0
npm · PyPI
68Помірнийіндекс здоров'я
aikdna/kdna
KDNA protocol and Core runtime for versioned, verifiable, encrypted, authorized judgment assets.
JavaScript★ 28↓ 20.7K/міс22 лип. 2026 р.
Apache-2.022 лип. 2026 р. · метрики 1.13.0
PyPI
67Помірнийіндекс здоров'я
huggingface/evaluate
🤗 Evaluate: A library for easily evaluating machine learning models and datasets.
Python★ 2 46518 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 1.13.0
PyPI
66Помірнийіндекс здоров'я
robocurve/inspect-robots
Evaluation framework for VLA / physical-AI models: define a benchmark once, run any policy on any robot or sim. (The Inspect AI for robotics.)
Python★ 515 лип. 2026 р.
MIT15 лип. 2026 р. · метрики 1.13.0
PyPI
60Помірнийіндекс здоров'я
mjpost/sacrebleu
Reference BLEU implementation that auto-downloads test sets and reports a version string to facilitate cross-lab comparisons
Python★ 1 253↓ 3.9M/міс18 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 1.13.0
Go · npm
58Помірнийіндекс здоров'я
starksv/windows-iso-downloader
Download official Windows ISOs directly from Microsoft's CDN. Web app + CLI tool. No account, no ads, no browser required.
TypeScript★ 7↓ 0/міс14 лип. 2026 р.
MIT14 лип. 2026 р. · метрики 1.13.0
PyPI
55Помірнийіндекс здоров'я
EpsilabAI/epsilab-python
The official Python library for the Epsilab API
Python★ 0↓ 2 706/міс21 лип. 2026 р.
Apache-2.021 лип. 2026 р. · метрики 1.13.0
PyPI
52Помірнийіндекс здоров'я
attenlabs/hotato
Conversation QA for voice agents. Catch the calls that pass every text check but talk over the caller, skip a disclosure, or claim a task that never happened. Self-hosted, offline, MIT.
HTML★ 0↓ 2 575/міс13 лип. 2026 р.
MIT13 лип. 2026 р. · метрики 1.13.0
PyPI
51Помірнийіндекс здоров'я
lazily-hub/lazily-py
A Python library for lazy evaluation with context caching.
Python★ 117 лип. 2026 р.
Apache-2.017 лип. 2026 р. · метрики 1.13.0
PyPI
50Помірнийіндекс здоров'я
JarJarBeatyourattitude/evalt
Budget-bounded LLM routing that finds the cheapest model and prompt meeting your accuracy target.
Python★ 0↓ 2 908/міс22 лип. 2026 р.
MIT22 лип. 2026 р. · метрики 1.13.0
PyPI
47У зоні ризикуіндекс здоров'я
davanstrien/ocr-bench
Per-collection OCR leaderboards using VLM-as-judge
HTML · Python★ 66↓ 0/міс14 лип. 2026 р.
Без ліцензії14 лип. 2026 р. · метрики 1.13.0
npm
40У зоні ризикуіндекс здоров'я
sindresorhus/define-lazy-prop
Define a lazily evaluated property on an object
JavaScript · TypeScript★ 67↓ 316M/міс22 лип. 2026 р.
MIT22 лип. 2026 р. · метрики 1.13.0
PyPI
39У зоні ризикуіндекс здоров'я
waybarrios/crystal
CRYSTAL: Beyond Final Answers: Benchmark for Transparent Multimodal Reasoning Evaluation | arXiv 2603.13099
Python★ 217 лип. 2026 р.
Без ліцензії17 лип. 2026 р. · метрики 1.13.0
PyPI
26Критичнийіндекс здоров'я
danthedeckie/simpleeval
Simple Safe Sandboxed Extensible Expression Evaluator for Python
Python★ 60721 лип. 2026 р.
Власна ліцензія21 лип. 2026 р. · метрики 1.13.0