Усі теги
Тег каталогу

#quantization

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

34 записи
З тегом «quantization»Упорядковано за індексом здоров'я
PyPI
99Винятковийіндекс здоров'я
openvinotoolkit/nncf
Neural Network Compression Framework for enhanced OpenVINO™ inference
Python★ 1 189↓ 1.3M/міс13 серп. 2026 р.
Apache-2.013 серп. 2026 р. · метрики 2.10.0
PyPI
97Винятковийіндекс здоров'я
intel/auto-round
A SOTA quantization algorithm for high-accuracy low-bit LLM inference, seamlessly optimized for CPU/XPU/CUDA, with multi-datatype support and full compatibility with vLLM, SGLang, and Transformers.
Python · C++★ 1 52016 лип. 2026 р.
Apache-2.016 лип. 2026 р. · метрики 2.10.0
PyPI
97Винятковийіндекс здоров'я
pytorch/ao
PyTorch native quantization and sparsity for training and inference
Python · C++★ 2 90921 лип. 2026 р.
Власна ліцензія21 лип. 2026 р. · метрики 2.10.0
PyPI
96Винятковийіндекс здоров'я
bitsandbytes-foundation/bitsandbytes
Accessible large language models via k-bit quantization for PyTorch.
Python · Cuda★ 8 442↓ 5.6M/міс27 серп. 2026 р.
MIT27 серп. 2026 р. · метрики 2.10.0
PyPI
96Винятковийіндекс здоров'я
vllm-project/llm-compressor
Transformers-compatible library for applying various compression algorithms to LLMs for optimized deployment with vLLM
Python★ 3 580↓ 190.2K/міс25 лип. 2026 р.
Apache-2.025 лип. 2026 р. · метрики 2.10.0
PyPI
94Винятковийіндекс здоров'я
huggingface/optimum
🚀 Accelerate inference and training of 🤗 Transformers, Diffusers, TIMM and Sentence Transformers with easy to use hardware optimization tools
Python★ 3 44821 лип. 2026 р.
Apache-2.021 лип. 2026 р. · метрики 2.10.0
PyPI
89Відміннийіндекс здоров'я
ModelCloud/GPTQModel
LLM model quantization (compression) toolkit with HW acceleration support for Nvidia, AMD, Intel GPU and Intel/AMD/Apple CPU via HF, vLLM, and SGLang.
Python · Cuda★ 1 20717 лип. 2026 р.
Власна ліцензія17 лип. 2026 р. · метрики 2.10.0
PyPI
89Відміннийіндекс здоров'я
Xilinx/brevitas
Brevitas: neural network quantization in PyTorch
Python★ 1 55422 лип. 2026 р.
Власна ліцензія22 лип. 2026 р. · метрики 2.10.0
PyPI · crates.io
88Відміннийіндекс здоров'я
RyanCodrai/turbovec
A vector index built on TurboQuant, written in Rust with Python bindings
Rust · Python★ 16.2K↓ 76K/міс23 серп. 2026 р.
MIT23 серп. 2026 р. · метрики 2.10.0
PyPI
86Відміннийіндекс здоров'я
OpenNMT/CTranslate2
Fast inference engine for Transformer models
C++ · Python★ 4 645↓ 12.4M/міс27 серп. 2026 р.
MIT27 серп. 2026 р. · метрики 2.10.0
PyPI · npm
84Відміннийіндекс здоров'я
rajveer43/VeloxQuant-MLX
Fast KV-cache quantization for Apple Silicon (MLX) — 43 research-adapted compression methods with Metal kernels
Python★ 15↓ 7 549/міс5 вер. 2026 р.
MIT5 вер. 2026 р. · метрики 2.10.0
PyPI
83Відміннийіндекс здоров'я
google-ai-edge/ai-edge-quantizer
AI Edge Quantizer: flexible post training quantization for LiteRT models.
Python★ 192↓ 228.3K/міс28 серп. 2026 р.
Apache-2.028 серп. 2026 р. · метрики 2.10.0
PyPI
80Відміннийіндекс здоров'я
manjunathshiva/turboquant-mlx
Extreme weight + KV cache compression for LLMs on Apple Silicon (MLX implementation of Google's TurboQuant)
Python★ 83↓ 1 116/міс28 серп. 2026 р.
Власна ліцензія28 серп. 2026 р. · метрики 2.10.0
PyPI
80Відміннийіндекс здоров'я
mobilint/mblt-model-zoo
Mobilint Model Zoo Project
Python★ 231 серп. 2026 р.
BSD-3-Clause1 серп. 2026 р. · метрики 2.10.0
PyPI
78Добрийіндекс здоров'я
Sahil170595/Chimeraforge
PyPI capacity-planning CLI for LLM deployment. pip install chimeraforge.
Python★ 2↓ 2 506/міс22 серп. 2026 р.
MIT22 серп. 2026 р. · метрики 2.10.0
crates.io · npm · PyPI
78Добрийіндекс здоров'я
ohdearquant/lattice
Run, quantize, and fine-tune LLMs on Apple Silicon. Pure Rust, no Python, no CUDA, no ONNX
Rust · Python★ 40↓ 19.1K/міс22 серп. 2026 р.
Apache-2.022 серп. 2026 р. · метрики 2.10.0
PyPI · crates.io
77Добрийіндекс здоров'я
ahb-sjsu/turboquant-pro
Consumer-aware compression for embedding indexes and LLM KV caches — compress by the metric the downstream consumer actually uses. PCA-Matryoshka + TurboQuant (27x @ 99.8% recall@10), asymmetric K/V, CUDA/Triton kernels, vLLM plugin, replayable CI-gated claims. MIT.
Python★ 25↓ 277/міс5 вер. 2026 р.
MIT5 вер. 2026 р. · метрики 2.10.0
PyPI
77Добрийіндекс здоров'я
huggingface/optimum-quanto
A pytorch quantization backend for optimum
Python · Cuda★ 1 054↓ 300.3K/міс13 серп. 2026 р.
Apache-2.013 серп. 2026 р. · метрики 2.10.0
PyPI
71Добрийіндекс здоров'я
Comfy-Org/comfy-kitchen
Fast kernel library for Diffusion inference with multiple compute backends.
Python · Cuda★ 11718 лип. 2026 р.
Apache-2.018 лип. 2026 р. · метрики 2.10.0
PyPI
71Добрийіндекс здоров'я
asher/mlx-kquant
Native K-quant support for MLX, with a quantization and fine-tuning toolchain for Apple Silicon
C++ · Python★ 6↓ 3 360/міс23 серп. 2026 р.
MIT23 серп. 2026 р. · метрики 2.10.0
PyPI
71Добрийіндекс здоров'я
varjoranta/turboquant-vllm
TurboQuant+ KV cache compression for vLLM. 3.8x smaller KV cache, same conversation quality. Fused CUDA kernels with automatic PyTorch fallback.
Python · C++ · Cuda★ 76↓ 960/міс22 лип. 2026 р.
MIT22 лип. 2026 р. · метрики 2.10.0
PyPI · crates.io
63Помірнийіндекс здоров'я
FedericoTs/quantprobe
Run a 110B on a 2016 PC with 16 GB RAM. Know your tok/s before you download. Placement beats budget: predicts speed + memory fit for any GGUF on your exact hardware, self-calibrates, emits the exact llama.cpp command — or 'quantprobe auto' does it all. Falsification-tested laws; misses published at full size. pip install quantprobe
Python★ 86↓ 6 494/міс20 серп. 2026 р.
MIT20 серп. 2026 р. · метрики 2.10.0
PyPI
63Помірнийіндекс здоров'я
RobTand/gridbook
Out-of-tree vLLM plugin and open format spec for NVFP4-CB / FP8-CB product-codebook weights — 2-6 bit-per-weight LLM quantization served on native Blackwell tensor cores.
Python · Cuda★ 10↓ 2 218/міс15 серп. 2026 р.
Apache-2.015 серп. 2026 р. · метрики 2.10.0
PyPI
63Помірнийіндекс здоров'я
SYSTRAN/faster-whisper
Faster Whisper transcription with CTranslate2
Python★ 24.7K5 серп. 2026 р.
MIT5 серп. 2026 р. · метрики 2.10.0
PyPI
63Помірнийіндекс здоров'я
google-ai-edge/LiteRT-CLI
A convenient CLI to streamline LiteRT related development workflows, including converting, quantizing, compiling, managing, running, benchmarking and visualizing LiteRT (TFLite) models on various hardwares (CPU / GPU / NPU) across platforms (desktop, mobile or cloud).
Python★ 34↓ 80/міс15 лип. 2026 р.
Apache-2.015 лип. 2026 р. · метрики 2.10.0
PyPI
63Помірнийіндекс здоров'я
jagmarques/nexusquant
Training-free KV cache compression via E8 lattice VQ. 2-bit KV that preserves retrieval (30/30 NIAH vs TurboQuant 0/30). Calibration-free, 9 architectures validated.
Python★ 2516 лип. 2026 р.
Власна ліцензія16 лип. 2026 р. · метрики 2.10.0
npm
60Помірнийіндекс здоров'я
mkbabb/value.js
CSS value units for color, length, angles, & c.
TypeScript★ 0↓ 2 468/міс20 лип. 2026 р.
MIT20 лип. 2026 р. · метрики 2.10.0
PyPI
54Помірнийіндекс здоров'я
jjang-ai/jangq
JANG — GGUF for MLX. YOU MUST USE JANG_Q RUNTIME. Adaptive Mixed-Precision Quantization + Runtime for Apple Silicon
Python · Swift★ 21422 лип. 2026 р.
Без ліцензії22 лип. 2026 р. · метрики 2.10.0
PyPI · npm · crates.io
53Помірнийіндекс здоров'я
JunHwan-Kwon/deepbom
Local static analysis and evidence generation for deployed AI model artifacts
JavaScript · Rust★ 2↓ 3 094/міс4 вер. 2026 р.
Apache-2.04 вер. 2026 р. · метрики 2.10.0
PyPI
50Помірнийіндекс здоров'я
pjordanandrsn/experts4bit-qlora
QLoRA fine-tuning of fused 4-bit Mixture-of-Experts on a single small GPU (bitsandbytes Experts4bit)
Python★ 1↓ 2 064/міс1 серп. 2026 р.
Власна ліцензія1 серп. 2026 р. · метрики 2.10.0