Todas las etiquetas
Etiqueta del catálogo

#tokenization

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

7 registros
Con la etiqueta «tokenization»Ordenado por índice de salud
npm
71Buenoíndice de salud
toon-format/toon
🎒 Token-Oriented Object Notation (TOON) – Compact, human-readable, schema-aware JSON for LLM prompts. Spec, benchmarks, TypeScript SDK.
TypeScript★ 24.9K19 jul 2026
MIT19 jul 2026 · métricas 1.13.0
PyPI · npm
69Moderadoíndice de salud
explosion/spaCy
💫 Industrial-strength Natural Language Processing (NLP) in Python
Python · MDX · Cython★ 33.7K↓ 22M/mes17 jul 2026
MIT17 jul 2026 · métricas 1.13.0
Go
58Moderadoíndice de salud
ron2111/omnitoken
Pure-Go LLM tokenizer and tiktoken-compatible token counter for OpenAI BPE, WordPiece, SentencePiece, Gemini, Llama, Mistral, and Hugging Face adapters.
Go★ 615 jul 2026
MIT15 jul 2026 · métricas 1.13.0
Go
54Moderadoíndice de salud
chadsr/ollamatokenizer
Ollama's internal tokenization as API endpoints.
Go★ 1↓ 0/mes14 jul 2026
MIT14 jul 2026 · métricas 1.13.0
crates.io
53Moderadoíndice de salud
bio-rs/bio-rs
AI-ready biological data I/O, validation, and tokenization engine
Rust · Python★ 315 jul 2026
Licencia propia15 jul 2026 · métricas 1.13.0
PyPI · crates.io
50Moderadoíndice de salud
marcelroed/gigatoken
Language model tokenization at GB/s
Rust · Python★ 115↓ 2741/mes22 jul 2026
MIT22 jul 2026 · métricas 1.13.0
PyPI
48En riesgoíndice de salud
OpenVoiceOS/quebra_frases
chunks strings into byte sized pieces
Python★ 121 jul 2026
Apache-2.021 jul 2026 · métricas 1.13.0