Усі теги
Тег каталогу

#crawling

Усі репозиторії публічного реєстру з цим тегом — із тем GitHub або ключових слів, які публікують їхні реєстри пакетів. Здоров'я вимірюється за тією ж версіонованою методологією, що й решта реєстру.

22 записи
З тегом «crawling»Упорядковано за індексом здоров'я
npm
98Винятковийіндекс здоров'я
apify/crawlee
Crawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.
TypeScript · MDX★ 25.2K↓ 6M/міс5 серп. 2026 р.
Apache-2.05 серп. 2026 р. · метрики 2.10.0
PyPI · npm
98Винятковийіндекс здоров'я
apify/crawlee-python
Crawlee—A web scraping and browser automation library for Python to build reliable crawlers. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Parsel, BeautifulSoup, Playwright, and raw HTTP. Both headful and headless mode. With proxy rotation.
Python · MDX★ 9 42612 серп. 2026 р.
Apache-2.012 серп. 2026 р. · метрики 2.10.0
PyPI · npm
97Винятковийіндекс здоров'я
apify/apify-client-python
Apify API client for Python—Programmatically run Actors, manage and stream data from storages (datasets, key-value stores, request queues), schedule and monitor runs, and access the full Apify platform API. Sync and async interfaces with automatic retries and pagination.
Python★ 97↓ 2.8M/міс27 серп. 2026 р.
Apache-2.027 серп. 2026 р. · метрики 2.10.0
PyPI
94Винятковийіндекс здоров'я
D4Vinci/Scrapling
🕷️ An adaptive Web Scraping framework that handles everything from a single request to a full-scale crawl!
Python★ 72.6K4 серп. 2026 р.
BSD-3-Clause4 серп. 2026 р. · метрики 2.10.0
Packagist · Hex · crates.io +2
94Винятковийіндекс здоров'я
firecrawl/firecrawl
The context API to search, scrape, and interact with the web at scale. 🔥
TypeScript · Python★ 161K↓ 3 278/міс4 серп. 2026 р.
AGPL-3.04 серп. 2026 р. · метрики 2.10.0
NuGet
92Відміннийіндекс здоров'я
hardkoded/puppeteer-sharp
Headless Chrome .NET API
C#★ 3 91628 серп. 2026 р.
MIT28 серп. 2026 р. · метрики 2.10.0
npm · PyPI
89Відміннийіндекс здоров'я
webrecorder/browsertrix-crawler
Run a high-fidelity browser-based web archiving crawler in a single Docker container
TypeScript★ 1 11724 серп. 2026 р.
AGPL-3.024 серп. 2026 р. · метрики 2.10.0
npm
86Відміннийіндекс здоров'я
getmaxun/maxun
🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥
TypeScript★ 17K↓ 952/міс5 серп. 2026 р.
AGPL-3.05 серп. 2026 р. · метрики 2.10.0
PyPI
81Відміннийіндекс здоров'я
linkchecker/linkchecker
check links in web documents or full websites
Python★ 1 067↓ 248.6K/міс30 лип. 2026 р.
GPL-2.030 лип. 2026 р. · метрики 2.10.0
PyPI · npm
80Відміннийіндекс здоров'я
ArchiveBox/abx-dl
⬇️ A simple all-in-one CLI tool to download EVERYTHING from a URL (like youtube-dl/yt-dlp, forum-dl, gallery-dl, simpler ArchiveBox). 🎭 Uses headless Chrome to get HTML, JS, CSS, images/video/audio/subtitles, PDFs, screenshots, article text, git repos, and more...
Python★ 130↓ 9 160/міс19 лип. 2026 р.
MIT19 лип. 2026 р. · метрики 2.10.0
npm · crates.io · Packagist +1
78Добрийіндекс здоров'я
xberg-io/crawlberg
High-performance web crawling engine with bindings for 11 languages
Rust★ 149↓ 685/міс1 серп. 2026 р.
MIT1 серп. 2026 р. · метрики 2.10.0
77Добрийіндекс здоров'я
tryAGI/Firecrawl
Generated C# SDK based on official Firecrawl OpenAPI specification
C#★ 42 вер. 2026 р.
MIT2 вер. 2026 р. · метрики 2.10.0
PyPI
69Добрийіндекс здоров'я
adbar/courlan
Clean, filter and sample URLs to optimize data collection – Python & command-line – Deduplication, spam, content and language filters
Python★ 17721 лип. 2026 р.
Apache-2.021 лип. 2026 р. · метрики 2.10.0
PyPI
57Помірнийіндекс здоров'я
codelucas/newspaper
newspaper3k is a news, full-text, and article metadata extraction in Python 3. Advanced docs:
Python★ 15.1K↓ 788.5K/міс12 серп. 2026 р.
MIT12 серп. 2026 р. · метрики 2.10.0
Packagist · npm
50Помірнийіндекс здоров'я
duzun/hQuery.php
An extremely fast web scraper that parses megabytes of invalid HTML in a blink of an eye. PHP5.3+, no dependencies.
PHP★ 360↓ 12.6K/міс29 лип. 2026 р.
MIT29 лип. 2026 р. · метрики 2.10.0
Packagist
42Слабкийіндекс здоров'я
crawlbase/crawlbase-php
A lightweight, dependency free PHP class that acts as wrapper for Crawlbase API
PHP★ 16↓ 2 779/міс15 лип. 2026 р.
Apache-2.015 лип. 2026 р. · метрики 2.10.0
Packagist
42Слабкийіндекс здоров'я
firecrawl/firecrawl-php
Опис репозиторію не опубліковано.
PHP★ 2↓ 2 586/міс19 серп. 2026 р.
Без ліцензії19 серп. 2026 р. · метрики 2.10.0
Packagist
41Слабкийіндекс здоров'я
zorlan/skycaiji
蓝天采集器是一款开源免费的爬虫系统,仅需点选编辑规则即可采集数据,可运行在本地、虚拟主机或云服务器中,几乎能采集所有类型的网页,无缝对接各类CMS建站程序,免登录实时发布数据,全自动无需人工干预!是网页大数据采集软件中完全跨平台的云端爬虫系统
PHP★ 2 07827 лип. 2026 р.
Власна ліцензія27 лип. 2026 р. · метрики 2.10.0
PyPI
34У зоні ризикуіндекс здоров'я
scrapy/scrapy
Scrapy, a fast high-level web crawling & scraping framework for Python.
Python★ 63.8K12 серп. 2026 р.
BSD-3-Clause12 серп. 2026 р. · метрики 2.10.0
npm
29У зоні ризикуіндекс здоров'я
crawlbase/crawlbase-node
Fast dependency free library for Crawlbase API
JavaScript★ 919 лип. 2026 р.
Apache-2.019 лип. 2026 р. · метрики 2.10.0
Packagist
28У зоні ризикуіндекс здоров'я
roach-php/core
The complete web scraping toolkit for PHP.
PHP★ 1 455↓ 12K/міс27 лип. 2026 р.
Без ліцензії27 лип. 2026 р. · метрики 2.10.0
npm
20У зоні ризикуіндекс здоров'я
karthikuj/sasori
Sasori is a dynamic web crawler powered by Puppeteer, designed for lightning-fast endpoint discovery.
JavaScript★ 145↓ 78/міс4 серп. 2026 р.
MIT4 серп. 2026 р. · метрики 2.10.0