Todas las etiquetas
Etiqueta del catálogo

#crawler

Todos los repositorios del registro público que llevan esta etiqueta, procedente de sus topics de GitHub o de las palabras clave que publican sus registros de paquetes. La salud se mide con la misma metodología versionada que el resto del registro.

86 registros
Con la etiqueta «crawler»Ordenado por índice de salud
npm
59Moderadoíndice de salud
brandonkramer/pi-scraper
Pi extension for fast page scraping, recursive crawling, URL/site mapping, brand extraction, content diffing, PDF text extraction, and deterministic vertical extraction.
TypeScript · HTML★ 7↓ 607/mes28 ago 2026
MIT28 ago 2026 · métricas 2.10.0
Packagist
57Moderadoíndice de salud
JayBizzle/Laravel-Crawler-Detect
A Laravel wrapper for CrawlerDetect - the web crawler detection library
PHP★ 324↓ 61.2K/mes28 jul 2026
MIT28 jul 2026 · métricas 2.10.0
PyPI
57Moderadoíndice de salud
codelucas/newspaper
newspaper3k is a news, full-text, and article metadata extraction in Python 3. Advanced docs:
Python★ 15.1K↓ 788.5K/mes12 ago 2026
MIT12 ago 2026 · métricas 2.10.0
Go
56Moderadoíndice de salud
x-way/crawlerdetect
Golang module to detect bots and crawlers via the user agent
Go★ 7017 jul 2026
MIT17 jul 2026 · métricas 2.10.0
npm
54Moderadoíndice de salud
codepurse/SEOCORE
Enterprise-grade, multi-threaded SEO Crawler, Rule Engine, and Link Graph Analyzer. Built in TypeScript for speed, compliance, and deep site health audits.
TypeScript★ 10917 jul 2026
MIT17 jul 2026 · métricas 2.10.0
PyPI
54Moderadoíndice de salud
tobybgy-lsd/web-agent-runtime-bench
Local-first failure diagnosis, auto collection, repair planning, AI handoff, and verification for Playwright, crawler, RPA, and agent workflows.
Python · JavaScript★ 1↓ 3325/mes26 jul 2026
Licencia propia26 jul 2026 · métricas 2.10.0
npm
51Moderadoíndice de salud
webscraping-ai/webscraping-ai-mcp-server
A Model Context Protocol (MCP) server implementation that integrates with WebScraping.AI for web data extraction capabilities.
JavaScript★ 44↓ 560/mes22 jul 2026
Sin licencia22 jul 2026 · métricas 2.10.0
Packagist · npm
50Moderadoíndice de salud
duzun/hQuery.php
An extremely fast web scraper that parses megabytes of invalid HTML in a blink of an eye. PHP5.3+, no dependencies.
PHP★ 360↓ 12.6K/mes29 jul 2026
MIT29 jul 2026 · métricas 2.10.0
Go
50Moderadoíndice de salud
mjc-gh/virgo
Convert a webpage into plaintext or markdown using the Chrome DevTool Protocol
Go · JavaScript★ 117 jul 2026
BSD-3-Clause17 jul 2026 · métricas 2.10.0
Go
50Moderadoíndice de salud
quantmind-br/repodocs
Go CLI for extracting websites, repositories, sitemaps, and package docs into structured Markdown
Go★ 025 ago 2026
MIT25 ago 2026 · métricas 2.10.0
crates.io
50Moderadoíndice de salud
spider-rs/spider_firewall
Firewall for Rust
Rust★ 1↓ 2668/mes16 jul 2026
MIT16 jul 2026 · métricas 2.10.0
npm · Go · PyPI
48Débilíndice de salud
AlphaTechini/doc-fetch
Dynamic documentation fetching CLI that converts entire documentation sites to single markdown files for AI/LLM consumption
Svelte · Go★ 1↓ 2547/mes27 jul 2026
Sin licencia27 jul 2026 · métricas 2.10.0
Packagist
42Débilíndice de salud
crawlbase/crawlbase-php
A lightweight, dependency free PHP class that acts as wrapper for Crawlbase API
PHP★ 16↓ 2779/mes15 jul 2026
Apache-2.015 jul 2026 · métricas 2.10.0
Packagist
41Débilíndice de salud
zorlan/skycaiji
蓝天采集器是一款开源免费的爬虫系统,仅需点选编辑规则即可采集数据,可运行在本地、虚拟主机或云服务器中,几乎能采集所有类型的网页,无缝对接各类CMS建站程序,免登录实时发布数据,全自动无需人工干预!是网页大数据采集软件中完全跨平台的云端爬虫系统
PHP★ 207827 jul 2026
Licencia propia27 jul 2026 · métricas 2.10.0
crates.io
39Débilíndice de salud
zekroTJA/r34-crawler
A simple CLI tool to fetch and download images from rule34.xxx
Rust★ 422 jul 2026
MIT22 jul 2026 · métricas 2.10.0
npm
36Débilíndice de salud
pavlealeksic/playwright-afp
Stop website fingerprinting techniques playwright edition
JavaScript★ 19↓ 4152/mes2 sept 2026
MIT2 sept 2026 · métricas 2.10.0
NuGet
35Débilíndice de salud
SoftCircuits/HtmlMonkey
Lightweight HTML/XML parser written in C#.
C#★ 6231 jul 2026
Licencia propia31 jul 2026 · métricas 2.10.0
PyPI
34En riesgoíndice de salud
scrapy/scrapy
Scrapy, a fast high-level web crawling & scraping framework for Python.
Python★ 63.8K12 ago 2026
BSD-3-Clause12 ago 2026 · métricas 2.10.0
npm
30En riesgoíndice de salud
hardbulls/wbsc-crawler
El repositorio no publica descripción.
TypeScript★ 1↓ 2234/mes25 jul 2026
Sin licencia25 jul 2026 · métricas 2.10.0
Maven
29En riesgoíndice de salud
code4craft/webmagic
A scalable web crawler framework for Java.
Java · HTML★ 11.7K27 ago 2026
Apache-2.027 ago 2026 · métricas 2.10.0
npm
29En riesgoíndice de salud
crawlbase/crawlbase-node
Fast dependency free library for Crawlbase API
JavaScript★ 919 jul 2026
Apache-2.019 jul 2026 · métricas 2.10.0
Go
28En riesgoíndice de salud
Synoppy/synoppy-go
Official Go SDK for Synoppy — the web-data layer for AI agents. Read, crawl, map, extract, classify & enrich any website on one key. Standard library only.
Go★ 128 jul 2026
MIT28 jul 2026 · métricas 2.10.0
Maven
23En riesgoíndice de salud
ssssssss-team/spider-flow
新一代爬虫平台,以图形化方式定义爬虫流程,不写代码即可完成爬虫。
Java★ 11.4K27 ago 2026
MIT27 ago 2026 · métricas 2.10.0
PyPI
22En riesgoíndice de salud
0-EternalJunior-0/GraphCrawler
Python бібліотека для сканування веб-сайтів та побудови графу їх структури.
Python · HTML★ 1↓ 4246/mes1 ago 2026
MIT1 ago 2026 · métricas 2.10.0
npm · PyPI
20En riesgoíndice de salud
88899/gitmen-lottery
彩票 数据 双色球 大乐透 快开 超级大乐透 预测 仅供学习
Python · JavaScript★ 927 jul 2026
Sin licencia27 jul 2026 · métricas 2.10.0
npm
20En riesgoíndice de salud
karthikuj/sasori
Sasori is a dynamic web crawler powered by Puppeteer, designed for lightning-fast endpoint discovery.
JavaScript★ 145↓ 78/mes4 ago 2026
MIT4 ago 2026 · métricas 2.10.0