Öffentliches Register
Software-GesundheitsberichtSchema 0.31.0 · Metriken 2.10.0 · 2026-08-13 15:27 UTC

david-smejkal / wiki2txt

A tool to extract plain (unformatted) multilingual / language-agnostic text, redirects, links and categories from wikipedia backups (dumps). Designed to prepare clean training data for AI Training / Machine Learning software.

PythonGPL-2.0★ 7 Sterne⑂ 1 Forkseit Dez. 2021Auf GitHub ansehen ↗

david-smejkal/wiki2txt erreicht einen Gesundheitsindex von 28 von 100 und liegt damit im Bereich Gefährdet. Am stärksten schneidet es bei Engineering Quality (54/100) ab, am schwächsten bei Vitality (18/100). Zuletzt vor 500 Tagen aktualisiert. Ein einzelner Mitwirkender trägt den Großteil der jüngsten Arbeit.

28
gesamt / 100
Gefährdet

Software-Gesundheitsindex

Metriken werden auf einer standardisierten Skala von 1–100 in gewichtete Kategorien gruppiert. Der Gesamtwert beginnt als ihr gewichtetes Mittel, kalibriert auf die Verteilung des öffentlichen Registers, sodass die Stufen Perzentilbedeutung tragen; sobald öffentliche Evidenz die Richtlinie für Hochrisikojurisdiktionen auslöst, wird die Bewertung angepasst und erhält die Obergrenze Gefährdet von 34.

28
Außergewöhnlich93-100Die Spitzengruppe des Registers (≈ obere 5 %); erfüllt im Wesentlichen alle geprüften Kriterien
Exzellent80-92Durchgehend stark; geringfügige Lücken
Gut65-79Gesund; Lücken sind begrenzt und beherrschbar
Mittel50-64Akzeptabel mit deutlichen Lücken; Überprüfung empfohlen
Schwach35-49Wesentliche Schwächen in mehreren Bereichen
Gefährdet20-34Erhebliche Schwächen; eine Übernahme erfordert Vorsicht
Kritisch1-19Schwerwiegende Probleme (aufgegeben, nur ein Maintainer, keine Hygiene)
VitalitätCommunity &VerbreitungNachhaltigkeit &GovernanceEngineering-QualitätSicherheitAI Readiness

Bewertungsprofil

Jede Achse ist eine Kategorie. Die Form zählt mehr als der Durchschnitt — ein gesundes Projekt füllt die gesamte Fläche, während ein Profil aus Spitzen und Kratern bedeutet, dass Stärke in einer Dimension Risiken in einer anderen verdeckt.

Der gewichtete Gesamtwert 34 wird auf der veröffentlichten Indexskala auf 28 kalibriert (Register-Kalibrierung 2026-08-02).

Eigentümerschaft

David SmejkalPersönliches Konto
1 Follower8 öffentliche Reposseit Nov. 2021

Dieses Repository gehört einem persönlichen Konto. Ein Projekt mit nur einem Eigentümer trägt ein höheres Kontinuitätsrisiko als ein organisationsgetragenes.

Metriken nach Kategorie

Vitalität

Lebt das Projekt — wird Code geschrieben und werden Releases ausgeliefert?

18Kritisch · 21 % des Gesamtindex
Wie die Bewertung erfolgt
0/36Push-Aktualitätletzter Push vor 500 Tagen
0/36Commit-Rhythmus0/52 Wochen mit Commits
0/18Commit-Volumen0 Commits im letzten Jahr
0/10OpenSSF Scorecard: Maintainedkeine Daten
Verwendete Eingangsdaten
commits_last_year0
human_commit_share1
days_since_last_push500
active_weeks_last_year0
Wie die Bewertung erfolgt
27/27Liefert Releases aus3 Releases veröffentlicht
7.2/36Release-Aktualitätletztes Release vor 503 Tagen
5.4/27Release-Rhythmusein Release etwa alle 604 Tage
0/10OpenSSF Scorecard: Signed-Releaseskeine Daten
Verwendete Eingangsdaten
releases_count3
latest_release_tagv0.7.0
releases_from_tagsnein
days_since_latest_release503
mean_days_between_releases604

Community & Verbreitung

Hat das Projekt Nutzer, Downloads, Aufmerksamkeit und ein einladendes Umfeld für Beitragende?

30Gefährdet · 17 % des Gesamtindex
Wie die Bewertung erfolgt
12.6/60Stars7 Stars
0/25Forks1 Forks
0/15Watcher2 Watcher
Verwendete Eingangsdaten
forks1
stars7
watchers2
growth_stateunverified
growth_factor_pct100
growth_unverified_reasonno_history
Wie die Bewertung erfolgt
22.5/22.5README
22.5/22.5Lizenzanerkannte Lizenz (GPL-2.0)
0/18CONTRIBUTING-Leitfaden
0/13.5Verhaltenskodex
0/7.2Issue-Vorlage
0/6.3PR-Vorlage
Verwendete Eingangsdaten
has_readmeja
has_licenseja
readme_badges0
has_contributingnein
has_issue_templatenein
has_code_of_conductnein
readme_badge_services
has_pull_request_templatenein

Nachhaltigkeit & Governance

Überdauert das Projekt die Menschen, die es tragen — Bus-Faktor, Reaktionsfähigkeit, Trägerschaft und Paketpflege?

47Schwach · 23 % des Gesamtindex
Wie die Bewertung erfolgt
9/54Bus-Faktor1 Beitragende decken die Hälfte aller Commits ab
0/22.5Commit-Verteilungwichtigste beitragende Person verfasste 100 % der Commits
1.4/13.5Breite der Beitragenden1 Beitragende
0/10OpenSSF Scorecard: Contributorskeine Daten
Verwendete Eingangsdaten
bus_factor1
contributors_sampled1
top_contributor_share1
Wie die Bewertung erfolgt
42/42Issue-Lösungsquote100 % der Issues geschlossen
0/30PR-Annahmekeine entschiedenen Pull Requests oder keine Daten
0/13Newcomer PR acceptancekein PR eines Erstbeitragenden in 30 Tagen entschieden
0/15OpenSSF Scorecard: Code-Reviewkeine Daten
Verwendete Eingangsdaten
merged_prs0
open_issues0
closed_issues1
prs_merged_7d0
prs_decided_7d0
prs_merged_30d0
prs_decided_30d0
issue_closed_ratio1
closed_unmerged_prs0
first_time_authors_30d0
first_time_prs_merged_30d0
first_time_prs_decided_30d0
Von der Bewertung ausgeschlossen (keine Daten oder nicht anwendbar): PR-Annahme, Newcomer PR acceptance. Die verbleibenden Gewichte wurden renormalisiert.
Wie die Bewertung erfolgt
10/30Organisatorische Trägerschaftpersönliches (Nutzer-)Konto
0/20Verifizierte Domainfür Nutzerkonten nicht anwendbar
2.2/25Reichweite des Inhabers1 Follower von david-smejkal
16.4/25Kontohistorie8 öffentliche Repos, Kontoalter ca. 4 Jahre
Verwendete Eingangsdaten
followers1
owner_typeUser
is_verified
owner_logindavid-smejkal
public_repos8
account_age_days1.718
Von der Bewertung ausgeschlossen (keine Daten oder nicht anwendbar): Verifizierte Domain. Die verbleibenden Gewichte wurden renormalisiert.

Engineering-Qualität

Sind grundlegende Engineering- und Dokumentationspraktiken vorhanden?

54Mittel · 19 % des Gesamtindex
Wie die Bewertung erfolgt
0/24CI-Workflows
24/24Tests vorhanden
16/16Linter-Konfigurationtox.ini
0/9.6Pre-Commit-Hooks
0/6.4.editorconfig
0/20OpenSSF Scorecard: CI-Testskeine Daten
Verwendete Eingangsdaten
has_cinein
has_testsja
has_editorconfignein
has_linter_configja
has_precommit_confignein
Wie die Bewertung erfolgt
30/30README
0/25Dokumentationsverzeichnis
0/15Dokumentations-/Homepage-Site
10/10Repository-Beschreibung
10/10Topics20 Topics
10/10Wiki
Verwendete Eingangsdaten
topicswiki-to-txt, wiki-to-text, wiki-to-plaintext, wikidump-to-txt, wikidump-to-plaintext, wiki-parser, wikidump-parser, ai-learning-tool, tool-for-ai, wikidumps-parser, wiki2plaintext, ai-learning, data-parser-for-ai, data-for-robots, plaintext-data-for-ai, wikipedia-to-txt, machine-learning-tool, machine-learning, training-data, ai-training
has_wikija
homepage
docs_site
has_readmeja
has_docs_dirnein
has_descriptionja

Sicherheit

Sind die sichtbaren Sicherheits- und Lieferkettenpraktiken belastbar, ohne ungeklärte Exposition gegenüber Hochrisikojurisdiktionen?

21Gefährdet · 16 % des Gesamtindex
Wie die Bewertung erfolgt
0/30Sicherheitsrichtlinie (SECURITY.md)
0/25Dependabot-Konfiguration
0/25Lockfiles für Abhängigkeiten
0/20CodeQL-Workflow
Verwendete Eingangsdaten
sourcefile_signals
lockfiles
manifestsrequirements-frozen.txt, requirements-test.txt, requirements.txt
has_codeql_workflownein
has_security_policynein
has_dependabot_confignein

Abhängigkeits-Advisories

100Außergewöhnlich
Wie die Bewertung erfolgt
35/35Direkte Abhängigkeiten ohne bekannte Advisorieskeine direkte Abhängigkeit trägt ein bekanntes Advisory
0/25Indirekte Abhängigkeiten ohne bekannte Advisoriestransitive Menge in diesem Bereich nicht von Entwicklungs- und Test-Abhängigkeiten trennbar
0/40Keine offenen Advisorieskein Advisory trägt ein Veröffentlichungsdatum
Verwendete Eingangsdaten
sourceosv
advisories10
affected_packages4
assessed_packages15
unassessed_packages4
affected_by_severityhigh 1, moderate 3
direct_affected_packages0
Von der Bewertung ausgeschlossen (keine Daten oder nicht anwendbar): Indirekte Abhängigkeiten ohne bekannte Advisories, Keine offenen Advisories. Die verbleibenden Gewichte wurden renormalisiert. 15 aufgelöste Abhängigkeiten wurden mit OSV abgeglichen. 4 konnten nicht bewertet werden — keine aufgelöste Version, ein nicht unterstütztes Ökosystem oder außerhalb der ausgewiesenen Paketliste. Dieses Repository veröffentlicht kein Paket, das der Index auflöst; bewertet wurde daher der Abhängigkeitsgraph des Repositorys. Dieser Graph vermischt Entwicklungs- und Test-Pins mit ausgelieferten Abhängigkeiten, daher werden nur die deklarierten Laufzeit-Abhängigkeiten bewertet; transitive Befunde werden als Kontext ausgewiesen und fließen nicht in die Bewertung ein. Erreichbarkeit wird nicht analysiert.

AI Readiness

Wie gut ist das Repository dafür ausgestattet, mit KI-Coding-Agenten entwickelt und gepflegt zu werden? Trägt ein bewusst kleines Gewicht (4 %): Agenten-Tooling ist ein echtes Pflegesignal, doch ein Repository ohne jedes Signal kann weiterhin 100/100 erreichen.

27Gefährdet · 4 % des Gesamtindex
Wie die Bewertung erfolgt
0/45Agentenanweisungenkeine CLAUDE.md / AGENTS.md / Editor-Regeln
0/15Maschinenlesbare Doku (llms.txt)
1.1/40Lesbare Commit-Historie2 von 100 menschlichen Commits benennen ihre Absicht (strukturierter Betreff oder erläuternder Text)
Verwendete Eingangsdaten
has_llms_txtnein
llms_txt_url
legible_history_share0,02
agent_instruction_files
agent_instruction_max_bytes
Wie die Bewertung erfolgt
0/18Bootstrap mit einem Befehl
22/22Automatisierte Tests
11/11Lint-/Format-Konfigurationtox.ini
0/11Statische Typprüfung
0/10Reproduzierbare Umgebung
0/10Belegte Agentenpraxiskeine von Agenten verfassten Commits unter den letzten 100
0/8Automatisierte Wartungkeine automatisierten Abhängigkeits-Updates beobachtet
0/10OpenSSF Scorecard: Pinned-Dependencieskeine Daten
Verwendete Eingangsdaten
has_nixnein
has_testsja
lockfiles
has_dockerfilenein
typed_languagenein
bootstrap_files
has_devcontainernein
has_linter_configja
typecheck_configs
agent_commit_share0
toolchain_manifests
dependency_bot_commit_share0
Wie die Bewertung erfolgt
0/45Typprüfbarer CodePython ohne Typprüfungs-Konfiguration
55/55Handhabbare Dateigrößen0/9 Quelldateien über 60 KB
Verwendete Eingangsdaten
primary_languagePython
largest_source_bytes43.396
source_files_sampled9
oversized_source_files0

Eckdaten

7GitHub-Sterne
1Mitwirkende
0Commits, letzte 12 Monate
500Tage seit letztem Push
3Releases
1Bus-Faktor
0offene Issues
PyPIPaket-Ökosysteme

Warnungen zur Datenerhebung

  • Star history unavailable: GitHub GraphQL error: Resource not accessible by personal access token
  • OpenSSF Scorecard timed out after 240s; skipping Scorecard checks

Weitere Details

Alle Abhängigkeiten 19

Vollständig aufgelöster Abhängigkeitssatz aus dem GitHub-Abhängigkeitsgraphen: 0 direkte und 19 indirekte (transitive) Pakete. Die transitive Hülle ist vollständig, wenn das Repository eine Lockfile eincheckt.

RegistryPaketVersionBeziehung
PyPIcachetools5.5.2indirekt
PyPIchardet5.2.0indirekt
PyPIcolorama0.4.6indirekt
PyPIdistlib0.3.9indirekt
PyPIfilelock3.18.0indirekt
PyPIiniconfig2.1.0indirekt
PyPIlxmlindirekt
PyPIlxml5.3.1indirekt
PyPIpackaging24.2indirekt
PyPIplatformdirs4.3.7indirekt
PyPIpluggy1.5.0indirekt
PyPIpyproject-api1.9.0indirekt
PyPIpytestindirekt
PyPIpytest8.3.5indirekt
PyPIregexindirekt
PyPIregex2024.11.6indirekt
PyPItoxindirekt
PyPItox4.25.0indirekt
PyPIvirtualenv20.29.3indirekt
Abhängigkeits-Advisories 4

Dieses Repository veröffentlicht kein vom Index auflösbares Paket, daher wurde sein eigener Abhängigkeitsgraph bewertet – 15 Pakete, darunter auch Entwicklungs- und Test-Pins, die nie ausgeliefert werden: 4 tragen bekannte Advisories, davon 0 direkte. 4 konnten nicht bewertet werden – keine aufgelöste Version, ein nicht unterstütztes Ökosystem, oder außerhalb der ausgewiesenen Paketliste.

PaketVersionBeziehungSchweregradAdvisoriesBehoben in
lxml5.3.1indirekthoch26.1.0
filelock3.18.0indirektmittel43.20.3
pytest8.3.5indirektmittel29.0.3
virtualenv20.29.3indirektmittel220.36.1

Ein Advisory bedeutet, dass die im Abhängigkeitsgraphen erfasste Version in den betroffenen Bereich eines Advisories fällt. Erreichbarkeit wird nicht analysiert, und der Graph enthält Entwicklungs- und Test-Pins — ein Fund kann das Werkzeug betreffen und nicht die ausgelieferte Software.

JSON-Rohbericht maschinenlesbar

Feedback

Stimmt etwas in diesem Bericht nicht, oder gibt es Gedanken dazu? Falsche Messungen, übersehene Tools, Ideen, Fragen — alles ist willkommen. Jede Nachricht wird gelesen und beantwortet.

Die Nachricht bleibt bei der Anmeldung erhalten.

Bewertungen sind Signale, keine Garantien. Sie spiegeln öffentlich sichtbare Praxis auf GitHub wider — kein Code-Audit und keine Sicherheitsgarantie.

Fehlende Daten werden ausgeschlossen und die Gewichte neu normiert, nie als null bewertet. Die Methodik ist versioniert und offen: Metriken v2.10.0, Schema v0.31.0 — vollständige Methodik · Metriken-Wiki.

Wie ein einzelnes Ergebnis im Gesamtregister steht: aggregierte Statistiken.