Bran (Brandon) Myers
Recherche im öffentlichen Interesse · Die Software-Karte · June 2026

Das Splink-Ökosystem: jede App, die an dem Werkzeug hängt

Teil neun — die technische Karte. Nachdem nachgezeichnet ist, wer Splink nutzt und was daneben steht, beantwortet dieser Teil die Frage nach der Lieferkette: jede App, jede Bibliothek, jedes Backend und jedes System, das wirklich an Splink gebunden ist — und, klar abgegrenzt, damit die Karte nicht falsch gelesen werden kann, die Konkurrenten, die es nicht sind.

Kern von Splink
Splink-Bibliothek (v4)Fellegi–Sunter-EngineEM-TrainingEingebaute Diagramme / Visualisierungen
Offizielle MoJ-Begleitprojekte
splink_datasetssplink_graphsplink_udfs (DuckDB)splink_demoscluster_studiocomparison_vieweruk_address_matcherlive_splink (WASM im Browser)
Backends, auf denen es läuft
DuckDBApache SparkAWS AthenaPostgreSQLSQLite+ sqlglot · Altair · igraph · Jinja2
Abhängige Projekte / Forks
~110 GitHub-'Used by' (Obergrenze)op_splink (Antigranular)healmatcherTuva EMPIentifysplink_testing
Nutzer in der britischen Regierung
Data FirstSplink Master RecordJustLinkCore Person RecordNorth Essex: Dashboard PNC→PolizeiONS Business IndexONS-Zensus 2021 → NHS PDSNHS-England-Verknüpfung (in Entwicklung)
Von Dritten produktisiert (nur 2)
Databricks ARC (eingestellt)Antigranular op_splink
Herkunft (woraus es hervorgeht)
fastLink (R)Fellegi–Sunter (1969)'sparklink' (alter Name)
NICHT an Splink gebunden — Konkurrenten, die man stattdessen nutzt, & Namensgleichheiten
BigMatch (US Census)G-Link (StatCan)DALI (AIHW)ChoiceMaker (CHeReL)WA DLS3FEBRLDatavantMatch*Prodedupe / ZinggrecordlinkageQuantexaPalantir FoundrySenzing / Tamr / Reltiogoldenmatch (Benchmark dagegen)splink.io Zahlungs-AppSplunk (nur Namensgleichheit)
Das Splink-Ökosystem: große Reichweite, schmale echte Abhängigkeit, konzentriert in der britischen Regierung. ~890k Downloads/Monat, aber nur eine Handvoll offizieller Begleitprojekte, zwei echte Wrapper von Dritten und ~8 Regierungssysteme, die seine Ergebnisse nutzen. Alles im roten Kasten ist ein Konkurrent, der stattdessen genutzt wird — nicht auf Splink aufgebaut.

↗ Die vollständige Ökosystem-Karte lesen — 75 Einträge, jede Primärquelle (GitHub)

Große Reichweite, schmale Abhängigkeit

Splink wird rund 890.000 Mal pro Monat heruntergeladen (~19 Millionen insgesamt), und GitHubs Graph “Used by” nennt ~110 abhängige Repositories. Doch diese Zahl ist eine Obergrenze, die die Wahrheit schmeichelhafter aussehen lässt: Sie wirft Lockfile-Einträge, beiläufige Erwähnungen und Benchmarks von Konkurrenten in einen Topf. Das mit Abstand meistbeachtete “abhängige” Projekt, goldenmatch, hat überhaupt keine Splink-Abhängigkeit — es misst sich per Benchmark gegen Splink und bewirbt sich selbst als schneller. Der wirklich tragende Kern ist winzig.

Kern — 4: die Splink-Bibliothek, ihre Fellegi–Sunter-Engine, der EM-Trainer und die eingebauten Diagramme.

Offizielle MoJ-Begleitprojekte — ~10: splink_graph, splink_datasets, splink_udfs, die Dashboards cluster-studio und comparison-viewer, uk_address_matcher und ein WASM-Build für den Browser. Alle gebaut vom selben Team, das Splink gemacht hat.

Backends — es läuft auf DuckDB, Apache Spark, AWS Athena, PostgreSQL und SQLite (dazu die Laufzeitbibliotheken sqlglot, Altair, igraph).

Echte produktisierte Wrapper von Dritten — genau 2: Databricks ARC (inzwischen eingestellt) und Antigranulars op_splink mit differenzieller Privatsphäre. Das ist die gesamte kommerzielle Integrationsfläche.

Die eigentliche Fläche ist der Staat, nicht die Software

Das Folgenreichste, was an Splink gebunden ist, ist nicht anderer Code — es sind Regierungssysteme, die seine Ergebnisse nutzen. Mindestens acht: JustLink des MoJ, der Splink Master Record, das Echtzeit-Pilotprojekt Core Person Record, das Dashboard in North Essex zur Festnahmeerkennung von der Bewährungshilfe zur Polizei, die Forschungsdatensätze Data First von ADR UK / MoJ, der Business Index des ONS und dessen Verknüpfung Zensus 2021 → NHS PDS sowie der in Entwicklung befindliche Verknüpfungsdienst von NHS England. Dort liegt das Gewicht des Ökosystems — in der operativen Nutzung eines Statistikwerkzeugs an namentlich benannten Menschen —, genau der Faden, an dem diese Serie von Anfang an zieht.

Was NICHT an Splink gebunden ist

Weil Übersichten zur “Entity Resolution” alles in einen Topf werfen, kommt es auf die Abgrenzung an. Keines dieser Produkte bindet Splink ein, umhüllt es oder hängt von ihm ab — es sind Konkurrenten, die Regierungen und Unternehmen stattdessen nutzen: BigMatch des US Census, G-Link von StatCan, DALI des AIHW (das AIHW erwog Berichten zufolge, es durch Splink zu ersetzen — was bestätigt, dass es ein Konkurrent ist), ChoiceMaker, FEBRL, Datavant, Match*Pro, dedupe, Zingg, Quantexa (175 Mio. £ an Aufträgen der HMRC) und Palantir Foundry. Und die reinen Namensgleichheiten: splink.io, eine Zahlungs-App aus Dublin, und Splunk, das Log-Analyse-Produkt — beide haben nichts mit dem MoJ-Werkzeug zu tun.

Splink und das Python-Toolkit recordlinkage verwenden beide die mitgelieferten Demo-Datensätze von FEBRL — gemeinsame Beispieldaten, keine Code-Abhängigkeit. Das macht FEBRL nicht “an Splink gebunden”. Genau auf diese Unterscheidung kommt es an, wenn man ehrlich kartiert.

Methode: 6 Segmente des Ökosystems anhand von Primärquellen recherchiert (die GitHub-Organisation moj-analytical-services, die Splink-Dokumentation, PyPI, gov.uk), dann gegnerisch verifiziert — so wurden die aufgeblähten “110 Abhängigen” und das falsch eingeordnete goldenmatch entdeckt und korrigiert. 75 Einträge, jeder eingestuft und belegt. Vollständige Karte, Hinweise auf geringe Belastbarkeit und Quellen: GitHub.

← All recherchen