Lokale Pseudonymisierung oder Cloud: die Abwägung

Kein Upload. Kein Server. Die Daten verlassen Ihr Gerät nicht.

Die lokale Verarbeitung hat einen eindeutigen Vorteil und einen ebenso eindeutigen Preis. Beides gehört auf denselben Tisch — eine Seite, die nur den Vorteil nennt, hilft bei der Entscheidung nicht.

Der Vorteil: kein Vertrauensvorschuss nötig

Wer Dokumente an einen Cloud-Dienst gibt, muss dessen Zusagen glauben — zu Löschfristen, Zugriffsrechten, Protokollierung, Weiterverarbeitung. Diese Zusagen können zutreffen, aber überprüfen lassen sie sich von außen nicht.

Läuft die Verarbeitung im Browser, entfällt die Frage. Nicht, weil der Anbieter vertrauenswürdiger wäre, sondern weil es nichts zu vertrauen gibt: Was nicht übertragen wird, kann auch nicht falsch behandelt werden. Und anders als eine Zusage lässt sich das Ausbleiben der Übertragung nachprüfen — im Netzwerk-Tab des Browsers, in dreißig Sekunden. Wie das geht, steht auf der Seite Keine Daten an die KI senden.

Der Preis: keine Server-KI für die Erkennung

Hier liegt die eigentliche Abwägung, und sie fällt nicht durchgehend zugunsten der lokalen Variante aus.

Eine Cloud-Lösung kann für die Erkennung ein großes Sprachmodell einsetzen. Ein solches Modell erschließt Personennamen aus dem Sinnzusammenhang — es erkennt einen seltenen Nachnamen auch dann, wenn keine Anrede davorsteht, und versteht, dass in einem bestimmten Satz eine Ortsangabe gemeint ist. Diese Fähigkeit steht lokal nicht zur Verfügung: Ein vergleichbares Modell im Browser bedeutete einen Download von mehreren Gigabyte und entsprechende Hardwareanforderungen.

Die lokale Erkennung arbeitet deshalb mustergestützt. Sie stützt sich auf drei Signale:

Wo welcher Ansatz stärker ist

Art der AngabeMustererkennung (lokal)Sprachmodell (Cloud)
IBAN, SVNr, Firmenbuchnummer, ZVR stärker — Prüfsumme ist rechenbar, kein Raten schwächer, kann formatgleiche Zahlen verwechseln
Name mit Anrede oder Titel davor zuverlässig zuverlässig
Seltener Name ohne jeden Hinweis davor schwächer stärker — erschließt aus dem Zusammenhang
Angabe, die erst im Satzsinn personenbezogen wird schwächer stärker
Ungewöhnliche Schreibweise, Tippfehler schwächer stärker
Zusammengefasst: Bei allem, was einem Format folgt, ist die lokale Mustererkennung im Vorteil — und genau dort sitzen die heikelsten Angaben, weil Kennzahlen eine Person eindeutig bestimmen. Bei frei geschriebenem Fließtext mit ungewöhnlichen Namen ist ein Sprachmodell im Vorteil.

Wie die Lücke geschlossen wird

Drei Dinge federn die schwächere Seite ab, ohne den Grundsatz aufzugeben:

  1. Eigene Begriffe ergänzen. Was kein allgemeines Muster hat — interne Projektnamen, ungewöhnliche Bezeichnungen, wiederkehrende Namen —, lässt sich der Erkennung ausdrücklich mitgeben.
  2. Messung statt Vermutung. Die Erkennung wird laufend gegen einen gelabelten Testkorpus gemessen. Verschlechtert eine Änderung die Trefferquote, wird das sichtbar, statt unbemerkt zu bleiben.
  3. Durchsicht bleibt Teil des Verfahrens. Die erkannten Stellen sind hervorgehoben und einzeln prüfbar. Diese abschließende Kontrolle ist im Übrigen auch bei einem Sprachmodell nicht entbehrlich — auch das übersieht Angaben.

Ein lokales Modell für die eigentliche Aufgabe

Zu unterscheiden ist die Erkennung von der Aufgabe. Die Erkennung läuft immer lokal. Was anschließend mit dem bereinigten Text geschehen soll — zusammenfassen, umformulieren, übersetzen —, können Sie einem Cloud-Dienst übergeben oder einem Modell, das auf Ihrem eigenen Rechner läuft.

Die zweite Variante schließt den Kreis: Dann verlässt auch der pseudonymisierte Text das Gerät nicht mehr. Der Aufwand dafür ist höher — ein lokal betriebenes Modell will installiert und mit Rechenleistung versorgt werden —, und die Ergebnisqualität liegt je nach Modellgröße unter der großer Cloud-Modelle. Für besonders heikle Unterlagen kann das trotzdem die richtige Wahl sein.

Häufige Fragen

Erkennt eine Cloud-Lösung mit Sprachmodell mehr als eine lokale Mustererkennung?

Bei ungewöhnlich geschriebenen Namen und bei Angaben, die sich erst aus dem Sinnzusammenhang ergeben, in der Regel ja. Ein Sprachmodell erkennt einen seltenen Nachnamen auch ohne Anrede davor. Bei formatgebundenen Angaben — Sozialversicherungsnummer, IBAN, Firmenbuchnummer, Aktenzahl — liegt die Mustererkennung dagegen vorn, weil sie die Prüfsumme rechnen kann und nicht raten muss.

Warum nutzt dieses Werkzeug kein Sprachmodell für die Erkennung?

Weil ein leistungsfähiges Sprachmodell entweder auf einem Server laufen müsste — dann wäre der Klartext übertragen, was den Zweck aufhebt — oder lokal, was Downloads im Bereich mehrerer Gigabyte und entsprechende Hardware voraussetzt. Für ein Werkzeug, das ohne Installation im Browser starten soll, ist die mustergestützte Erkennung deshalb der gangbare Weg.

Kann ich trotzdem ein KI-Modell einbinden?

Ja, für die eigentliche Aufgabe — also das, was mit dem bereinigten Text geschehen soll. Sie können einen Cloud-Dienst konfigurieren oder ein lokal laufendes Modell auf dem eigenen Rechner ansprechen. In beiden Fällen geht nur der bereits pseudonymisierte Text hinaus; die Erkennung selbst bleibt davon unberührt und lokal.

Was bedeutet das für die Qualität in der Praxis?

Die Erkennung wird laufend gegen einen gelabelten Testkorpus gemessen, sodass Veränderungen sichtbar werden statt vermutet. Sie erreicht damit keine Vollständigkeit, und das wird auch nicht behauptet. Die abschließende Durchsicht durch Sie bleibt Bestandteil des Verfahrens — bei einer Cloud-Lösung mit Sprachmodell im Übrigen genauso.

Zu den Grenzen: Die Erkennung arbeitet mustergestützt und wird laufend gegen einen gelabelten Testkorpus gemessen. Sie kann ungewöhnlich geschriebene oder erst aus dem Zusammenhang erschließbare Angaben übersehen. Prüfen Sie das Ergebnis vor dem Versand an einen KI-Dienst immer selbst. Die Anwendung unterstützt datenschutzkonforme Abläufe, ersetzt aber keine Rechtsberatung.

Ohne Registrierung ausprobieren — Text einfügen, Ergebnis sofort sehen.

Zur Anwendung