Wird meine Datei irgendwohin hochgeladen?
Nein. TrulyRedacted ist eine statische Website; es gibt keinen Server, der Ihre Datei empfangen könnte. Lesen, Erkennung, OCR, Gesichtserkennung, Schwärzen und Export laufen komplett im Browser-Tab. Sie können das im Netzwerk-Tab der DevTools prüfen oder nach dem Laden der Seite das WLAN ausschalten.
Ist es wirklich kostenlos? Wo ist der Haken?
Es gibt keinen Haken. Ohne Server, die Ihre Dateien verarbeiten, gibt es nichts, wofür wir Geld verlangen müssten. Kein Konto, kein Kontingent, kein Wasserzeichen. Wenn es Ihnen eine Stunde spart, können Sie dem Autor einen Kaffee spendieren.
Erkennt es Steuer-ID und Sozialversicherungsnummer?
Ja. Steuer-ID (Prüfziffer nach ISO 7064), Sozialversicherungsnummer (Prüfziffer der Rentenversicherung) und Krankenversichertennummer werden mit Prüfziffer erkannt; Personalausweis- und Reisepassnummern in der maschinenlesbaren Form ebenfalls, gedruckte Nummern neben einem Stichwort wie „Ausweis-Nr.“. Dazu kommen IBAN und Kartennummern. Kennungen aus über 20 weiteren Ländern sind ebenfalls enthalten - siehe nächste Frage.
Kennungen welcher Länder werden unterstützt?
Derzeit aus 22 Ländern. Deutschland: Steuer-ID, Sozialversicherungsnummer, Krankenversichertennummer, Personalausweis, Reisepass. Österreich: Sozialversicherungsnummer. Schweiz: AHV-Nummer. Polen: PESEL, NIP, REGON, Personalausweis, Reisepass, Grundbuchnummer. Vereinigtes Königreich: National-Insurance-Nummer, NHS-Nummer, UTR, Reisepass, Führerschein. USA: Social Security Number, ITIN, Medicare-Nummer, Reisepass. Dazu Ukraine, Tschechien und Slowakei (Geburtsnummer), Niederlande (BSN), Belgien, Schweden, Dänemark (CPR), Finnland, Norwegen, Litauen, Rumänien (CNP), Portugal (NIF), Irland (PPSN), Spanien (DNI/NIE), Italien (codice fiscale) und Frankreich (NIR). Wo ein Land eine Prüfziffer definiert, wird sie geprüft; Anschriften werden in den Formaten aller 22 Länder erkannt.
Wie genau ist die Erkennung?
Gemessen an einem verblindeten Testsatz, der vor dem Test der finalen Engine erstellt und eingefroren wurde: 84 realistische Dokumente (Tabellen und Listen, Briefe und Bescheide, Verträge, Formulare, Gerichtsdokumente, E-Mails; 50 % Polnisch, 20 % Englisch, 15 % Deutsch, 15 % zehn weitere Sprachen) mit 1.533 personenbezogenen Angaben. In PDFs mit Textebene hat TrulyRedacted 88,7 % davon automatisch zum Schwärzen vorausgewählt (95-%-Konfidenzintervall 84,5–92,5 %) und einschließlich Vorschlägen 90,8 % gefunden (87,8–93,8 %); 98,4 % der Markierungen waren tatsächlich personenbezogene Daten (97,0–99,4 %). Scans sind schwieriger: Auf 12 echten Scans (271 Angaben, kleine Stichprobe) wurden 64 % gefunden — 90 % in Briefen, 69 % in Tabellen, 10 % in Kästchenformularen. Die automatische Erkennung kann etwas übersehen: Prüfen Sie die Fundstellen immer vor der Veröffentlichung.
Was ist mit gescannten Dokumenten?
Gescannte Seiten haben keine Textebene, deshalb führt TrulyRedacted im Browser eine OCR aus (Tesseract; Deutsch, Englisch und Polnisch) und durchsucht dann den erkannten Text. Tabellen werden Zeile für Zeile rekonstruiert, Linien von Formularfeldern vor der Erkennung entfernt. Scans in schlechter Qualität und Kästchenformulare können trotzdem Zeichen vor jeder OCR verbergen (siehe „Wie genau ist die Erkennung?“) - Sie können jederzeit einen ganzen Bereich von Hand markieren.
Wird der Text entfernt oder nur überdeckt?
Er wird entfernt. Seiten mit Schwärzungen werden als Bilder neu aufgebaut, sodass die ursprünglichen Zeichen aus der Datei verschwinden; Metadaten, Anhänge, Kommentare, Formularfelder und Lesezeichen werden entfernt. Das Dokument-Röntgen zeigt Ihnen vorab, welche versteckten Daten die Datei enthält. Ein über Text gezeichnetes Rechteck - der klassische Fehler - kommt hier nicht vor.
Kann ich das Ergebnis überprüfen?
Ja, automatisch. Nach dem Export wird die Ausgabe erneut geöffnet und nach jedem geschwärzten Wert durchsucht; das Ergebnis erscheint als „Geprüft — 0 Datenlecks“ oder als Liste der Seiten, die nachgebessert werden müssen. Exportierte Bilder werden genauso geprüft (Metadaten und jeder Bereich), Videos erneut nach noch sichtbaren Gesichtern und Kennzeichen durchsucht. Außerdem können Sie einen Prüfbericht (CSV, JSON oder HTML) herunterladen, der jede Schwärzung nach Typ und Seite auflistet - beim Stapelexport als gemeinsamer Bericht im ZIP.
Funktioniert es mit Video und Audio?
Video ja: Gesichter und Kennzeichen werden erkannt, über Frames hinweg verfolgt und weichgezeichnet oder verpixelt; für alles andere können Sie manuelle Bereiche setzen und MP4 oder WebM exportieren. Die Original-Tonspur bleibt erhalten oder wird stummgeschaltet; gesprochene Namen werden nicht überpiept. Jeder Export wird erneut nach noch sichtbaren Gesichtern und Kennzeichen durchsucht. Auf 5 echten Clips (1.905 Frames) wurden Gesichter in 95 % von 1.699 Referenz-Gesichtsboxen maskiert und Kennzeichen in 97 % von 64 Kennzeichenboxen - bei Kennzeichen eine kleine Stichprobe.
Welche Browser werden unterstützt?
Dokumente funktionieren in aktuellen Versionen von Chrome, Edge, Firefox und Safari. Der Videoexport braucht einen WebCodecs-Videoencoder - nutzen Sie Chrome oder Edge auf einem Desktop-Computer; andere Browser können ein Video trotzdem in der Vorschau anzeigen und prüfen. Die App sagt Ihnen klar, wenn eine Funktion nicht verfügbar ist, statt still zu scheitern.
Ist das eine rechtswirksame Anonymisierung nach DSGVO?
Für eine veröffentlichte Kopie ist es Schwärzen, was die Verordnung als Pseudonymisierung behandelt, solange das Original bei Ihnen bleibt (Erwägungsgrund 26, EDSA-Leitlinien zur Pseudonymisierung). Genau das brauchen IFG-Auskünfte und veröffentlichte Gerichtsentscheidungen. Eine echte Anonymisierung eines Datensatzes ist eine weitergehende Frage, die kein einzelnes Tool versprechen kann.
Kann ich es für IFG-Auskünfte oder Gerichtsveröffentlichungen nutzen?
Das ist der Hauptanwendungsfall. Die Voreinstellungen „Behörden“ und „Gerichte und Kanzleien“ wählen die Kategorien, die solche Veröffentlichungen üblicherweise brauchen; für Urteile ersetzen einheitliche Pseudonyme („Person A“) die Namen. Der Prüfbericht dokumentiert, was entfernt wurde. Die Trefferliste muss trotzdem ein Mensch prüfen - die automatische Erkennung unterstützt, sie entscheidet nicht.