Czy mój plik jest gdzieś wysyłany?
Nie. TrulyRedacted to statyczna strona; nie ma serwera, który mógłby odebrać Twój plik. Odczyt, wykrywanie, OCR, detekcja twarzy, zaczernianie i eksport działają w karcie przeglądarki. Możesz to sprawdzić w zakładce Sieć narzędzi deweloperskich albo wyłączając Wi-Fi po załadowaniu strony.
Czy to naprawdę za darmo? Gdzie jest haczyk?
Nie ma haczyka. Skoro żadne serwery nie przetwarzają Twoich plików, nie ma za co pobierać opłat. Bez konta, bez limitu, bez znaku wodnego. Jeśli narzędzie oszczędzi Ci godzinę, możesz postawić autorowi kawę.
Czy znajdzie polskie identyfikatory, np. PESEL albo NIP?
Tak - właśnie po to powstało. PESEL, NIP, REGON, numery dowodu osobistego i paszportu oraz numery ksiąg wieczystych są sprawdzane sumą kontrolną; rachunki NRB, numery prawa jazdy (obok słowa kluczowego) i polskie formaty telefonów również są wykrywane. Numer KRS jest rozpoznawany, ale domyślnie wyłączony, bo dotyczy firmy, nie osoby. Obsługiwane są też identyfikatory z ponad 20 innych krajów - zob. następne pytanie.
Identyfikatory z jakich krajów są obsługiwane?
Obecnie z 22 krajów. Polska: PESEL, NIP, REGON, dowód osobisty, paszport, numer księgi wieczystej. Wielka Brytania: National Insurance number, NHS number, UTR, paszport, prawo jazdy. USA: Social Security number (SSN), ITIN, numer Medicare, paszport. Niemcy: Steuer-ID, numer ubezpieczenia społecznego, numer ubezpieczenia zdrowotnego, dowód osobisty, paszport. Do tego Ukraina, Austria, Szwajcaria (AHV), Czechy i Słowacja (rodné číslo), Holandia (BSN), Belgia, Szwecja, Dania (CPR), Finlandia, Norwegia, Litwa, Rumunia (CNP), Portugalia (NIF), Irlandia (PPSN), Hiszpania (DNI/NIE), Włochy (codice fiscale) i Francja (NIR). Tam, gdzie kraj definiuje cyfrę kontrolną, jest ona weryfikowana; adresy są rozpoznawane w formatach wszystkich 22 krajów.
Jak dokładne jest wykrywanie?
Zmierzyliśmy je na ślepym zbiorze testowym, przygotowanym i zamrożonym, zanim przetestowano ostateczną wersję silnika: 84 realistyczne dokumenty (tabele i wykazy, pisma i decyzje, umowy, formularze, pisma sądowe, e-maile; 50 % po polsku, 20 % po angielsku, 15 % po niemiecku, 15 % w dziesięciu innych językach) zawierające 1533 dane osobowe. W PDF-ach z warstwą tekstową TrulyRedacted automatycznie zaznaczył do zanonimizowania 88,7 % z nich (95-procentowy przedział ufności 84,5–92,5 %), a razem z sugestiami wskazał 90,8 % (87,8–93,8 %); 98,4 % oznaczonych fragmentów to rzeczywiście dane osobowe (97,0–99,4 %). Skany są trudniejsze: na 12 prawdziwych skanach (271 danych, mała próba) wykrył 64 % — 90 % w pismach, 69 % w tabelach, 10 % w formularzach z kratkami. Automat może coś przeoczyć: zawsze przejrzyj listę wyników przed publikacją.
A co ze skanami?
Zeskanowane strony nie mają warstwy tekstowej, więc TrulyRedacted uruchamia OCR (Tesseract: polski, angielski i niemiecki) w przeglądarce i przeszukuje rozpoznany tekst. Tabele są odtwarzane wiersz po wierszu, a linie pól formularza usuwane przed rozpoznawaniem. Skany niskiej jakości i formularze z kratkami wciąż mogą ukryć znaki przed każdym silnikiem OCR (zob. „Jak dokładne jest wykrywanie?”) - zawsze możesz zaczernić cały obszar ręcznie.
Czy tekst jest usuwany, czy tylko przykrywany?
Usuwany. Strony z zaczernieniami są budowane na nowo jako obrazy, więc oryginalne znaki znikają z pliku; metadane, załączniki, komentarze, pola formularzy i zakładki są usuwane. Prześwietlenie dokumentu pokaże Ci wcześniej, jakie ukryte dane zawiera plik. Prostokąt narysowany na tekście - klasyczna wpadka - tutaj nie ma miejsca.
Czy mogę sprawdzić wynik?
Tak, automatycznie. Po eksporcie wynik jest otwierany ponownie i przeszukiwany pod kątem każdej zaczernionej wartości; zobaczysz „Zweryfikowano — 0 wycieków” albo listę stron do poprawy. Wyeksportowane obrazy są sprawdzane tak samo (metadane i każde pole), a filmy ponownie skanowane pod kątem wciąż widocznych twarzy i tablic. Możesz też pobrać raport (CSV, JSON lub HTML) z listą wszystkich zaczernień według typu i strony - przy pracy wsadowej jako wspólny raport w ZIP-ie.
Czy działa na wideo i dźwięku?
Wideo tak: twarze i tablice rejestracyjne są wykrywane, śledzone między klatkami i rozmywane lub pikselizowane; możesz dodać ręczne pola na wszystko inne i wyeksportować MP4 lub WebM. Oryginalna ścieżka dźwiękowa jest zachowywana lub wyciszana; wypowiadane nazwiska nie są wycinane. Każdy eksport jest ponownie skanowany pod kątem wciąż widocznych twarzy i tablic. Na 5 prawdziwych nagraniach (1905 klatek) twarze zostały zamaskowane w 95 % z 1699 referencyjnych ramek twarzy, a tablice w 97 % z 64 ramek tablic - przy tablicach to mała próba.
Które przeglądarki są obsługiwane?
Dokumenty działają w aktualnych Chrome, Edge, Firefoksie i Safari. Eksport wideo wymaga kodera wideo WebCodecs - użyj Chrome lub Edge na komputerze; w innych przeglądarkach nadal możesz obejrzeć i przejrzeć nagranie. Aplikacja jasno informuje, gdy funkcja jest niedostępna, zamiast po cichu zawieść.
Czy to legalna anonimizacja w rozumieniu RODO?
Dla publikowanej kopii to anonimizacja publikacyjna, którą rozporządzenie traktuje jak pseudonimizację, gdy oryginał zostaje u Ciebie (motyw 26, wytyczne EROD w sprawie pseudonimizacji). Dokładnie tego oczekuje praktyka BIP i orzecznictwo sądów administracyjnych. Pełna anonimizacja zbioru danych to szersze zagadnienie, którego żadne pojedyncze narzędzie nie może obiecać.
Czy mogę używać tego do publikacji na BIP lub orzeczeń?
To główny scenariusz. Ustawienia wstępne „Urzędy (BIP)” i „Sądy i kancelarie” wybierają kategorie zwykle wymagane przy takich publikacjach; w orzeczeniach nazwiska zastępują spójne pseudonimy („Osoba A”). Raport daje Ci zapis tego, co zaczerniono. Listę wykrytych danych nadal musi przejrzeć człowiek - automatyczne wykrywanie wspomaga, nie decyduje.