Techniczne
Dogłębne analizy wykrywania PII, NER i technologii anonimizacji
33 artykuły
Presidio: 3-tygodniowa konfiguracja kontra zarządzane PII
Microsoft Presidio ma tysiące gwiazdek na GitHubie i setki otwartych zgłoszeń. Złożoność konfiguracji, obciążenie integracji PySpark i konflikty zależności Python.
6 tygodni do 3 dni: zarządzane API PII kontra Presidio samodzielnie
Zespoły SaaS z sektora ochrony zdrowia spędzają 6 tygodni na wdrożeniu produkcyjnym Presidio samodzielnie, po czym przechodzą na zarządzane API. Zarządzane API zastępuje całe wdrożenie.
"Darmowe" wykrywanie PII kosztuje 13 000 EUR rocznie
Samodzielne hostowanie Presidio wymaga 40–80 godzin wstępnej konfiguracji i 5–10 godzin miesięcznej konserwacji. Przy stawce 100 EUR/h za pracę inżynierską daje to ponad 13 200 EUR.
Problem precyzji Presidio: tylko 22,7%
Benchmark z 2024 roku wykazał, że rozpoznawacz nazwisk osób w Microsoft Presidio osiąga precyzję 22,7% w dokumentach biznesowych — co oznacza, że 77,3% wykryć to fałszywe alarmy.
Powtarzalna prywatność: presety ML
Anonimizacja danych treningowych ML musi być spójna i powtarzalna. Jeśli naukowcy danych A i B stosują różne typy encji, zbiory treningowe stają się niespójne.
Pipeline zgodny z RODO: anonimizuj przed zapisem
Tagi kolumn w dbt to nie jest zgodność z RODO. Surowe dane klientów trafiają do hurtowni Snowflake bez maskowania, zanim polityki oparte na tagach zaczną obowiązywać.
FOIA: redakcja dokumentów w godzinach zamiast tygodni
W 2024 roku rząd federalny USA wydał szacunkowo 500 mln USD na obsługę wniosków FOIA — głównie na ręczną redakcję. ARPA-H wprost poszukiwało oprogramowania AI do redakcji.
Anonimizacja danych treningowych ML zgodna z RODO
RODO ogranicza wykorzystanie danych osobowych do trenowania modeli ML poza pierwotnym celem ich pobrania. Zespoły data science polegające na doraźnych skryptach Python narażają się na poważne ryzyko.
FOIA: 80% szybciej dzięki redakcji wsadowej
Federalne agencje USA otrzymały 1,5 miliona wniosków FOIA w roku budżetowym 2024 przy średnim koszcie 482 USD za wniosek. Wsadowa redakcja danych osobowych skraca czas przetwarzania z miesięcy do tygodni. Jak działa ten proces.
Presidio kontra anonym.legal: budować czy kupować?
Microsoft Presidio jest technicznie bezpłatny, ale prawidłowe wdrożenie kosztuje 40–80 godzin pracy inżynierskiej. anonym.legal oferuje tę samą dokładność modeli ML jako zarządzana usługa SaaS.
Prywatność w środowiskach air-gap: Anonimizacja offline
Środowiska FedRAMP i ITAR mają jedną cechę wspólną – chmura nie wchodzi w grę. Odwracalna pseudonimizacja w rozumieniu art. 4 ust. 5 RODO.
Podatek od fałszywych alarmów w narzędziach PII
Zgłoszenie #1071 na GitHubie Microsoft Presidio dokumentuje systematyczne fałszywe alarmy. Badanie z 2024 roku wykazało precyzję na poziomie 22,7% w mieszanych językowo zbiorach danych korporacyjnych.
Arabski i hebrajski PII: zachodnie narzędzia zawodzą
RODO nie kończy się na Bosforze. Dane osobowe w języku arabskim i hebrajskim w europejskich procesach biznesowych są systematycznie niezabezpieczone. Detekcja cross-lingual z XLM-RoBERTa i inne rozwiązania.
PII w dokumentach wielojęzycznych: jednojęzyczne narzędzia zawodzą
72% przedsiębiorstw UE przetwarza jednocześnie dokumenty w co najmniej 3 językach. Mieszane językowo dokumenty powodują 45% wyższy wskaźnik pominięć PII w jednojęzycznych narzędziach NER.
PII w regionie APAC: tajski, indonezyjski, wietnamski
Singapurska firma fintech przetwarzająca 500 000 miesięcznych czatów obsługi klienta w 12 językach regionu APAC stwierdziła, że narzędzie wyłącznie angielskie pomija PII w 60% rozmów nieanglojęzycznych.
Fałszywe alarmy Presidio: dlaczego redakcja ML zawodzi
Badanie benchmarkowe z 2024 r. wykazało, że Presidio wygenerowało 13 536 fałszywych wykryć imion w 4 434 próbkach — oznaczając zaimki, nazwy statków i nazwy krajów jako imiona osób.
ISO 27001 + zero-knowledge skraca czas oceny dostawców
Badanie z 2025 r. wykazało, że „brak uznanej certyfikacji bezpieczeństwa" był drugim najczęstszym powodem dyskwalifikacji dostawców SaaS przez CISO. Oto, co daje połączenie ISO 27001 i architektury zero-knowledge.
Architektura zero-knowledge skraca cykle sprzedaży
Kwestionariusze bezpieczeństwa dostawców dla przedsiębiorstw zawierają średnio ponad 100 pytań. Architektura zero-knowledge odpowiada na najtrudniejsze z nich w sposób definitywny — i przyspiesza zamykanie transakcji.
Naruszenie LastPass: lekcje bezpieczeństwa od dostawców
LastPass szyfrował dane swoich użytkowników. Sejfy zostały mimo to skradzione. Ponad 600 tys. rekordów Okta poszło w ślad. Incydenty bezpieczeństwa SaaS wzrosły o 300% w latach 2022–2024.
Ocena twierdzeń o zero-knowledge po naruszeniu LastPass
438 mln dolarów skradzionych użytkownikom LastPass po naruszeniu ich „zaszyfrowanych" sejfów. Kara ICO wyniosła 1,2 mln funtów. Oto lista kontrolna do oceny, czy twierdzenia dostawcy o zerowej wiedzy są wiarygodne.
LangChain CVE-2025-68664: jak dane osobowe wyciekają przez Twój potok RAG
CVSS 9,3. Funkcje serializacji LangChain ujawniają zmienne środowiskowe i sekrety modelom LLM kontrolowanym przez atakującego. Jak wykryć i naprawić wycieki danych osobowych.
Rozszerzenie LibreOffice do anonimizacji danych osobowych
Przewodnik krok po kroku po anonimizacji danych osobowych w dokumentach LibreOffice za pomocą rozszerzenia anonym.legal.
LibreOffice vs. Microsoft Office: redagowanie danych osobowych – porównanie 2026
Szczegółowe porównanie możliwości anonimizacji danych osobowych w LibreOffice (rozszerzenie anonym.legal) i Microsoft Office (Dodatek do pakietu Office).
Dlaczego binarna detekcja PII nie spełnia wymogów zgodności
Flagi wykryto/nie wykryto nie wystarczą do podejmowania obronialnych decyzji o redakcji. Ocena wiarygodności przekształca anonimizację PII z binarnego zgadywania w audytowalny środek kontroli.
Fragmentacja formatów dokumentów w narzędziach PII
Jedna odpowiedź DSAR może obejmować umowy Word, faktury PDF, listy klientów Excel i eksporty CSV. Używanie różnych narzędzi dla każdego formatu tworzy luki w zgodności z RODO.
Anonimizacja logów JSON zgodna z RODO: jak zachować możliwość debugowania
Logi aplikacji po cichu gromadzą adresy e-mail użytkowników, adresy IP i numery kont. Jak bezpiecznie udostępniać logi zewnętrznym firmom, wykonawcom i platformom obserwowalności.
RODO a logi aplikacji: zgodność JSON i danych osobowych
Logi aplikacji zawierają adresy e-mail klientów, adresy IP i numery kont — wszystko to, czym zarządzania wymaga art. 5 ust. 1 lit. e) RODO.
Ochrona PII między aplikacjami: Word, Chrome i AI
Dane klientów przepływają z badań w przeglądarce do szkiców w Wordzie i do promptów Claude'a. Każde przejście między kontekstami to potencjalny punkt wycieku.
Wieloplatformowa zgodność PII: Mac, Linux i Windows
Inspektorzy ochrony danych na Macu, prawnicy na Windowsie, inżynierowie danych na Linuksie — wszyscy przetwarzają te same dane różnymi narzędziami. Oto dlaczego wykrywanie niezależne od systemu operacyjnego jest niezbędne.
Anonimizacja PII w środowiskach izolowanych – podejście offline-first dla sektora obronnego
41% polityk bezpieczeństwa dużych przedsiębiorstw zakazuje przetwarzania dokumentów niejawnych w chmurze.
Redakcja odwracalna a trwała – jak dokonać właściwego wyboru
RODO odróżnia anonimizację od pseudonimizacji. Sądy wymagają oryginałów. Badania naukowe potrzebują możliwości ponownej identyfikacji. Dowiedz się, kiedy stosować każde z podejść.
Wielojęzyczny NER: Angielski Zawodzi Arabski
Modele NER trenowane na angielskim osiągają 85–92% dokładności. Arabski i chiński? Często 50–70%. Poznaj wyzwania techniczne i jak budować naprawdę wielojęzyczne systemy.
Używaj Claude i ChatGPT Bez Wycieku PII
Przewodnik dla programistów dotyczący bezpiecznego korzystania z asystentów AI. Skonfiguruj integrację z Serwerem MCP dla przezroczystej ochrony PII w Claude Desktop, Cursor i VS Code.
Zacznij chronić swoje dane już dziś
285+ typów podmiotów, 48 języków, bezpieczeństwo klasy przedsiębiorstw w cenach startowych.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.