Tehnic
Analize aprofundate în detectarea PII, NER și tehnologia de anonimizare
33 articole
Presidio: configurare de 3 săptămâni vs. PII gestionat
Microsoft Presidio are mii de stele pe GitHub și sute de probleme deschise. Complexitatea configurării, overhead-ul integrării PySpark și dependențele Python.
De la 6 săptămâni la 3 zile: configurarea PII gestionat
Echipele SaaS din sănătate petrec 6 săptămâni pe implementarea în producție a Presidio auto-găzduit înainte de a trece la API-ul gestionat. API-ul gestionat înlocuiește implementarea.
Detecția gratuită a PII costă €13.000/an
Auto-găzduirea Presidio necesită 40-80 de ore de configurare inițială și 5-10 ore/lună de mentenanță continuă. La tarife de inginerie de €100/oră, asta înseamnă €13.200+.
Problema de precizie 22,7% a Presidio
Un benchmark din 2024 a descoperit că recunoaștorul de nume de persoane al Presidio atinge o precizie de 22,7% în documentele de afaceri — adică 77,3% dintre detecții sunt fals pozitive.
Confidențialitate reproductibilă: presetări ML
Anonimizarea datelor de antrenare ML trebuie să fie consecventă și reproductibilă. Dacă oamenii de știință A și B aplică tipuri diferite de entități, seturile de date de antrenare vor fi inconsistente.
Pipeline GDPR: Anonimizează înainte de stocare
Etichetele de coloane dbt nu reprezintă conformitate GDPR. Datele brute ale clienților ajung în depozitul tău Snowflake nemaschate înainte ca politicile bazate pe etichete să se aplice.
FOIA: Redactarea AI reduce săptămânile la ore
Guvernul federal a cheltuit un estimat de 500 de milioane de dolari pe procesarea FOIA în 2024, în mare parte redactare manuală. ARPA-H a solicitat explicit software de redactare AI pentru a rezolva restanțele.
Anonimizarea datelor de antrenare ML conform GDPR
GDPR restricționează utilizarea datelor personale pentru antrenarea ML dincolo de scopul inițial de colectare. Echipele de știința datelor care se bazează pe scripturi Python ad-hoc creează riscuri de conformitate și întârzieri de aprobare.
FOIA: 80% mai rapid cu redactarea în lot
Agențiile federale americane au primit 1,5 milioane de cereri FOIA în exercițiul financiar 2024 la un cost mediu de 482 dolari per cerere. Redactarea în lot a datelor personale reduce timpul de procesare de la.
Presidio vs. anonym.legal: construiești sau cumperi?
Microsoft Presidio este tehnic gratuit, dar implementarea corectă costă 40–80 de ore de inginerie. anonym.legal oferă aceeași acuratețe ML ca un serviciu SaaS gestionat.
Confidențialitate Air-Gapped: Anonimizare Complet Offline
Mediile FedRAMP și ITAR au un lucru în comun — cloud-ul nu este o opțiune. Pseudonimizare reversibilă conform art. GDPR.
Taxa Fals-Pozitiva a Instrumentelor PII
Presidio GitHub issue #1071 documenteaza fals-pozitive sistematice. Un studiu din 2024 a gasit 22,7% precizie in seturile de date enterprise multilingve.
Araba si Ebraica: Instrumentele Occidentale Esueaza
GDPR nu se opreste la Bosfor. Datele personale in araba si ebraica din fluxurile de lucru ale companiilor europene sunt sistematic neprotejate. Detectie cross-lingvistica XLM-RoBERTa.
PII în documente multilingve: instrumentele monolingve eșuează
72% dintre companiile europene prelucrează simultan documente în 3+ limbi. Documentele multilingve cauzează o rată de rată cu 45% mai mare în instrumentele NER monolingve.
PII APAC: Thailandeză, Indoneziană, Vietnameză
Un fintech din Singapore care procesează 500.000 de chat-uri de suport lunar în 12 limbi APAC a constatat că instrumentul lor exclusiv în engleză a ratat PII în 60% din chat-urile non-engleze.
False Pozitive: De Ce Eșuează Redactarea ML
Un benchmark din 2024 a constatat că Presidio a generat 13.536 de detecții false pozitive de nume pe 4.434 de mostre — marcând pronume, nume de nave și țări ca nume de persoane.
ISO 27001 + ZK Reduce Timpul de Evaluare a Furnizorilor
Un sondaj din 2025 a constatat că „lipsa unei certificări de securitate recunoscute” a fost motivul #2 pentru care CISO-ii descalifică furnizorii SaaS. Iată ce oferă combinația ISO 27001 +.
Arhitectura ZK Scurtează Ciclurile de Vânzare
Chestionarele de securitate ale furnizorilor enterprise au în medie 100+ întrebări. Arhitectura zero-knowledge răspunde la cele mai dificile în mod definitiv — și convertește.
Breșa LastPass: Lecții de securitate pentru furnizori
LastPass și-a criptat datele utilizatorilor. Seifurile au fost totuși exfiltrate. Au urmat 600.000+ de înregistrări Okta. Incidentele de securitate SaaS au crescut cu 300% din 2022 până în 2024. Iată ce trebuie să verifice fiecare echipă de achiziții.
Evaluarea revendicărilor ZK după LastPass
438 milioane de dolari furați de la utilizatorii LastPass după ce seifurile lor 'criptate' au fost sparte. A urmat o amendă ICO de 1,2 milioane de lire sterline. Iată lista de verificare pentru evaluarea dacă un furnizor are cu adevărat zero-knowledge.
CVE-2025-68664 LangChain: Cum Se Scurge PII Prin Pipeline-ul Dvs. RAG
CVSS 9,3. Funcțiile de serializare LangChain expun variabilele de mediu și secretele LLM-urilor controlate de atacatori. Cum se detectează și se remediază scurgerile PII.
Extensia LibreOffice pentru Anonimizarea Datelor Personale
Ghid pas cu pas pentru anonimizarea datelor personale în documentele LibreOffice folosind extensia anonym.legal.
LibreOffice vs Office: Redactarea Datelor Personale
Comparație detaliată a capacităților de anonimizare a datelor personale în LibreOffice (extensia anonym.legal) vs. Microsoft Office (Office Add-in).
De ce Detectarea Binară PII Eșuează în Conformitate
Detectat/nedetectat nu este suficient în contextele de conformitate care necesită judecată umană. Iată de ce scorul de încredere transformă anonimizarea PII dintr-o presupunere binară într-un control de conformitate verificabil.
Fragmentarea formatelor de documente în instrumentele PII
Un răspuns DSAR poate cuprinde contracte Word, facturi PDF, liste de clienți Excel și exporturi CSV. Utilizarea unor instrumente diferite pentru fiecare format creează lacune de conformitate.
Anonimizarea jurnalelor GDPR: menținerea capacității de depanare
Jurnalele de aplicații acumulează silențios emailuri de utilizatori, adrese IP și numere de cont. Iată cum să partajați jurnale cu terțe părți, contractori și platforme de observabilitate fără a încălca GDPR.
GDPR în jurnalele de aplicații: conformitatea PII în JSON
Jurnalele de aplicații conțin adrese de email ale clienților, adrese IP și numere de cont pe care Articolul 5(1)(e) GDPR impune să fie gestionate. Iată cum să mascați PII din jurnale fără a pierde capacitatea de depanare.
Date personale în mai multe aplicații: Word, Chrome și IA
Datele clienților trec din browserul de cercetare în documentele Word și din documentele Word în prompturile Claude. Fiecare schimbare de context este un punct potențial de scurgere.
Date personale cross-platformă: Mac, Linux și Windows
Ofițerii de confidențialitate pe Mac, juridicul pe Windows, inginerii de date pe Linux — toți prelucrând aceleași date cu instrumente diferite. Iată de ce detecția agnostică față de sistemul de operare este esențială.
PII în Rețele Izolate: Abordare Offline-First pentru Apărare
41% din politicile de securitate enterprise interzic procesarea în cloud a documentelor clasificate.
Redactare Reversibilă vs. Permanentă
GDPR face distincție între anonimizare și pseudonimizare. Instanțele au nevoie de documente originale. Cercetarea necesită re-identificare. Află când să folosești fiecare abordare.
NER Multilingv: Modelele Engleze Eșuează la Arabă
Modelele NER antrenate pe engleză ating 85-92% acuratețe. Arabă și chineză? Adesea 50-70%. Află despre provocările tehnice și cum să construiești sisteme cu adevărat multilingve.
Utilizați Claude și ChatGPT Fără a Scurge Date PII
Ghidul dezvoltatorului pentru utilizarea securizată a asistenților AI. Configurați integrarea cu Serverul MCP pentru protecția transparentă a datelor PII în Claude Desktop, Cursor și VS Code.
Începeți să Vă Protejați Datele Astăzi
285+ tipuri de entități, 48 de limbi, securitate de nivel enterprise la prețuri de startup.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.