Tècnic
Anàlisis profundes sobre detecció de PII, NER i tecnologia d'anonimització
33 articles
Presidio: 3 setmanes de configuracio vs. IIP gestionada
Microsoft Presidio te milers d'estrelles a GitHub i centenars de problemes oberts. La complexitat de configuracio, la sobrecarga d'integracio de PySpark i les dependencies de Python fan que molts equips busquin alternatives.
De 6 setmanes a 3 dies: configuracio de IIP gestionada
Els equips de SaaS sanitari passen 6 setmanes en el desplegament en produccio de Presidio allotjat localment abans de canviar a l'API gestionada. L'API gestionada substitueix tot el desplegament.
La deteccio gratuita de IIP costa mes de 13.000 EUR l'any
Allotjar Presidio localment requereix entre 40 i 80 hores de configuracio inicial i entre 5 i 10 hores de manteniment mensual. A 100 EUR l'hora d'enginyeria, aixo suposa mes de 13.200 EUR.
El problema del 22,7% de precisio de Presidio
Una avaluacio de referencia de 2024 va trobar que el reconeixedor de noms de persones de Presidio assoleix una precisio del 22,7% en documents empresarials, es a dir, el 77,3% de les deteccions son falsos positius.
Privacitat Reproductible: Presets per a ML
L'anonimització de les dades d'entrenament ML ha de ser consistent i reproductible. Si els científics de dades A i B apliquen tipus d'entitats diferents, els conjunts de dades d'entrenament són incompatibles.
Pipeline GDPR: Anonimitzar el PIE abans d'emmagatzemar-lo
Les etiquetes de columnes de dbt no son compliment GDPR. Les dades de clients en brut arriben al vostre magatzem Snowflake sense emmascarar abans que s'apliquin les polítiques basades en etiquetes.
FOIA: La redaccio passa de setmanes a hores amb IA
El govern federal va gastar un estimat de 500 milions de dolars en processament FOIA el 2024, principalment en redaccio manual. ARPA-H va buscar expressament programari de redaccio amb IA per abordar els endarreriments.
Anonimitzacio de dades ML conforme al GDPR
El GDPR restringeix l'us de dades personals per a l'entrenament de ML mes enlla del proposit original de recollida. Els cientifics de dades que depenen de scripts Python ad hoc creen llacunes de compliment que un DPO no pot certificar.
FOIA: 80% mes rapid amb la redaccio per lots
Les agencies federals dels EUA van rebre 1,5 milions de solicituds FOIA l'exercici fiscal 2024 a un cost mitja de 482 USD per solicitud. La redaccio de dades personals per lots redueix el temps de processament de mesos a setmanes.
Presidio vs. anonym.legal: construccio propia o servei gestionat
Microsoft Presidio es technicament gratuit pero costa entre 40 i 80 hores d'enginyeria per desplegar-lo correctament. anonym.legal ofereix la mateixa precisio ML com a SaaS gestionat.
Privadesa en entorns air-gapped: anonimitzar sense connexio
Els entorns FedRAMP i ITAR tenen una cosa en comu: el núvol no es una opcio. La pseudonimitzacio reversible sota l'art. 4(5) del GDPR permet als equips classificats treballar amb seguretat.
L'impost dels falsos positius en les eines de DCP
L'issue #1071 de GitHub de Presidio documenta falsos positius sistemarics. Un estudi de 2024 va trobar una precisio del 22,7% en conjunts de dades empresarials de llengua mixta.
DCP en arab i hebreu: les eines occidentals fallen
El RGPD no acaba al Bosfor. Les dades personals en arab i hebreu dins dels fluxos de treball empresarials de la UE estan sistematicament desprotegides. Deteccio cross-lingual amb XLM-RoBERTa i.
PII en documents multilingues: les eines monolingues fallen
El 72% de les empreses de la UE processen documents en 3 o mes llengues simultaneament. Els documents multilingues provoquen una taxa de deteccio fallida de PII un 45% superior en les eines NER monolingues.
PII a l'APAC: thai, indonesi, vietnamita
Una fintech de Singapur que processa 500.000 xats de suport mensuals en 12 dialectes de l'APAC va descobrir que la seva eina nomes en angles passava per alt PII en el 60% dels xats no anglesos.
Falsos positius: per que la redacció amb ML fracassa
Un benchmark de 2024 va trobar que Presidio va generar 13.536 deteccions falses de noms en 4.434 mostres, marcant pronoms, noms de vaixells i países com a noms de persona. Aquí teniu el que aixo costa en entorns legals i sanitaris.
ISO 27001 + ZK redueix el temps d'avaluació de proveïdors
Una enquesta de 2025 va trobar que la "manca de certificació de seguretat reconeguda" era el segon motiu pel qual els CISO descartaven proveïdors SaaS. Aquí teniu el que la combinació ISO 27001 + coneixement zero aporta.
L'arquitectura ZK escurca els cicles de vendes
Els qüestionaris de seguretat de proveïdors empresarials solen tenir mes de 100 preguntes. L'arquitectura de coneixement zero respon les mes difícils de manera definitiva i tanca l'acord.
La Bretxa de LastPass: Lliçons de Seguretat de Proveïdors
LastPass va xifrar les dades dels seus usuaris. Les caixes fortes van ser igualment exfiltrades. Van seguir mes de 600.000 registres d'Okta. Els incidents de seguretat SaaS van augmentar un 300% del 2022 al 2024.
Avaluacio de les Afirmacions ZK despres de LastPass
438 milions de dolars robats als usuaris de LastPass despres que les seves caixes fortes 'xifrades' van ser compromeses. Va seguir una multa de 1,2 milions de lliures de la ICO. Aqui teniu la llista de verificacio per avaluar si un proveidor compleix realment.
LangChain CVE-2025-68664: com es filtren les dades personals a traves del vostre pipeline RAG
CVSS 9.3. Les funcions de serialitzacio de LangChain exposen variables d'entorn i secrets a LLMs controlats per atacants. Com detectar i corregir les filtracions de dades personals.
Extensio d'Anonimitzacio de PII per a LibreOffice
Guia pas a pas per anonimitzar PII en documents de LibreOffice utilitzant l'extensio d'anonym.legal.
LibreOffice vs Office: Redaccio de PII
Comparacio detallada de les capacitats d'anonimitzacio de PII a LibreOffice (extensio anonym.legal) vs. Microsoft Office (Complement d'Office).
Per que la Deteccio Binaria de PII Falla en el Compliment
Les marques de detectat/no detectat son insuficients per a contextos de compliment que requereixen judici huma. La puntuacio de confiana transforma l'anonimitzacio de PII d'una conjectura binaria en un control de compliment auditable.
Fragmentacio de formats de documents en eines de dades personals
Una sola resposta a una DSAR pot abastar contractes Word, factures PDF, llistes de clients Excel i exportacions CSV. Usar eines diferents per a cada format crea buits de compliment.
Anonimitzacio de registres JSON conforme al RGPD: manteniu la capacitat de depuracio
Els registres d'aplicacio acumulen silenciosament correus electronics d'usuaris, adreces IP i numeros de compte. Aqui s'explica com compartir registres amb tercers, contractistes i plataformes d'observabilitat sense transferir dades personals.
RGPD en registres d'aplicacio: compliment de dades personals JSON
Els registres d'aplicacio contenen adreces de correu electronic, IPs i numeros de compte de clients que l'Article 5(1)(e) del RGPD exigeix gestionar.
PII entre aplicacions: Word, Chrome i IA
Les dades de clients flueixen del navegador als documents Word i als prompts de Claude. Cada canvi de context es un punt potencial de filtracio.
PII multiplataforma: Mac, Linux i Windows
Responsables de privacitat en Mac, equips juridics en Windows, enginyers de dades en Linux, tots processant les mateixes dades amb eines diferents. Per que la deteccio independent del sistema operatiu es imprescindible.
PII en Xarxes Aillades: Solucio Offline per a Defensa
El 41% de les politiques de seguretat empresarial prohibeixen el processament al nuvol de documents classificats. Aqui teniu com funciona l'anonimitzacio de PII sense connexio a internet.
Redaccio Reversible vs Permanent: Quina Triar
El RGPD distingeix entre anonimitzacio i seudonimitzacio. Els tribunals necessiten els originals. La recerca necessita la reidentificacio. Apreneu quan usar cada enfocament.
NER Multilingue: L'Angles Falla en Arab
Els models NER en angles assoleixen una precisio del 85-92%. En arab i xines? Sovint del 50-70%. Apreneu els reptes tecnics i com construir una deteccio de PII veritablement multilingue.
Useu Claude i ChatGPT sense filtrar dades personals
Guia per a desenvolupadors per usar assistents d'IA de forma segura. Configureu la integracio amb el servidor MCP per a proteccio transparent de dades personals a Claude Desktop, Cursor i VS Code.
Comenceu a Protegir les Vostres Dades Avui
Més de 285 tipus d'entitats, 48 idiomes, seguretat de nivell empresarial a preus de startup.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.