Tekninen
Syvälliset tarkastelut PII-tunnistuksesta, NER:stä ja anonymisointiteknologiasta
33 artikkeleita
Presidio: 3 viikon asennus vs. hallittu PII
Microsoft Presidiolla on tuhansia GitHub-tähtiä ja satoja avoimia ongelmia. Konfiguraation monimutkaisuus, PySpark-integraation ylimääräinen työ ja Python-riippuvuuksien ristiriidat ajavat tiimejä hallittuihin vaihtoehtoihin.
6 viikosta 3 päivään: hallittu PII vs. itse isännöity
Terveydenhuollon SaaS-tiimit käyttävät 6 viikkoa itse isännöidyn Presidion tuotantokäyttöönottoon ennen siirtymistä hallittuun API:iin. Hallittu API korvaa koko infrastruktuuriprojektin.
"Ilmainen" henkilötietojen tunnistus maksaa 13 000 €/vuosi
Presidion itse isännöinti vaatii 40–80 tuntia alkukonfiguraatiota ja 5–10 tuntia/kk jatkuvaa ylläpitoa. Insinöörityön hinnoilla 100 €/tunti tämä vastaa yli 13 200 euroa vuodessa.
Presidio: 22,7 %:n tarkkuusongelma
Vuoden 2024 vertailutesti osoitti, että Presidion henkilönnimitunnistin saavuttaa 22,7 %:n tarkkuuden yritysasiakirjoissa — mikä tarkoittaa, että 77,3 % tunnistuksista on vääriä positiivisia.
Toistettava tietosuoja: ML-asetuspohjat
ML-harjoitusdatan anonymisoinnin on oltava johdonmukaista ja toistettavaa. Jos datatieteilijät A ja B soveltavat erilaisia entiteettityyppejä, harjoitusaineistot ovat.
GDPR-turvallinen datapipeline: PII:n anonymisointi ennen varastointia
dbt-saraketunnisteet eivät ole GDPR-vaatimustenmukaisuutta. Raaka asiakasdata päätyy Snowflake-tietovarastoosi peittämättömänä ennen kuin tunniste-perusteinen käytäntö astuu voimaan.
FOIA tekoälyaikakaudella: Redaktoinnin lyhentäminen viikoista tunteiksi
Liittohallitus käytti arviolta 500 miljoonaa dollaria FOIA-käsittelyyn vuonna 2024, pääasiassa manuaaliseen redaktointiin. ARPA-H haki nimenomaisesti tekoälyredaktointiohjelmistoa kasvavan ruuhkan ratkaisemiseksi.
GDPR-yhteensopiva ML-koulutusdata: 10 000 tietueen anonymisointi ilman koodausta
GDPR rajoittaa henkilötietojen käyttöä koneoppimiskoulutuksessa alkuperäisen keräystarkoituksen ulkopuolella. Datatiimit, jotka tukeutuvat ad hoc -Python-skripteihin, luovat vaatimustenmukaisuusaukkoja, jotka epäonnistuvat tietosuojavastaavan auditoinneissa.
FOIA-pyyntöjen käsittelyaika laskee 80 % eräpeittämisellä
Yhdysvaltain liittovaltion virastot vastaanottivat 1,5 miljoonaa FOIA-pyyntöä varainhoitovuonna 2024, keskimääräiskustannuksella 482 dollaria per pyyntö. Eräpeittäminen lyhentää käsittelyaikaa kuukausista viikkoihin.
Presidio vs anonym.legal: Rakenna itse vai osta palveluna
Microsoft Presidio on teknisesti ilmainen, mutta sen asianmukainen käyttöönotto maksaa 40–80 insinöörityötuntia. anonym.legal toimittaa saman ML-tarkkuuden hallittuna SaaS-palveluna.
Ilmaverkkoon eristetty tietosuoja: anonymisointi offline-tilassa
FedRAMP- ja ITAR-ympäristöillä on yksi yhteinen piirre — pilvipalvelu ei ole vaihtoehto. Palautuva pseudonymisointi GDPR:n 4(5) artiklan mukaisesti.
Väärien positiivisten vero PII-tunnistustyökaluissa
Presidio GitHub-ongelma #1071 dokumentoi järjestelmällisiä vääriä positiivisia. Vuoden 2024 tutkimus löysi 22,7 %:n tarkkuuden sekakielisissä yritysdataseteissä.
Arabia- ja hepreankielinen PII: läntiset työkalut epäonnistuvat
GDPR ei pääty Bosporin salmelle. Arabia- ja hepreankielinen PII EU-yritysten työnkuluissa on järjestelmällisesti suojaamatta. XLM-RoBERTa-pohjainen monikielinen tunnistus ja.
Monikie linen henkilötieto: yksikieliset työkalut epäonnistuvat
72 % EU-yrityksistä käsittelee asiakirjoja samanaikaisesti kolmella tai useammalla kielellä. Sekakieliset asiakirjat aiheuttavat 45 % korkeamman henkilötietojen jäämisasteen yksikielisissä NER-työkaluissa.
APAC-henkilötietotunnistus: thai, indonesia, vietnam
Singaporelainen fintech-yritys, joka käsittelee 500 000 kuukausittaista tukikeskustelua 12 APAC-kielessä, havaitsi, että vain englanninkielinen työkalu jättää henkilötiedot huomaamatta 60 %:ssa muun kuin englanninkielisissä keskusteluissa.
Väärät positiiviset: Miksi ML-peittäminen epäonnistuu
Vuoden 2024 vertailu havaitsi, että Presidio tuotti 13 536 väärää positiivista nimentunnistusta 4 434 näytteen joukossa — merkiten pronomineja, alusnimikylttejä ja maantieteellisiä nimiä henkilöiksi.
ISO 27001 + ZK lyhentää toimittaja-arviointiaikaa
Vuoden 2025 tutkimus havaitsi, että tunnustetun tietoturvasertifioinnin puuttuminen on toiseksi yleisin syy, jolla CISO:t hylkäävät SaaS-toimittajat. Tässä mitä ISO 27001 -yhdistelmä tarjoaa.
ZK-arkkitehtuuri lyhentää myyntisyklejä
Yritysmyyjien turvallisuuskyselylomakkeissa on keskimäärin yli 100 kysymystä. Zero-knowledge-arkkitehtuuri vastaa vaikeimpiin kysymyksiin yksiselitteisesti — ja vakuuttaa asiakkaat.
LastPass-tietomurto: toimittajaturvallisuuden opetukset
LastPass salasi käyttäjiensä tiedot. Silti holdit exfiltroitiin. Seuraavaksi 600 000+ Okta-tietuetta. SaaS-tietoturvapoikkeamat lisääntyivät 300 % vuodesta 2022 lähtien.
Nollatieto-väitteiden arviointi LastPass-tapauksen jälkeen
LastPass-käyttäjiltä varastettiin 438 miljoonaa dollaria sen jälkeen, kun heidän 'salatut' holvinsa murtauduttiin. Seurasi 1,2 miljoonan punnan ICO-sakko. Tässä tarkistuslista sen arvioimiseksi, pitääkö toimittaja todella lupauksensa.
LangChain CVE-2025-68664: Miten PII vuotaa RAG-putkistosi läpi
CVSS 9,3. LangChainin serialisointifunktiot paljastavat ympäristömuuttujat ja salaisuudet hyökkääjän hallitsemille kielimalleille. Miten havaita ja korjata PII-vuodot.
LibreOffice PII -anonymisointilaajennus
Vaiheittainen opas PII:n anonymisointiin LibreOffice-asiakirjoissa anonym.legal-laajennuksen avulla.
LibreOffice vs. Office: PII-peittäminen
Yksityiskohtainen vertailu PII-anonymisointiominaisuuksista LibreOfficessa (anonym.legal-laajennus) vs. Microsoft Officessa (Office-lisäosa).
Miksi binaarinen PII-tunnistus epäonnistuu vaatimustenmukaisuudessa
Havaittu/ei havaittu -merkintä ei riitä vaatimustenmukaisuustilanteissa, jotka edellyttävät ihmisen harkintaa. Luottamuspisteytys muuttaa PII-anonymisoinnin.
Asiakirjaformaattien hajanaisuus henkilötietotyökaluissa
Yksi DSAR-vastaus voi kattaa Word-sopimuksia, PDF-laskuja, Excel-asiakaslistoja ja CSV-vientejä. Eri työkalujen käyttäminen kullekin formaatille luo vaatimustenmukaisuusaukkoja.
GDPR-lokien anonymisointi: Säilytä debuggauskyky
Sovellukset kerryttävät hiljaisesti käyttäjien sähköposteja, IP-osoitteita ja tilinumeroita lokitiedostoihin. Näin jaat lokeja kolmansille osapuolille, urakoitsijoille ja havainnointipalveluille ilman GDPR-riskiä.
GDPR sovelluksen lokeissa: JSON-henkilötietojen vaatimustenmukaisuus
Sovelluksen lokit sisältävät asiakkaiden sähköpostiosoitteita, IP-osoitteita ja tilinumeroita, joiden hallintaa GDPR:n artikla 5(1)(e) edellyttää.
Henkilötietojen suojaus eri sovelluksissa: Word, Chrome ja tekoäly
Asiakasdata siirtyy selaimen tutkimuksesta Word-luonnoksiin ja Claude-kehotteisiin. Jokainen sovelluksen vaihto on mahdollinen tietovuodon kohta.
Alustakohtainen henkilötietojen vaatimustenmukaisuus: Mac, Linux ja Windows
Tietosuojavastuullinen Macilla, lakitiimi Windowsilla, data-insinöörit Linuxilla — kaikki käsittelevät samaa dataa eri työkaluilla. Siksi käyttöjärjestelmästä riippumaton tunnistus on välttämätöntä.
Ilmavälin PII-anonymisointi: offline-first puolustuskäyttöön
41 % yritysten tietoturvapolitiikoista kieltää pilvipalveluiden käytön luokiteltujen asiakirjojen käsittelyyn. Lue, miten offline-first-käsittely ratkaisee tämän haasteen.
Palautuva vs. pysyvä tunnistaminen: oikea valinta tilanteesta riippuen
GDPR erottaa anonymisoinnin pseudonymisaatiosta. Tuomioistuimet tarvitsevat alkuperäisaineiston. Tutkimus vaatii uudelleentunnistamista. Lue, milloin käyttää kumpakin lähestymistapaa.
Monikielinen NER: englanninkieliset mallit epäonnistuvat arabian kanssa
Englanninkieliset NER-mallit saavuttavat 85–92 %:n tarkkuuden. Arabia ja kiina? Usein vain 50–70 %. Lue teknisistä haasteista ja siitä, miten rakentaa aidosti monikielinen ratkaisu.
Käytä Claudea ja ChatGPT:tä vuotamatta PII-tietoja
Kehittäjän opas tekoälyavustajien turvalliseen käyttöön. Aseta MCP Server -integraatio läpinäkyvään PII-suojaukseen Claude Desktopissa, Cursorissa ja VS Codessa.
Aloita Tietojesi Suojaaminen Tänään
285+ entiteettityyppiä, 48 kieltä, yritystason turvallisuus aloitushintaan.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.