Kaikki ArtikkelitTekninen

Tekninen

Syvälliset tarkastelut PII-tunnistuksesta, NER:stä ja anonymisointiteknologiasta

33 artikkeleita

Tekninen

Presidio: 3 viikon asennus vs. hallittu PII

Microsoft Presidiolla on tuhansia GitHub-tähtiä ja satoja avoimia ongelmia. Konfiguraation monimutkaisuus, PySpark-integraation ylimääräinen työ ja Python-riippuvuuksien ristiriidat ajavat tiimejä hallittuihin vaihtoehtoihin.

June 15, 20266 min
Tekninen

6 viikosta 3 päivään: hallittu PII vs. itse isännöity

Terveydenhuollon SaaS-tiimit käyttävät 6 viikkoa itse isännöidyn Presidion tuotantokäyttöönottoon ennen siirtymistä hallittuun API:iin. Hallittu API korvaa koko infrastruktuuriprojektin.

June 14, 20267 min
Tekninen

"Ilmainen" henkilötietojen tunnistus maksaa 13 000 €/vuosi

Presidion itse isännöinti vaatii 40–80 tuntia alkukonfiguraatiota ja 5–10 tuntia/kk jatkuvaa ylläpitoa. Insinöörityön hinnoilla 100 €/tunti tämä vastaa yli 13 200 euroa vuodessa.

June 12, 20267 min
Tekninen

Presidio: 22,7 %:n tarkkuusongelma

Vuoden 2024 vertailutesti osoitti, että Presidion henkilönnimitunnistin saavuttaa 22,7 %:n tarkkuuden yritysasiakirjoissa — mikä tarkoittaa, että 77,3 % tunnistuksista on vääriä positiivisia.

June 11, 20267 min
Tekninen

Toistettava tietosuoja: ML-asetuspohjat

ML-harjoitusdatan anonymisoinnin on oltava johdonmukaista ja toistettavaa. Jos datatieteilijät A ja B soveltavat erilaisia entiteettityyppejä, harjoitusaineistot ovat.

June 7, 20266 min
Tekninen

GDPR-turvallinen datapipeline: PII:n anonymisointi ennen varastointia

dbt-saraketunnisteet eivät ole GDPR-vaatimustenmukaisuutta. Raaka asiakasdata päätyy Snowflake-tietovarastoosi peittämättömänä ennen kuin tunniste-perusteinen käytäntö astuu voimaan.

May 29, 20268 min
Tekninen

FOIA tekoälyaikakaudella: Redaktoinnin lyhentäminen viikoista tunteiksi

Liittohallitus käytti arviolta 500 miljoonaa dollaria FOIA-käsittelyyn vuonna 2024, pääasiassa manuaaliseen redaktointiin. ARPA-H haki nimenomaisesti tekoälyredaktointiohjelmistoa kasvavan ruuhkan ratkaisemiseksi.

May 28, 20268 min
Tekninen

GDPR-yhteensopiva ML-koulutusdata: 10 000 tietueen anonymisointi ilman koodausta

GDPR rajoittaa henkilötietojen käyttöä koneoppimiskoulutuksessa alkuperäisen keräystarkoituksen ulkopuolella. Datatiimit, jotka tukeutuvat ad hoc -Python-skripteihin, luovat vaatimustenmukaisuusaukkoja, jotka epäonnistuvat tietosuojavastaavan auditoinneissa.

May 27, 20267 min
Tekninen

FOIA-pyyntöjen käsittelyaika laskee 80 % eräpeittämisellä

Yhdysvaltain liittovaltion virastot vastaanottivat 1,5 miljoonaa FOIA-pyyntöä varainhoitovuonna 2024, keskimääräiskustannuksella 482 dollaria per pyyntö. Eräpeittäminen lyhentää käsittelyaikaa kuukausista viikkoihin.

May 23, 20269 min
Tekninen

Presidio vs anonym.legal: Rakenna itse vai osta palveluna

Microsoft Presidio on teknisesti ilmainen, mutta sen asianmukainen käyttöönotto maksaa 40–80 insinöörityötuntia. anonym.legal toimittaa saman ML-tarkkuuden hallittuna SaaS-palveluna.

May 18, 20268 min
Tekninen

Ilmaverkkoon eristetty tietosuoja: anonymisointi offline-tilassa

FedRAMP- ja ITAR-ympäristöillä on yksi yhteinen piirre — pilvipalvelu ei ole vaihtoehto. Palautuva pseudonymisointi GDPR:n 4(5) artiklan mukaisesti.

April 13, 20269 min
Tekninen

Väärien positiivisten vero PII-tunnistustyökaluissa

Presidio GitHub-ongelma #1071 dokumentoi järjestelmällisiä vääriä positiivisia. Vuoden 2024 tutkimus löysi 22,7 %:n tarkkuuden sekakielisissä yritysdataseteissä.

April 3, 20268 min
Tekninen

Arabia- ja hepreankielinen PII: läntiset työkalut epäonnistuvat

GDPR ei pääty Bosporin salmelle. Arabia- ja hepreankielinen PII EU-yritysten työnkuluissa on järjestelmällisesti suojaamatta. XLM-RoBERTa-pohjainen monikielinen tunnistus ja.

April 1, 20268 min
Tekninen

Monikie linen henkilötieto: yksikieliset työkalut epäonnistuvat

72 % EU-yrityksistä käsittelee asiakirjoja samanaikaisesti kolmella tai useammalla kielellä. Sekakieliset asiakirjat aiheuttavat 45 % korkeamman henkilötietojen jäämisasteen yksikielisissä NER-työkaluissa.

March 26, 20267 min
Tekninen

APAC-henkilötietotunnistus: thai, indonesia, vietnam

Singaporelainen fintech-yritys, joka käsittelee 500 000 kuukausittaista tukikeskustelua 12 APAC-kielessä, havaitsi, että vain englanninkielinen työkalu jättää henkilötiedot huomaamatta 60 %:ssa muun kuin englanninkielisissä keskusteluissa.

March 24, 20267 min
Tekninen

Väärät positiiviset: Miksi ML-peittäminen epäonnistuu

Vuoden 2024 vertailu havaitsi, että Presidio tuotti 13 536 väärää positiivista nimentunnistusta 4 434 näytteen joukossa — merkiten pronomineja, alusnimikylttejä ja maantieteellisiä nimiä henkilöiksi.

March 23, 20268 min
Tekninen

ISO 27001 + ZK lyhentää toimittaja-arviointiaikaa

Vuoden 2025 tutkimus havaitsi, että tunnustetun tietoturvasertifioinnin puuttuminen on toiseksi yleisin syy, jolla CISO:t hylkäävät SaaS-toimittajat. Tässä mitä ISO 27001 -yhdistelmä tarjoaa.

March 19, 20267 min
Tekninen

ZK-arkkitehtuuri lyhentää myyntisyklejä

Yritysmyyjien turvallisuuskyselylomakkeissa on keskimäärin yli 100 kysymystä. Zero-knowledge-arkkitehtuuri vastaa vaikeimpiin kysymyksiin yksiselitteisesti — ja vakuuttaa asiakkaat.

March 18, 20267 min
Tekninen

LastPass-tietomurto: toimittajaturvallisuuden opetukset

LastPass salasi käyttäjiensä tiedot. Silti holdit exfiltroitiin. Seuraavaksi 600 000+ Okta-tietuetta. SaaS-tietoturvapoikkeamat lisääntyivät 300 % vuodesta 2022 lähtien.

March 17, 20268 min
Tekninen

Nollatieto-väitteiden arviointi LastPass-tapauksen jälkeen

LastPass-käyttäjiltä varastettiin 438 miljoonaa dollaria sen jälkeen, kun heidän 'salatut' holvinsa murtauduttiin. Seurasi 1,2 miljoonan punnan ICO-sakko. Tässä tarkistuslista sen arvioimiseksi, pitääkö toimittaja todella lupauksensa.

March 16, 20268 min
Tekninen

LangChain CVE-2025-68664: Miten PII vuotaa RAG-putkistosi läpi

CVSS 9,3. LangChainin serialisointifunktiot paljastavat ympäristömuuttujat ja salaisuudet hyökkääjän hallitsemille kielimalleille. Miten havaita ja korjata PII-vuodot.

March 16, 20268 min
Tekninen

LibreOffice PII -anonymisointilaajennus

Vaiheittainen opas PII:n anonymisointiin LibreOffice-asiakirjoissa anonym.legal-laajennuksen avulla.

March 10, 202610 min
Tekninen

LibreOffice vs. Office: PII-peittäminen

Yksityiskohtainen vertailu PII-anonymisointiominaisuuksista LibreOfficessa (anonym.legal-laajennus) vs. Microsoft Officessa (Office-lisäosa).

March 10, 20268 min
Tekninen

Miksi binaarinen PII-tunnistus epäonnistuu vaatimustenmukaisuudessa

Havaittu/ei havaittu -merkintä ei riitä vaatimustenmukaisuustilanteissa, jotka edellyttävät ihmisen harkintaa. Luottamuspisteytys muuttaa PII-anonymisoinnin.

March 6, 20268 min
Tekninen

Asiakirjaformaattien hajanaisuus henkilötietotyökaluissa

Yksi DSAR-vastaus voi kattaa Word-sopimuksia, PDF-laskuja, Excel-asiakaslistoja ja CSV-vientejä. Eri työkalujen käyttäminen kullekin formaatille luo vaatimustenmukaisuusaukkoja.

March 6, 20267 min
Tekninen

GDPR-lokien anonymisointi: Säilytä debuggauskyky

Sovellukset kerryttävät hiljaisesti käyttäjien sähköposteja, IP-osoitteita ja tilinumeroita lokitiedostoihin. Näin jaat lokeja kolmansille osapuolille, urakoitsijoille ja havainnointipalveluille ilman GDPR-riskiä.

March 6, 20267 min
Tekninen

GDPR sovelluksen lokeissa: JSON-henkilötietojen vaatimustenmukaisuus

Sovelluksen lokit sisältävät asiakkaiden sähköpostiosoitteita, IP-osoitteita ja tilinumeroita, joiden hallintaa GDPR:n artikla 5(1)(e) edellyttää.

March 6, 20266 min
Tekninen

Henkilötietojen suojaus eri sovelluksissa: Word, Chrome ja tekoäly

Asiakasdata siirtyy selaimen tutkimuksesta Word-luonnoksiin ja Claude-kehotteisiin. Jokainen sovelluksen vaihto on mahdollinen tietovuodon kohta.

March 6, 20266 min
Tekninen

Alustakohtainen henkilötietojen vaatimustenmukaisuus: Mac, Linux ja Windows

Tietosuojavastuullinen Macilla, lakitiimi Windowsilla, data-insinöörit Linuxilla — kaikki käsittelevät samaa dataa eri työkaluilla. Siksi käyttöjärjestelmästä riippumaton tunnistus on välttämätöntä.

March 6, 20266 min
Tekninen

Ilmavälin PII-anonymisointi: offline-first puolustuskäyttöön

41 % yritysten tietoturvapolitiikoista kieltää pilvipalveluiden käytön luokiteltujen asiakirjojen käsittelyyn. Lue, miten offline-first-käsittely ratkaisee tämän haasteen.

March 3, 20268 min
Tekninen

Palautuva vs. pysyvä tunnistaminen: oikea valinta tilanteesta riippuen

GDPR erottaa anonymisoinnin pseudonymisaatiosta. Tuomioistuimet tarvitsevat alkuperäisaineiston. Tutkimus vaatii uudelleentunnistamista. Lue, milloin käyttää kumpakin lähestymistapaa.

February 27, 20267 min
Tekninen

Monikielinen NER: englanninkieliset mallit epäonnistuvat arabian kanssa

Englanninkieliset NER-mallit saavuttavat 85–92 %:n tarkkuuden. Arabia ja kiina? Usein vain 50–70 %. Lue teknisistä haasteista ja siitä, miten rakentaa aidosti monikielinen ratkaisu.

February 26, 20268 min
Tekninen

Käytä Claudea ja ChatGPT:tä vuotamatta PII-tietoja

Kehittäjän opas tekoälyavustajien turvalliseen käyttöön. Aseta MCP Server -integraatio läpinäkyvään PII-suojaukseen Claude Desktopissa, Cursorissa ja VS Codessa.

February 22, 20267 min

Aloita Tietojesi Suojaaminen Tänään

285+ entiteettityyppiä, 48 kieltä, yritystason turvallisuus aloitushintaan.

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

We run a full check suite on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We track recall and precision on a labelled set.

Bad runs block the deploy.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

You can top up at any time.

Unused credits roll over each month.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.