Технички
Длабински анализи на откривање на PII, NER и технологии за анонимизација
33 статии
Presidio: поставување 3 недели наспроти управуван PII
Microsoft Presidio има илјадници ѕвезди на GitHub и стотици отворени прашања. Сложеноста на поставувањето, надоверноста на PySpark интеграцијата и зависностите на Python.
Од 6 недели до 3 дена: управувано PII поставување
Тимовите за здравствен SaaS трошат 6 недели на производствено распоредување на самохостиран Presidio пред да преминат на управуван API. Управуваниот API го заменува распоредувањето.
Бесплатното откривање на PII чини €13.000 годишно
Самохостирањето на Presidio бара 40-80 часа за почетно поставување и 5-10 часа/месечно за тековно одржување. При инженерски ставки од €100/час, тоа е €13.200+.
Проблемот со прецизноста на Presidio: 22,7%
Бенчмарк од 2024 година покажа дека препознавачот на имиња на лица на Presidio постигнува прецизност од 22,7% во деловни документи — што значи дека 77,3% од откривањата се лажни позитиви.
Обновлива приватност: ML предлошки
Анонимизацијата на ML податоците за обука мора да биде конзистентна и обновлива. Ако научниците за податоци А и Б применуваат различни видови ентитети, наборите за обука се несогласувачки.
GDPR цевковод: Анонимизирај пред складирање
dbt ознаките на колони не се GDPR усогласеност. Сировите клиентски податоци пристигнуваат во вашиот Snowflake магацин немаскирани пред да се применат политиките базирани на ознаки.
FOIA: Редакција од недели до часови
Федералната влада потрошила проценети $500M на обработка на FOIA во 2024 година, главно рачна редакција. ARPA-H изречно барал AI софтвер за редакција за да го реши огромниот заостаток.
GDPR анонимизација на податоци за обука на ML
GDPR ги ограничува употребата на лични податоци за обука на ML надвор од оригиналната намена на нивното собирање. Тимовите за наука на податоци кои се потпираат на ad-hoc Python скрипти создаваат сериозни проблеми.
FOIA: 80% побрзо со пакетна редакција
Федералните агенции на САД добиле 1,5 милиони барања за FOIA во финансиската 2024 година при просечен трошок од $482 по барање. Пакетната редакција на лични податоци го намалува времето за обработка од.
Presidio vs. anonym.legal: Изградба наспроти купување
Microsoft Presidio е технички бесплатен, но чини 40-80 инженерски часа за правилно распоредување. anonym.legal обезбедува иста точност на ML-моделите во форма на управуван SaaS.
Приватност со воздушна изолација: Анонимизирајте офлајн
FedRAMP и ITAR средините имаат една заедничка работа — облакот не е опција. Реверзибилна псевдонимизација според GDPR Чл. 4(5) бара посебно складирање на токенот.
Данокот на лажно позитивни резултати кај PII алатките
GitHub проблемот #1071 на Presidio документира систематски лажно позитивни резултати. Студија од 2024 откри прецизност од 22,7% во мешано-јазични деловни датасети.
Арапски и хебрејски PII: западните алатки не успеваат
GDPR не завршува на Босфорот. Арапски и хебрејски лични податоци во деловните процеси на ЕУ се систематски незаштитени. XLM-RoBERTa меѓујазичното детектирање и регионалните типови ентитети ја затвораат оваа правна дупка.
PII на мешан јазик: Еднојазичните алатки не успеваат
72% од компаниите во ЕУ обработуваат документи на 3+ јазици истовремено. Мешано-јазичните документи предизвикуваат 45% повисоки стапки на пропуштање PII кај еднојазичните NER алатки.
APAC ЛЛИ: тајландски, индонезиски, виетнамски
Компанија за финансиски технологии во Сингапур која обработува 500.000 месечни разговори за поддршка на 12 APAC јазика откри дека нивната алатка само на англиски пропушта ЛЛИ во 60% од разговорите кои не се на англиски.
Лажни позитиви на Presidio: Зошто ML редакцијата не успева
Бенчмарк од 2024 година откри дека Presidio генерирал 13.536 лажни позитивни детекции на имиња низ 4.434 примероци - означувајќи заменки, имиња на бродови и земји како лични имиња. Еве колку тоа чини во правни и здравствени средини.
ISO 27001 + ZK го скратуваат времето за оценка на добавувачи
Истражување од 2025 година покажа дека 'недостатокот на признаена безбедносна сертификација' е втората причина поради која CISO ги дисквалификуваат SaaS добавувачите. Еве го она што го нуди комбинацијата ISO 27001 + нулта знаење.
ZK архитектурата ги скратува продажните циклуси
Безбедносните прашалници на корпоративните добавувачи содржат 100+ прашања. Архитектурата со нулта знаење дава дефинитивни одговори на најтешките прашања - и конвертира.
Пробивот на LastPass: лекции за безбедноста на добавувачите
LastPass ги шифрирале податоците на своите корисници. Трезорите сепак биле ексфилтрирани. Следеле 600.000+ записи на Okta. Безбедносните инциденти на SaaS се зголемиле за 300% од 2022 до 2024 година.
Евалуација на тврдења за нула-знаење по LastPass
438 милиони $ украдени од корисниците на LastPass откако нивните 'шифрирани' трезори биле пробиени. Следела казна на ICO од 1,2 милиони фунти. Еве контролна листа за проценка на тоа дали тврдењата на добавувачот навистина се однесуваат.
LangChain CVE-2025-68664: Како личните податоци протекуваат низ вашиот RAG Pipeline
CVSS 9,3. Функциите за серијализација на LangChain ги изложуваат променливите на околината и тајните на LLM-ови контролирани од напаѓачи. Како да откривате и поправате протекување на PII.
LibreOffice додаток за анонимизација на лични податоци
Чекор по чекор водич за анонимизација на лични податоци во LibreOffice документи со помош на додатокот anonym.legal.
LibreOffice vs Office: Редакција на лични податоци
Детална споредба на можностите за анонимизација на лични податоци во LibreOffice (додаток anonym.legal) vs. Microsoft Office (Office додаток).
Зошто бинарното откривање на лични податоци не ја задоволува усогласеноста
Ознаките откривено/неоткривено не се доволни за контексти на усогласеност кои бараат човечка проценка. Оценувањето на доверба ја претвора анонимизацијата на лични податоци од бинарно погодување во ревидирачка контрола за усогласеност.
Фрагментација на Формати на Документи во Алатки за Лични Податоци
Единствен одговор на DSAR може да опфати Word договори, PDF фактури, Excel списоци на клиенти и CSV извози. Користењето различни алатки за секој формат создава јазови во усогласеноста.
GDPR Анонимизација на Дневници: Задржете го Дебагирањето
Апликациските дневници молчешкум акумулираат е-пошти на корисниците, IP адреси и броеви на сметки. Еве како да ги споделите дневниците со трети страни, изведувачи и платформи за набљудување.
GDPR во Апликациски Дневници: JSON PII Усогласеност
Апликациските дневници содржат е-пошта адреси, IP адреси и броеви на сметки на клиентите кои GDPR Член 5(1)(е) бара да бидат управувани.
Заштита на лични податоци низ апликации: Word, Chrome и AI
Податоците за клиентите преминуваат од прелистувачот до Word документи и до Claude промпти. Секој премин меѓу апликации е потенцијална точка на истекување.
Лични податоци меѓу платформи: Mac, Linux и Windows
Службениците за приватност на Mac, правни тимови на Windows, инженери за податоци на Linux — сите обработуваат исти податоци со различни алатки. Еве зошто детекцијата независна од OS е суштинска.
Со воздушна изолација PII: Офлајн-прво за одбраната
41% од политиките за безбедност на претпријатија забрануваат обработка на класифицирани документи во облак. Дознајте kako офлајн-прво анонимизација функционира за мрежи со строги безбедносни барања.
Избор помеѓу реверзибилна и трајна редакција
GDPR прави разлика помеѓу анонимизација и псевдонимизација. На судовите им требаат оригинали. На истражувањата им е потребна повторна идентификација. Дознајте кога да користите кој пристап.
Повеќејазичен NER: Английскиот не успева за арапски
NER моделите на англиски јазик постигнуваат точност од 85-92%. Арапски и кинески? Честопати 50-70%. Дознајте за техничките предизвици и како да изградите вистински повеќејазична детекција.
Користете Claude и ChatGPT без да протечете лични податоци
Водич за програмери за безбедно користење на ВИ асистенти. Поставете ја интеграцијата на MCP Server за транспарентна заштита на личните податоци во Claude Desktop, Cursor и VS Code.
Започнете да ги заштитите вашите податоци денес
285+ типови на ентитети, 48 јазици, безбедност на ниво на претпријатие по стартна цена.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.