Технически
Дълбочинни анализи на откритие на PII, NER и технологии за анонимизация
33 статии
Presidio: 3-седмична настройка срещу управляван PII
Microsoft Presidio има хиляди звезди в GitHub и стотици отворени проблеми. Сложността на настройката, интеграционните разходи с PySpark и зависимостите на Python правят го труден за производствена употреба.
От 6 седмици до 3 дни: настройка на управляван PII API
Екипите за здравен SaaS прекарват 6 седмици в производствено разгръщане на собствено хостван Presidio, преди да преминат към управляван API. Управляваният API заменя разгръщането.
Безплатното разпознаване на PII данни струва 13 000 EUR годишно
Собственото хостване на Presidio изисква 40-80 часа начална настройка и 5-10 часа месечна поддръжка. При ставка от 100 EUR на час за инженери, това е 13 200+ EUR.
Проблемът с точността от 22,7% при Presidio
Бенчмарк от 2024 г. установи, че разпознавателят на лични имена в Presidio постига 22,7% точност при бизнес документи -- което означава, че 77,3% от засечените резултати са фалшиви положителни.
Възпроизводима поверителност: ML настройки
Анонимизирането на обучителните данни за ML трябва да бъде последователно и възпроизводимо. Ако учените по данни A и B прилагат различни типове обекти, обучителните набори от данни са непоследователни.
GDPR тръбопровод: Анонимизация преди съхранение
Тагването на колони в dbt не е GDPR съответствие. Необработените клиентски данни попадат в Snowflake хранилището без маскиране, преди да се приложат политиките за маркиране.
FOIA: Редакция от седмици до часове с AI
Федералното правителство е похарчило около 500 млн. долара за обработка на FOIA заявки през 2024 г., предимно за ръчна редакция. ARPA-H изрично е търсила AI софтуер за редакция.
Анонимизация на данни за ML обучение съгласно GDPR
GDPR ограничава използването на лични данни за ML обучение извън първоначалната им цел. Екипите, разчитащи на Python скриптове, създават пропуски в съответствието.
FOIA: 80% по-бързо с пакетно заличаване
Федералните агенции на САЩ са получили 1,5 милиона FOIA заявки за FY2024 при средна цена от 482 долара на заявка. Пакетното заличаване на лични данни намалява времето за обработка от.
Presidio срещу anonym.legal: Изграждане или покупка
Microsoft Presidio е технически безплатен, но струва 40-80 инженерни часа за правилно внедряване. anonym.legal доставя същата ML точност като управляван SaaS.
Поверителност с Въздушна Бариера: Анонимизиране Офлайн
Средите FedRAMP и ITAR имат едно общо - облакът не е вариант. Обратима псевдонимизация по GDPR Чл. 4(5) за класифицирани работни процеси.
Данъкът от фалшиви позитиви при PII инструментите
GitHub issue #1071 на Presidio документира систематични фалшиви позитиви. Проучване от 2024 г. установи 22,7% точност в многоезични корпоративни набори от данни.
Арабски и иврит PII: Западните инструменти се провалят
GDPR не свършва на Босфора. Арабски и иврит PII в работните процеси на ЕС фирмите е системно незащитен. XLM-RoBERTa с крос-лингвална детекция и специфични за региона типове субекти са единственият надежден подход.
PII в смесени езикови документи: Едноезичните инструменти се провалят
72% от предприятията в ЕС обработват документи на 3 или повече езика едновременно. Смесените езикови документи причиняват 45% по-висок процент на пропуснати PII в едноезичните NER инструменти.
PII в APAC: Тайландски, индонезийски, виетнамски
Сингапурска финтех компания, обработваща 500 000 месечни чата за поддръжка на 12 езика в APAC, установи, че инструментът им само на английски пропуска PII в 60% от нeanглийските разговори.
Фалшиви позитиви в Presidio: Цената им в правото и здравеопазването
Бенчмарк от 2024 г. установи, че Microsoft Presidio е генерирал 13 536 фалшиво положителни детекции на имена сред 4 434 образца - маркирайки местоимения, имена на кораби и страни като лични имена. Ето какво струва това в правна и здравна среда.
ISO 27001 + ZK съкращава времето за оценка на доставчици
Проучване от 2025 г. установи, че 'липсата на призната сертификация по сигурност' е причина номер 2 CISO-те да дисквалифицират SaaS доставчиците. Ето какво дава комбинацията ISO 27001 и zero-knowledge дизайн.
ZK архитектурата съкращава търговските цикли
Корпоративните въпросници за сигурност на доставчиците средно съдържат над 100 въпроса. Zero-knowledge архитектурата отговаря категорично на най-трудните от тях - и превръща проверките в сключени сделки.
Пробивът на LastPass: Поуки за сигурността на доставчиците
LastPass е криптирал данните на потребителите си. Трезорите все пак бяха изнесени. Последваха 600 000+ записа от Okta. Инцидентите в SaaS сигурността са нараснали с 300% от 2022 до 2024 г.
Оценяване на твърдения за нулево знание след LastPass
438 милиона долара са откраднати от потребители на LastPass, след като техните 'криптирани' трезори бяха пробити. Последва глоба от 1,2 милиона лири от ICO. Ето контролния списък за оценка дали твърдението на даден доставчик реално се поддържа.
LangChain CVE-2025-68664: Как личните данни изтичат през RAG тръбопровода ви
CVSS 9.3. Функциите за сериализация на LangChain излагат променливи на средата и тайни пред LLM-и, контролирани от атакуващи. Как да разпознаете и поправите изтичането на лични данни.
Разширение за анонимизация на лични данни в LibreOffice
Ръководство стъпка по стъпка за анонимизиране на лични данни в документи на LibreOffice с помощта на разширението anonym.legal.
LibreOffice срещу Office: Редактиране на лични данни
Подробно сравнение на възможностите за анонимизация на лични данни в LibreOffice (разширение anonym.legal) спрямо Microsoft Office (Office Add-in).
Защо бинарното засичане на лични данни не отговаря на изискванията за съответствие
Маркерите открито/не е открито са недостатъчни за контекстите на съответствие, изискващи човешка преценка. Ето защо оценяването на доверие трансформира анонимизирането на лични данни.
Фрагментация на формати при инструменти за PII
Един отговор по DSAR може да обхваща договори в Word, фактури в PDF, списъци с клиенти в Excel и CSV експорти. Използването на различни инструменти за всеки формат създава пропуски в съответствието.
Анонимизиране на JSON логове по GDPR: Запазете отстраняването на грешки
Приложните журнали тихо натрупват имейли на потребители, IP адреси и номера на сметки. Ето как да споделяте журнали с трети страни, изпълнители и платформи за наблюдение, без да нарушавате GDPR.
GDPR в журналите на приложенията: Съответствие на JSON PII
Журналите на приложенията съдържат имейл адреси на клиенти, IP адреси и номера на сметки, чието управление се изисква от член 5(1)(д) от GDPR.
Защита на лични данни в множество приложения: Word, Chrome и AI
Клиентските данни преминават от браузъра към Word и после към Claude. Всяко превключване между контексти е потенциална точка на изтичане.
Лични данни между платформи: Mac, Linux и Windows
Служителите по поверителност на Mac, правният отдел на Windows, инженерите на данни на Linux — всички обработват едни и същи данни с различни инструменти. Ето защо платформено-независимото засичане е от ключово значение.
Анонимизиране на лични данни без мрежа: Офлайн подход за отбраната
41% от корпоративните политики за сигурност забраняват облачна обработка на класифицирани документи.
Обратимо срещу постоянно редактиране: Правилният избор
GDPR прави разграничение между анонимизиране и псевдонимизиране. Съдилищата се нуждаят от оригинали. Изследванията изискват повторна идентификация. Научете кога да използвате всеки подход.
Многоезично NER: Английски моделе се провалят при арабски
Английските NER модели постигат 85-92% точност. Арабски и китайски? Често 50-70%. Научете за техническите предизвикателства и как да изградите наистина многоезично решение.
Използвайте Claude и ChatGPT без изтичане на лични данни
Ръководство за разработчици за сигурно използване на ИИ асистенти. Настройте интеграция с MCP Server за прозрачна защита на лични данни в Claude Desktop, Cursor и VS Code.
Започнете да защитавате данните си днес
285+ типа субекти, 48 езика, сигурност на ниво предприятие на стартиращи цени.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.