Технические
Глубокое погружение в технологии обнаружения PII, NER и анонимизации
33 статьи
Presidio: 3 недели настройки против управляемого PII
Microsoft Presidio имеет тысячи звёзд на GitHub и сотни открытых issues. Сложность настройки, накладные расходы на интеграцию с PySpark и конфликты зависимостей Python делают самостоятельное развёртывание длительным процессом.
6 недель против 3 дней: управляемый PII-API
Команда SaaS в сфере здравоохранения потратила 6 недель на развёртывание Presidio в продакшне, прежде чем перейти на управляемый API. Управляемый API заменил весь этот путь.
«Бесплатное» обнаружение PII обходится в €13 000 в год
Самостоятельное развёртывание Presidio требует 40–80 часов первоначальной настройки и 5–10 часов ежемесячного обслуживания. При ставке €100/час это обходится в €13 200 и более.
Проблема точности Presidio: 22,7%
Бенчмарк 2024 года показал, что распознаватель имён Presidio достигает точности лишь 22,7% на деловых документах — то есть 77,3% обнаружений являются ложными срабатываниями.
Воспроизводимая конфиденциальность: пресеты для команд машинного обучения
Анонимизация обучающих данных ML должна быть последовательной и воспроизводимой. Если специалисты по данным A и B применяют разные типы сущностей, обучающие наборы данных становятся несовместимыми.
GDPR-безопасный конвейер данных: анонимизация ПДн перед загрузкой в хранилище
Теги колонок dbt — это не соответствие GDPR. Необработанные данные о клиентах попадают в Snowflake без маскировки ещё до применения политик на основе тегов.
FOIA: ИИ сокращает время редактирования с недель до часов
В 2024 году федеральное правительство потратило на обработку запросов по FOIA около $500 млн, преимущественно на ручное редактирование. ARPA-H специально искал ПО для редактирования на основе ИИ.
Анонимизация обучающих данных ML в соответствии с GDPR
GDPR запрещает использовать персональные данные для обучения ML-моделей вне целей их первоначального сбора. Специализированные Python-скрипты не обеспечивают должного соответствия требованиям.
FOIA: на 80% быстрее с пакетным обезличиванием
В FY2024 федеральные ведомства США получили 1,5 млн запросов FOIA при средней стоимости обработки $482 за запрос. Пакетное обезличивание ПДн сокращает время обработки с месяцев до недель.
Presidio vs. anonym.legal: собственная разработка или готовый SaaS
Microsoft Presidio технически бесплатен, но корректное развёртывание требует 40–80 инженерных часов. anonym.legal обеспечивает ту же точность ML в виде управляемого SaaS-сервиса.
Защита данных в изолированных средах: анонимизация офлайн
В средах FedRAMP и ITAR есть одна общая черта — облако не является вариантом. Обратимая псевдонимизация по GDPR Статья 4(5) — единственный соответствующий путь.
Налог ложных срабатываний на инструменты PII
Issue #1071 на GitHub Presidio документирует систематические ложные срабатывания. Исследование 2024 года выявило точность 22,7% на смешанноязычных корпоративных наборах данных.
Арабский и иврит: западные инструменты PII дают сбои
GDPR не заканчивается у Босфора. Арабский и иврит-PII в рабочих процессах европейского бизнеса систематически остаются незащищёнными. XLM-RoBERTa и кросс-лингвальное обнаружение для RTL-текстов.
ПДн в многоязычных документах: одноязычные инструменты дают сбои
72% предприятий ЕС обрабатывают документы на трёх и более языках одновременно. Смешанноязычные документы повышают долю пропущенных ПДн в одноязычных NER-инструментах на 45%.
ПДн в APAC: тайский, индонезийский, вьетнамский
Сингапурская финтех-компания, обрабатывающая 500 000 чатов поддержки ежемесячно на 12 языках APAC, обнаружила, что её инструмент на английском языке пропускает ПДн в 60% неанглийских обращений.
Ложные срабатывания: почему ML-редактирование даёт сбои
Бенчмарк 2024 года выявил 13 536 ложных срабатываний при обнаружении имён в Presidio на 4 434 образцах — инструмент помечал местоимения, названия судов и стран как имена людей.
ISO 27001 + нулевое знание сокращают время оценки поставщиков
Опрос 2025 года: «отсутствие признанного сертификата безопасности» — вторая причина, по которой CISO отклоняют SaaS-поставщиков. Вот что даёт комбинация ISO 27001 и нулевого знания.
Архитектура нулевого знания сокращает циклы продаж
Корпоративные вопросники по безопасности поставщиков в среднем содержат 100+ вопросов. Архитектура нулевого знания даёт исчерпывающие ответы на самые сложные из них.
Взлом LastPass: уроки безопасности для поставщиков
LastPass шифровал данные пользователей. Хранилища всё равно были украдены. Затем последовали 600 000+ записей Okta. SaaS-инциденты выросли на 300% с 2022 по 2024 год.
Оценка заявлений о нулевом знании после LastPass
$438 млн похищено у пользователей LastPass после взлома «зашифрованных» хранилищ. Штраф ICO £1,2 млн. Вот чеклист для проверки заявлений поставщика о нулевом знании.
LangChain CVE-2025-68664: как персональные данные утекают через ваш RAG-конвейер
CVSS 9.3. Функции сериализации LangChain передают переменные окружения и секреты подконтрольным атакующим LLM. Как обнаружить и устранить утечки персональных данных.
Расширение LibreOffice для анонимизации персональных данных
Пошаговое руководство по анонимизации персональных данных в документах LibreOffice с помощью расширения anonym.legal.
LibreOffice против Office: редактирование персональных данных
Детальное сравнение возможностей анонимизации персональных данных в LibreOffice (расширение anonym.legal) и Microsoft Office (надстройка Office).
Почему бинарное обнаружение ПДн не работает для комплаенса
Флаги «обнаружено/не обнаружено» недостаточны для контекстов соответствия, требующих профессионального суждения. Оценка достоверности превращает анонимизацию ПДн из угадывания в аудируемый контроль.
Фрагментация форматов документов в инструментах защиты ПДн
Один ответ на запрос субъекта данных (DSAR) может охватывать договоры Word, счета-фактуры PDF, списки клиентов Excel и экспорты CSV. Использование разных инструментов для каждого формата создаёт риски несоответствия требованиям.
Анонимизация журналов для соответствия GDPR: отладка без компромиссов
Журналы приложений незаметно накапливают адреса электронной почты, IP-адреса и номера аккаунтов пользователей. Как делиться журналами с третьими сторонами, подрядчиками и платформами мониторинга, не нарушая GDPR.
GDPR и журналы приложений: соответствие требованиям для JSON с ПДн
Журналы приложений содержат адреса электронной почты, IP-адреса и номера аккаунтов клиентов, которые статья 5(1)(e) GDPR обязывает контролировать. Как маскировать ПДн, не теряя ценности данных для мониторинга.
Защита персональных данных в Word, Chrome и ИИ
Данные клиентов перетекают из браузера в черновики Word, а оттуда — в промпты Claude. Каждая смена контекста создаёт потенциальную точку утечки.
Соответствие требованиям PII: Mac, Linux и Windows
Офицеры по конфиденциальности на Mac, юридический отдел на Windows, инженеры по данным на Linux — все обрабатывают одни данные разными инструментами. Вот почему платформонезависимое обнаружение критично.
Анонимизация PII в изолированных сетях: принцип offline-first
41% корпоративных политик безопасности запрещают облачную обработку секретных документов. Узнайте, как работает анонимизация PII в изолированных сетях.
Обратимое или постоянное редактирование: как сделать правильный выбор
GDPR разграничивает анонимизацию и псевдонимизацию. Суды требуют оригиналы. Исследования требуют повторной идентификации. Узнайте, когда применять каждый подход.
Многоязычное NER: английские модели не справляются с арабским
NER-модели, обученные на английском, достигают 85–92% точности. На арабском и китайском? Зачастую 50–70%. Узнайте о технических сложностях и как построить по-настоящему многоязычную систему.
Используйте Claude и ChatGPT без утечки персональных данных
Руководство разработчика по безопасному использованию ИИ-ассистентов. Настройте интеграцию с MCP-сервером для прозрачной защиты PII в Claude Desktop, Cursor и VS Code.
Начните защищать ваши данные сегодня
285+ типов сущностей, 48 языков, безопасность корпоративного уровня по стартовым ценам.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.