anonym.legal
Все статьиТехнические

Технические

Глубокое погружение в технологии обнаружения PII, NER и анонимизации

33 статьи

Технические

Presidio: 3 недели настройки против управляемого PII

Microsoft Presidio имеет тысячи звёзд на GitHub и сотни открытых issues. Сложность настройки, накладные расходы на интеграцию с PySpark и конфликты зависимостей Python делают самостоятельное развёртывание длительным процессом.

June 15, 20266 мин
Технические

6 недель против 3 дней: управляемый PII-API

Команда SaaS в сфере здравоохранения потратила 6 недель на развёртывание Presidio в продакшне, прежде чем перейти на управляемый API. Управляемый API заменил весь этот путь.

June 14, 20267 мин
Технические

«Бесплатное» обнаружение PII обходится в €13 000 в год

Самостоятельное развёртывание Presidio требует 40–80 часов первоначальной настройки и 5–10 часов ежемесячного обслуживания. При ставке €100/час это обходится в €13 200 и более.

June 12, 20267 мин
Технические

Проблема точности Presidio: 22,7%

Бенчмарк 2024 года показал, что распознаватель имён Presidio достигает точности лишь 22,7% на деловых документах — то есть 77,3% обнаружений являются ложными срабатываниями.

June 11, 20267 мин
Технические

Воспроизводимая конфиденциальность: пресеты для команд машинного обучения

Анонимизация обучающих данных ML должна быть последовательной и воспроизводимой. Если специалисты по данным A и B применяют разные типы сущностей, обучающие наборы данных становятся несовместимыми.

June 7, 20266 мин
Технические

GDPR-безопасный конвейер данных: анонимизация ПДн перед загрузкой в хранилище

Теги колонок dbt — это не соответствие GDPR. Необработанные данные о клиентах попадают в Snowflake без маскировки ещё до применения политик на основе тегов.

May 29, 20268 мин
Технические

FOIA: ИИ сокращает время редактирования с недель до часов

В 2024 году федеральное правительство потратило на обработку запросов по FOIA около $500 млн, преимущественно на ручное редактирование. ARPA-H специально искал ПО для редактирования на основе ИИ.

May 28, 20268 мин
Технические

Анонимизация обучающих данных ML в соответствии с GDPR

GDPR запрещает использовать персональные данные для обучения ML-моделей вне целей их первоначального сбора. Специализированные Python-скрипты не обеспечивают должного соответствия требованиям.

May 27, 20267 мин
Технические

FOIA: на 80% быстрее с пакетным обезличиванием

В FY2024 федеральные ведомства США получили 1,5 млн запросов FOIA при средней стоимости обработки $482 за запрос. Пакетное обезличивание ПДн сокращает время обработки с месяцев до недель.

May 23, 20269 мин
Технические

Presidio vs. anonym.legal: собственная разработка или готовый SaaS

Microsoft Presidio технически бесплатен, но корректное развёртывание требует 40–80 инженерных часов. anonym.legal обеспечивает ту же точность ML в виде управляемого SaaS-сервиса.

May 18, 20268 мин
Технические

Защита данных в изолированных средах: анонимизация офлайн

В средах FedRAMP и ITAR есть одна общая черта — облако не является вариантом. Обратимая псевдонимизация по GDPR Статья 4(5) — единственный соответствующий путь.

April 13, 20269 мин
Технические

Налог ложных срабатываний на инструменты PII

Issue #1071 на GitHub Presidio документирует систематические ложные срабатывания. Исследование 2024 года выявило точность 22,7% на смешанноязычных корпоративных наборах данных.

April 3, 20268 мин
Технические

Арабский и иврит: западные инструменты PII дают сбои

GDPR не заканчивается у Босфора. Арабский и иврит-PII в рабочих процессах европейского бизнеса систематически остаются незащищёнными. XLM-RoBERTa и кросс-лингвальное обнаружение для RTL-текстов.

April 1, 20268 мин
Технические

ПДн в многоязычных документах: одноязычные инструменты дают сбои

72% предприятий ЕС обрабатывают документы на трёх и более языках одновременно. Смешанноязычные документы повышают долю пропущенных ПДн в одноязычных NER-инструментах на 45%.

March 26, 20267 мин
Технические

ПДн в APAC: тайский, индонезийский, вьетнамский

Сингапурская финтех-компания, обрабатывающая 500 000 чатов поддержки ежемесячно на 12 языках APAC, обнаружила, что её инструмент на английском языке пропускает ПДн в 60% неанглийских обращений.

March 24, 20267 мин
Технические

Ложные срабатывания: почему ML-редактирование даёт сбои

Бенчмарк 2024 года выявил 13 536 ложных срабатываний при обнаружении имён в Presidio на 4 434 образцах — инструмент помечал местоимения, названия судов и стран как имена людей.

March 23, 20268 мин
Технические

ISO 27001 + нулевое знание сокращают время оценки поставщиков

Опрос 2025 года: «отсутствие признанного сертификата безопасности» — вторая причина, по которой CISO отклоняют SaaS-поставщиков. Вот что даёт комбинация ISO 27001 и нулевого знания.

March 19, 20267 мин
Технические

Архитектура нулевого знания сокращает циклы продаж

Корпоративные вопросники по безопасности поставщиков в среднем содержат 100+ вопросов. Архитектура нулевого знания даёт исчерпывающие ответы на самые сложные из них.

March 18, 20267 мин
Технические

Взлом LastPass: уроки безопасности для поставщиков

LastPass шифровал данные пользователей. Хранилища всё равно были украдены. Затем последовали 600 000+ записей Okta. SaaS-инциденты выросли на 300% с 2022 по 2024 год.

March 17, 20268 мин
Технические

Оценка заявлений о нулевом знании после LastPass

$438 млн похищено у пользователей LastPass после взлома «зашифрованных» хранилищ. Штраф ICO £1,2 млн. Вот чеклист для проверки заявлений поставщика о нулевом знании.

March 16, 20268 мин
Технические

LangChain CVE-2025-68664: как персональные данные утекают через ваш RAG-конвейер

CVSS 9.3. Функции сериализации LangChain передают переменные окружения и секреты подконтрольным атакующим LLM. Как обнаружить и устранить утечки персональных данных.

March 16, 20268 мин
Технические

Расширение LibreOffice для анонимизации персональных данных

Пошаговое руководство по анонимизации персональных данных в документах LibreOffice с помощью расширения anonym.legal.

March 10, 202610 мин
Технические

LibreOffice против Office: редактирование персональных данных

Детальное сравнение возможностей анонимизации персональных данных в LibreOffice (расширение anonym.legal) и Microsoft Office (надстройка Office).

March 10, 20268 мин
Технические

Почему бинарное обнаружение ПДн не работает для комплаенса

Флаги «обнаружено/не обнаружено» недостаточны для контекстов соответствия, требующих профессионального суждения. Оценка достоверности превращает анонимизацию ПДн из угадывания в аудируемый контроль.

March 6, 20268 мин
Технические

Фрагментация форматов документов в инструментах защиты ПДн

Один ответ на запрос субъекта данных (DSAR) может охватывать договоры Word, счета-фактуры PDF, списки клиентов Excel и экспорты CSV. Использование разных инструментов для каждого формата создаёт риски несоответствия требованиям.

March 6, 20267 мин
Технические

Анонимизация журналов для соответствия GDPR: отладка без компромиссов

Журналы приложений незаметно накапливают адреса электронной почты, IP-адреса и номера аккаунтов пользователей. Как делиться журналами с третьими сторонами, подрядчиками и платформами мониторинга, не нарушая GDPR.

March 6, 20267 мин
Технические

GDPR и журналы приложений: соответствие требованиям для JSON с ПДн

Журналы приложений содержат адреса электронной почты, IP-адреса и номера аккаунтов клиентов, которые статья 5(1)(e) GDPR обязывает контролировать. Как маскировать ПДн, не теряя ценности данных для мониторинга.

March 6, 20266 мин
Технические

Защита персональных данных в Word, Chrome и ИИ

Данные клиентов перетекают из браузера в черновики Word, а оттуда — в промпты Claude. Каждая смена контекста создаёт потенциальную точку утечки.

March 6, 20266 мин
Технические

Соответствие требованиям PII: Mac, Linux и Windows

Офицеры по конфиденциальности на Mac, юридический отдел на Windows, инженеры по данным на Linux — все обрабатывают одни данные разными инструментами. Вот почему платформонезависимое обнаружение критично.

March 6, 20266 мин
Технические

Анонимизация PII в изолированных сетях: принцип offline-first

41% корпоративных политик безопасности запрещают облачную обработку секретных документов. Узнайте, как работает анонимизация PII в изолированных сетях.

March 3, 20268 мин
Технические

Обратимое или постоянное редактирование: как сделать правильный выбор

GDPR разграничивает анонимизацию и псевдонимизацию. Суды требуют оригиналы. Исследования требуют повторной идентификации. Узнайте, когда применять каждый подход.

February 27, 20267 мин
Технические

Многоязычное NER: английские модели не справляются с арабским

NER-модели, обученные на английском, достигают 85–92% точности. На арабском и китайском? Зачастую 50–70%. Узнайте о технических сложностях и как построить по-настоящему многоязычную систему.

February 26, 20268 мин
Технические

Используйте Claude и ChatGPT без утечки персональных данных

Руководство разработчика по безопасному использованию ИИ-ассистентов. Настройте интеграцию с MCP-сервером для прозрачной защиты PII в Claude Desktop, Cursor и VS Code.

February 22, 20267 мин

Начните защищать ваши данные сегодня

285+ типов сущностей, 48 языков, безопасность корпоративного уровня по стартовым ценам.

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

We run a full check suite on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We track recall and precision on a labelled set.

Bad runs block the deploy.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

You can top up at any time.

Unused credits roll over each month.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.