anonym.legal
Всички статииТехнически

Технически

Дълбочинни анализи на откритие на PII, NER и технологии за анонимизация

33 статии

Технически

Presidio: 3-седмична настройка срещу управляван PII

Microsoft Presidio има хиляди звезди в GitHub и стотици отворени проблеми. Сложността на настройката, интеграционните разходи с PySpark и зависимостите на Python правят го труден за производствена употреба.

June 15, 20266 мин
Технически

От 6 седмици до 3 дни: настройка на управляван PII API

Екипите за здравен SaaS прекарват 6 седмици в производствено разгръщане на собствено хостван Presidio, преди да преминат към управляван API. Управляваният API заменя разгръщането.

June 14, 20267 мин
Технически

Безплатното разпознаване на PII данни струва 13 000 EUR годишно

Собственото хостване на Presidio изисква 40-80 часа начална настройка и 5-10 часа месечна поддръжка. При ставка от 100 EUR на час за инженери, това е 13 200+ EUR.

June 12, 20267 мин
Технически

Проблемът с точността от 22,7% при Presidio

Бенчмарк от 2024 г. установи, че разпознавателят на лични имена в Presidio постига 22,7% точност при бизнес документи -- което означава, че 77,3% от засечените резултати са фалшиви положителни.

June 11, 20267 мин
Технически

Възпроизводима поверителност: ML настройки

Анонимизирането на обучителните данни за ML трябва да бъде последователно и възпроизводимо. Ако учените по данни A и B прилагат различни типове обекти, обучителните набори от данни са непоследователни.

June 7, 20266 мин
Технически

GDPR тръбопровод: Анонимизация преди съхранение

Тагването на колони в dbt не е GDPR съответствие. Необработените клиентски данни попадат в Snowflake хранилището без маскиране, преди да се приложат политиките за маркиране.

May 29, 20268 мин
Технически

FOIA: Редакция от седмици до часове с AI

Федералното правителство е похарчило около 500 млн. долара за обработка на FOIA заявки през 2024 г., предимно за ръчна редакция. ARPA-H изрично е търсила AI софтуер за редакция.

May 28, 20268 мин
Технически

Анонимизация на данни за ML обучение съгласно GDPR

GDPR ограничава използването на лични данни за ML обучение извън първоначалната им цел. Екипите, разчитащи на Python скриптове, създават пропуски в съответствието.

May 27, 20267 мин
Технически

FOIA: 80% по-бързо с пакетно заличаване

Федералните агенции на САЩ са получили 1,5 милиона FOIA заявки за FY2024 при средна цена от 482 долара на заявка. Пакетното заличаване на лични данни намалява времето за обработка от.

May 23, 20269 мин
Технически

Presidio срещу anonym.legal: Изграждане или покупка

Microsoft Presidio е технически безплатен, но струва 40-80 инженерни часа за правилно внедряване. anonym.legal доставя същата ML точност като управляван SaaS.

May 18, 20268 мин
Технически

Поверителност с Въздушна Бариера: Анонимизиране Офлайн

Средите FedRAMP и ITAR имат едно общо - облакът не е вариант. Обратима псевдонимизация по GDPR Чл. 4(5) за класифицирани работни процеси.

April 13, 20269 мин
Технически

Данъкът от фалшиви позитиви при PII инструментите

GitHub issue #1071 на Presidio документира систематични фалшиви позитиви. Проучване от 2024 г. установи 22,7% точност в многоезични корпоративни набори от данни.

April 3, 20268 мин
Технически

Арабски и иврит PII: Западните инструменти се провалят

GDPR не свършва на Босфора. Арабски и иврит PII в работните процеси на ЕС фирмите е системно незащитен. XLM-RoBERTa с крос-лингвална детекция и специфични за региона типове субекти са единственият надежден подход.

April 1, 20268 мин
Технически

PII в смесени езикови документи: Едноезичните инструменти се провалят

72% от предприятията в ЕС обработват документи на 3 или повече езика едновременно. Смесените езикови документи причиняват 45% по-висок процент на пропуснати PII в едноезичните NER инструменти.

March 26, 20267 мин
Технически

PII в APAC: Тайландски, индонезийски, виетнамски

Сингапурска финтех компания, обработваща 500 000 месечни чата за поддръжка на 12 езика в APAC, установи, че инструментът им само на английски пропуска PII в 60% от нeanглийските разговори.

March 24, 20267 мин
Технически

Фалшиви позитиви в Presidio: Цената им в правото и здравеопазването

Бенчмарк от 2024 г. установи, че Microsoft Presidio е генерирал 13 536 фалшиво положителни детекции на имена сред 4 434 образца - маркирайки местоимения, имена на кораби и страни като лични имена. Ето какво струва това в правна и здравна среда.

March 23, 20268 мин
Технически

ISO 27001 + ZK съкращава времето за оценка на доставчици

Проучване от 2025 г. установи, че 'липсата на призната сертификация по сигурност' е причина номер 2 CISO-те да дисквалифицират SaaS доставчиците. Ето какво дава комбинацията ISO 27001 и zero-knowledge дизайн.

March 19, 20267 мин
Технически

ZK архитектурата съкращава търговските цикли

Корпоративните въпросници за сигурност на доставчиците средно съдържат над 100 въпроса. Zero-knowledge архитектурата отговаря категорично на най-трудните от тях - и превръща проверките в сключени сделки.

March 18, 20267 мин
Технически

Пробивът на LastPass: Поуки за сигурността на доставчиците

LastPass е криптирал данните на потребителите си. Трезорите все пак бяха изнесени. Последваха 600 000+ записа от Okta. Инцидентите в SaaS сигурността са нараснали с 300% от 2022 до 2024 г.

March 17, 20268 мин
Технически

Оценяване на твърдения за нулево знание след LastPass

438 милиона долара са откраднати от потребители на LastPass, след като техните 'криптирани' трезори бяха пробити. Последва глоба от 1,2 милиона лири от ICO. Ето контролния списък за оценка дали твърдението на даден доставчик реално се поддържа.

March 16, 20268 мин
Технически

LangChain CVE-2025-68664: Как личните данни изтичат през RAG тръбопровода ви

CVSS 9.3. Функциите за сериализация на LangChain излагат променливи на средата и тайни пред LLM-и, контролирани от атакуващи. Как да разпознаете и поправите изтичането на лични данни.

March 16, 20268 мин
Технически

Разширение за анонимизация на лични данни в LibreOffice

Ръководство стъпка по стъпка за анонимизиране на лични данни в документи на LibreOffice с помощта на разширението anonym.legal.

March 10, 202610 мин
Технически

LibreOffice срещу Office: Редактиране на лични данни

Подробно сравнение на възможностите за анонимизация на лични данни в LibreOffice (разширение anonym.legal) спрямо Microsoft Office (Office Add-in).

March 10, 20268 мин
Технически

Защо бинарното засичане на лични данни не отговаря на изискванията за съответствие

Маркерите открито/не е открито са недостатъчни за контекстите на съответствие, изискващи човешка преценка. Ето защо оценяването на доверие трансформира анонимизирането на лични данни.

March 6, 20268 мин
Технически

Фрагментация на формати при инструменти за PII

Един отговор по DSAR може да обхваща договори в Word, фактури в PDF, списъци с клиенти в Excel и CSV експорти. Използването на различни инструменти за всеки формат създава пропуски в съответствието.

March 6, 20267 мин
Технически

Анонимизиране на JSON логове по GDPR: Запазете отстраняването на грешки

Приложните журнали тихо натрупват имейли на потребители, IP адреси и номера на сметки. Ето как да споделяте журнали с трети страни, изпълнители и платформи за наблюдение, без да нарушавате GDPR.

March 6, 20267 мин
Технически

GDPR в журналите на приложенията: Съответствие на JSON PII

Журналите на приложенията съдържат имейл адреси на клиенти, IP адреси и номера на сметки, чието управление се изисква от член 5(1)(д) от GDPR.

March 6, 20266 мин
Технически

Защита на лични данни в множество приложения: Word, Chrome и AI

Клиентските данни преминават от браузъра към Word и после към Claude. Всяко превключване между контексти е потенциална точка на изтичане.

March 6, 20266 мин
Технически

Лични данни между платформи: Mac, Linux и Windows

Служителите по поверителност на Mac, правният отдел на Windows, инженерите на данни на Linux — всички обработват едни и същи данни с различни инструменти. Ето защо платформено-независимото засичане е от ключово значение.

March 6, 20266 мин
Технически

Анонимизиране на лични данни без мрежа: Офлайн подход за отбраната

41% от корпоративните политики за сигурност забраняват облачна обработка на класифицирани документи.

March 3, 20268 мин
Технически

Обратимо срещу постоянно редактиране: Правилният избор

GDPR прави разграничение между анонимизиране и псевдонимизиране. Съдилищата се нуждаят от оригинали. Изследванията изискват повторна идентификация. Научете кога да използвате всеки подход.

February 27, 20267 мин
Технически

Многоезично NER: Английски моделе се провалят при арабски

Английските NER модели постигат 85-92% точност. Арабски и китайски? Често 50-70%. Научете за техническите предизвикателства и как да изградите наистина многоезично решение.

February 26, 20268 мин
Технически

Използвайте Claude и ChatGPT без изтичане на лични данни

Ръководство за разработчици за сигурно използване на ИИ асистенти. Настройте интеграция с MCP Server за прозрачна защита на лични данни в Claude Desktop, Cursor и VS Code.

February 22, 20267 мин

Започнете да защитавате данните си днес

285+ типа субекти, 48 езика, сигурност на ниво предприятие на стартиращи цени.

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

We run a full check suite on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We track recall and precision on a labelled set.

Bad runs block the deploy.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

You can top up at any time.

Unused credits roll over each month.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.