anonym.legal
Сите статииТехнички

Технички

Длабински анализи на откривање на PII, NER и технологии за анонимизација

33 статии

Технички

Presidio: поставување 3 недели наспроти управуван PII

Microsoft Presidio има илјадници ѕвезди на GitHub и стотици отворени прашања. Сложеноста на поставувањето, надоверноста на PySpark интеграцијата и зависностите на Python.

June 15, 20266 мин
Технички

Од 6 недели до 3 дена: управувано PII поставување

Тимовите за здравствен SaaS трошат 6 недели на производствено распоредување на самохостиран Presidio пред да преминат на управуван API. Управуваниот API го заменува распоредувањето.

June 14, 20267 мин
Технички

Бесплатното откривање на PII чини €13.000 годишно

Самохостирањето на Presidio бара 40-80 часа за почетно поставување и 5-10 часа/месечно за тековно одржување. При инженерски ставки од €100/час, тоа е €13.200+.

June 12, 20267 мин
Технички

Проблемот со прецизноста на Presidio: 22,7%

Бенчмарк од 2024 година покажа дека препознавачот на имиња на лица на Presidio постигнува прецизност од 22,7% во деловни документи — што значи дека 77,3% од откривањата се лажни позитиви.

June 11, 20267 мин
Технички

Обновлива приватност: ML предлошки

Анонимизацијата на ML податоците за обука мора да биде конзистентна и обновлива. Ако научниците за податоци А и Б применуваат различни видови ентитети, наборите за обука се несогласувачки.

June 7, 20266 мин
Технички

GDPR цевковод: Анонимизирај пред складирање

dbt ознаките на колони не се GDPR усогласеност. Сировите клиентски податоци пристигнуваат во вашиот Snowflake магацин немаскирани пред да се применат политиките базирани на ознаки.

May 29, 20268 мин
Технички

FOIA: Редакција од недели до часови

Федералната влада потрошила проценети $500M на обработка на FOIA во 2024 година, главно рачна редакција. ARPA-H изречно барал AI софтвер за редакција за да го реши огромниот заостаток.

May 28, 20268 мин
Технички

GDPR анонимизација на податоци за обука на ML

GDPR ги ограничува употребата на лични податоци за обука на ML надвор од оригиналната намена на нивното собирање. Тимовите за наука на податоци кои се потпираат на ad-hoc Python скрипти создаваат сериозни проблеми.

May 27, 20267 мин
Технички

FOIA: 80% побрзо со пакетна редакција

Федералните агенции на САД добиле 1,5 милиони барања за FOIA во финансиската 2024 година при просечен трошок од $482 по барање. Пакетната редакција на лични податоци го намалува времето за обработка од.

May 23, 20269 мин
Технички

Presidio vs. anonym.legal: Изградба наспроти купување

Microsoft Presidio е технички бесплатен, но чини 40-80 инженерски часа за правилно распоредување. anonym.legal обезбедува иста точност на ML-моделите во форма на управуван SaaS.

May 18, 20268 мин
Технички

Приватност со воздушна изолација: Анонимизирајте офлајн

FedRAMP и ITAR средините имаат една заедничка работа — облакот не е опција. Реверзибилна псевдонимизација според GDPR Чл. 4(5) бара посебно складирање на токенот.

April 13, 20269 мин
Технички

Данокот на лажно позитивни резултати кај PII алатките

GitHub проблемот #1071 на Presidio документира систематски лажно позитивни резултати. Студија од 2024 откри прецизност од 22,7% во мешано-јазични деловни датасети.

April 3, 20268 мин
Технички

Арапски и хебрејски PII: западните алатки не успеваат

GDPR не завршува на Босфорот. Арапски и хебрејски лични податоци во деловните процеси на ЕУ се систематски незаштитени. XLM-RoBERTa меѓујазичното детектирање и регионалните типови ентитети ја затвораат оваа правна дупка.

April 1, 20268 мин
Технички

PII на мешан јазик: Еднојазичните алатки не успеваат

72% од компаниите во ЕУ обработуваат документи на 3+ јазици истовремено. Мешано-јазичните документи предизвикуваат 45% повисоки стапки на пропуштање PII кај еднојазичните NER алатки.

March 26, 20267 мин
Технички

APAC ЛЛИ: тајландски, индонезиски, виетнамски

Компанија за финансиски технологии во Сингапур која обработува 500.000 месечни разговори за поддршка на 12 APAC јазика откри дека нивната алатка само на англиски пропушта ЛЛИ во 60% од разговорите кои не се на англиски.

March 24, 20267 мин
Технички

Лажни позитиви на Presidio: Зошто ML редакцијата не успева

Бенчмарк од 2024 година откри дека Presidio генерирал 13.536 лажни позитивни детекции на имиња низ 4.434 примероци - означувајќи заменки, имиња на бродови и земји како лични имиња. Еве колку тоа чини во правни и здравствени средини.

March 23, 20268 мин
Технички

ISO 27001 + ZK го скратуваат времето за оценка на добавувачи

Истражување од 2025 година покажа дека 'недостатокот на признаена безбедносна сертификација' е втората причина поради која CISO ги дисквалификуваат SaaS добавувачите. Еве го она што го нуди комбинацијата ISO 27001 + нулта знаење.

March 19, 20267 мин
Технички

ZK архитектурата ги скратува продажните циклуси

Безбедносните прашалници на корпоративните добавувачи содржат 100+ прашања. Архитектурата со нулта знаење дава дефинитивни одговори на најтешките прашања - и конвертира.

March 18, 20267 мин
Технички

Пробивот на LastPass: лекции за безбедноста на добавувачите

LastPass ги шифрирале податоците на своите корисници. Трезорите сепак биле ексфилтрирани. Следеле 600.000+ записи на Okta. Безбедносните инциденти на SaaS се зголемиле за 300% од 2022 до 2024 година.

March 17, 20268 мин
Технички

Евалуација на тврдења за нула-знаење по LastPass

438 милиони $ украдени од корисниците на LastPass откако нивните 'шифрирани' трезори биле пробиени. Следела казна на ICO од 1,2 милиони фунти. Еве контролна листа за проценка на тоа дали тврдењата на добавувачот навистина се однесуваат.

March 16, 20268 мин
Технички

LangChain CVE-2025-68664: Како личните податоци протекуваат низ вашиот RAG Pipeline

CVSS 9,3. Функциите за серијализација на LangChain ги изложуваат променливите на околината и тајните на LLM-ови контролирани од напаѓачи. Како да откривате и поправате протекување на PII.

March 16, 20268 мин
Технички

LibreOffice додаток за анонимизација на лични податоци

Чекор по чекор водич за анонимизација на лични податоци во LibreOffice документи со помош на додатокот anonym.legal.

March 10, 202610 мин
Технички

LibreOffice vs Office: Редакција на лични податоци

Детална споредба на можностите за анонимизација на лични податоци во LibreOffice (додаток anonym.legal) vs. Microsoft Office (Office додаток).

March 10, 20268 мин
Технички

Зошто бинарното откривање на лични податоци не ја задоволува усогласеноста

Ознаките откривено/неоткривено не се доволни за контексти на усогласеност кои бараат човечка проценка. Оценувањето на доверба ја претвора анонимизацијата на лични податоци од бинарно погодување во ревидирачка контрола за усогласеност.

March 6, 20268 мин
Технички

Фрагментација на Формати на Документи во Алатки за Лични Податоци

Единствен одговор на DSAR може да опфати Word договори, PDF фактури, Excel списоци на клиенти и CSV извози. Користењето различни алатки за секој формат создава јазови во усогласеноста.

March 6, 20267 мин
Технички

GDPR Анонимизација на Дневници: Задржете го Дебагирањето

Апликациските дневници молчешкум акумулираат е-пошти на корисниците, IP адреси и броеви на сметки. Еве како да ги споделите дневниците со трети страни, изведувачи и платформи за набљудување.

March 6, 20267 мин
Технички

GDPR во Апликациски Дневници: JSON PII Усогласеност

Апликациските дневници содржат е-пошта адреси, IP адреси и броеви на сметки на клиентите кои GDPR Член 5(1)(е) бара да бидат управувани.

March 6, 20266 мин
Технички

Заштита на лични податоци низ апликации: Word, Chrome и AI

Податоците за клиентите преминуваат од прелистувачот до Word документи и до Claude промпти. Секој премин меѓу апликации е потенцијална точка на истекување.

March 6, 20266 мин
Технички

Лични податоци меѓу платформи: Mac, Linux и Windows

Службениците за приватност на Mac, правни тимови на Windows, инженери за податоци на Linux — сите обработуваат исти податоци со различни алатки. Еве зошто детекцијата независна од OS е суштинска.

March 6, 20266 мин
Технички

Со воздушна изолација PII: Офлајн-прво за одбраната

41% од политиките за безбедност на претпријатија забрануваат обработка на класифицирани документи во облак. Дознајте kako офлајн-прво анонимизација функционира за мрежи со строги безбедносни барања.

March 3, 20268 мин
Технички

Избор помеѓу реверзибилна и трајна редакција

GDPR прави разлика помеѓу анонимизација и псевдонимизација. На судовите им требаат оригинали. На истражувањата им е потребна повторна идентификација. Дознајте кога да користите кој пристап.

February 27, 20267 мин
Технички

Повеќејазичен NER: Английскиот не успева за арапски

NER моделите на англиски јазик постигнуваат точност од 85-92%. Арапски и кинески? Честопати 50-70%. Дознајте за техничките предизвици и како да изградите вистински повеќејазична детекција.

February 26, 20268 мин
Технички

Користете Claude и ChatGPT без да протечете лични податоци

Водич за програмери за безбедно користење на ВИ асистенти. Поставете ја интеграцијата на MCP Server за транспарентна заштита на личните податоци во Claude Desktop, Cursor и VS Code.

February 22, 20267 мин

Започнете да ги заштитите вашите податоци денес

285+ типови на ентитети, 48 јазици, безбедност на ниво на претпријатие по стартна цена.

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

We run a full check suite on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We track recall and precision on a labelled set.

Bad runs block the deploy.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

You can top up at any time.

Unused credits roll over each month.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.