모든 기사기술

기술

PII 탐지, NER 및 익명화 기술에 대한 심층 분석

33 기사들

기술

Presidio: 3주 설치 vs 관리형 PII 서비스

Microsoft Presidio는 수천 개의 GitHub 스타와 수백 개의 미해결 이슈를 보유합니다. 설치 복잡성, PySpark 통합 오버헤드, Python 의존성 문제를 관리형 대안과 비교합니다.

June 15, 20266
기술

6주에서 3일로: 관리형 PII API vs. Presidio 자체 호스팅

의료 SaaS 팀이 관리형 API로 전환하기 전 Presidio 프로덕션 배포에 6주를 소비했습니다. 관리형 API가 배포 작업을 대체한 방법을 알아보세요.

June 14, 20267
기술

"무료" PII 감지의 실제 비용: 연간 1만 3천 유로

Presidio 자체 호스팅에는 초기 설정에 40~80시간, 월간 유지보수에 5~10시간이 필요합니다. 시간당 100유로의 엔지니어링 비용으로 계산하면 연간 1만 3,200유로 이상입니다.

June 12, 20267
기술

Presidio 22.7% 정밀도 문제

2024년 벤치마크에서 비즈니스 문서에 대한 Presidio의 인명 인식기 정밀도가 22.7%로 나타났습니다. 플래그된 항목의 77.3%가 오탐이라는 의미입니다.

June 11, 20267
기술

재현 가능한 개인정보 보호: ML 학습 데이터 프리셋

ML 학습 데이터 익명화는 일관적이고 재현 가능해야 합니다. 데이터 과학자 A와 B가 서로 다른 엔티티 유형을 적용하면 학습 데이터셋의 신뢰성이 무너집니다.

June 7, 20266
기술

GDPR 안전 파이프라인: 저장 전 PII 익명화

dbt 컬럼 태그는 GDPR 컴플라이언스가 아닙니다. 원본 고객 데이터는 태그 기반 정책이 적용되기 전에 마스킹 없이 Snowflake 웨어하우스에 도달합니다.

May 29, 20268
기술

FOIA: 비식별화 처리 기간을 몇 주에서 몇 시간으로

연방 정부는 2024년 FOIA 처리에 약 5억 달러를 지출했으며, 대부분이 수동 비식별화 비용이었습니다. ARPA-H는 AI 비식별화 소프트웨어를 명시적으로 요청했습니다.

May 28, 20268
기술

GDPR 준수 ML 학습 데이터 익명화

GDPR은 원래 수집 목적을 넘어 ML 학습에 개인 데이터를 사용하는 것을 제한합니다. 임기응변식 Python 스크립트에 의존하는 데이터 과학자는 감사 실패와 컴플라이언스 공백을 만들게 됩니다.

May 27, 20267
기술

FOIA: 배치 마스킹으로 처리 시간 80% 단축

미국 연방 기관은 2024 회계연도에 150만 건의 FOIA 요청을 수신했으며, 건당 평균 비용은 $482였습니다. 배치 PII 마스킹은 처리 시간을 수개월에서 수 주로 단축합니다.

May 23, 20269
기술

Presidio vs anonym.legal: 직접 구축 vs 구매

Microsoft Presidio는 기술적으로 무료지만 제대로 배포하려면 40~80시간의 엔지니어링 공수가 필요합니다. anonym.legal은 동일한 ML 정확도를 관리형 SaaS로 제공합니다.

May 18, 20268
기술

망분리 환경에서의 개인정보 익명화

FedRAMP와 ITAR 환경의 공통점은 하나입니다 — 클라우드는 선택지가 아닙니다. GDPR 제4조 제5항에 따른 가역적 가명화와 로컬 처리 방법을 알아보세요.

April 13, 20269
기술

PII 탐지 도구의 오탐 비용

Presidio GitHub 이슈 #1071은 체계적인 오탐을 기록합니다. 2024년 연구에 따르면 혼합 언어 기업 데이터셋에서 정밀도가 22.7%에 불과합니다.

April 3, 20268
기술

아랍어·히브리어 PII: 서구권 도구의 한계

GDPR은 보스포루스 해협에서 끝나지 않습니다. EU 기업 워크플로우에서 아랍어·히브리어 PII는 체계적으로 보호받지 못하고 있습니다. XLM-RoBERTa 교차 언어 탐지를 활용하십시오.

April 1, 20268
기술

혼합 언어 PII: 단일 언어 도구의 실패

EU 기업의 72%가 동시에 3개 이상의 언어로 문서를 처리합니다. 혼합 언어 문서는 단일 언어 NER 도구에서 45% 더 높은 PII 누락율을 야기합니다.

March 26, 20267
기술

APAC PII: 태국어, 인도네시아어, 베트남어

12개 APAC 언어로 월 50만 건의 지원 채팅을 처리하는 싱가포르 핀테크는 영어 전용 도구가 비영어 채팅의 60%에서 PII를 놓치는 것을 발견했습니다.

March 24, 20267
기술

거짓 양성: ML 처리가 실패하는 이유

2024년 벤치마크에서 Presidio는 4,434개 샘플에서 13,536개의 거짓 양성 이름 탐지를 생성했습니다 — 대명사, 선박 이름, 국가를 인명으로 표시하며. 법률 및 의료 환경에서 이것이 어떤 비용을 발생시키는지 알아보세요.

March 23, 20268
기술

ISO 27001 + 제로 지식으로 벤더 평가 시간 단축

2025년 조사에서 CISO들이 SaaS 벤더를 실격시키는 두 번째 이유가 '공인된 보안 인증 부재'였습니다. ISO 27001 + 제로 지식이 어떤 의미인지 알아보세요.

March 19, 20267
기술

제로 지식 아키텍처로 영업 주기 단축

기업 벤더 보안 설문지는 평균 100개 이상의 질문을 포함합니다. 제로 지식 아키텍처는 가장 어려운 질문에 결정적으로 답하고 계약을 성사시킵니다.

March 18, 20267
기술

LastPass 침해: 벤더 보안 교훈

LastPass는 사용자 데이터를 암호화했습니다. 볼트는 여전히 유출됐습니다. 이후 60만+ Okta 기록이 뒤따랐습니다. SaaS 보안 사건이 2022~2024년 사이 300% 증가했습니다.

March 17, 20268
기술

LastPass 이후 제로 지식 주장 평가

LastPass 사용자들의 '암호화된' 볼트가 침해된 후 4억 3,800만 달러가 탈취됐습니다. ICO 과징금 120만 파운드도 뒤따랐습니다. 벤더가 실제로 제로 지식을 구현하는지 평가하는 체크리스트.

March 16, 20268
기술

LangChain CVE-2025-68664: RAG 파이프라인을 통한 개인정보 유출 경로

CVSS 9.3. LangChain의 직렬화 함수가 환경 변수와 비밀 정보를 공격자가 제어하는 LLM에 노출합니다. 개인정보 유출을 탐지하고 수정하는 방법을 설명합니다.

March 16, 20268
기술

LibreOffice PII 익명화 확장 프로그램

anonym.legal 확장 프로그램을 사용해 LibreOffice 문서에서 PII를 익명화하는 단계별 가이드입니다.

March 10, 202610
기술

LibreOffice vs. Microsoft Office: 개인정보 비식별 처리 비교

LibreOffice(anonym.legal 확장 프로그램)와 Microsoft Office(Office 추가 기능)의 개인정보 익명화 기능을 상세 비교합니다.

March 10, 20268
기술

이진 PII 탐지가 컴플라이언스에 실패하는 이유

탐지/미탐지 플래그만으로는 인간 판단이 필요한 컴플라이언스 상황을 지원할 수 없습니다. 신뢰도 점수가 PII 익명화를 이진 추측에서 감사 가능한 컴플라이언스 통제로 전환하는 방법을 설명합니다.

March 6, 20268
기술

PII 도구의 문서 형식 파편화 문제

단일 DSAR 응답은 Word 계약서, PDF 청구서, Excel 고객 목록, CSV 내보내기에 걸쳐 있을 수 있습니다. 형식마다 다른 도구를 사용하면 컴플라이언스 공백이 생깁니다.

March 6, 20267
기술

GDPR 로그 익명화: 디버깅 기능을 유지하는 방법

애플리케이션 로그에는 사용자 이메일, IP 주소, 계좌 번호가 조용히 축적됩니다. 제3자, 계약업체, 옵저버빌리티 플랫폼과 로그를 공유하면서 GDPR을 준수하는 방법을 설명합니다.

March 6, 20267
기술

앱 로그 속 GDPR: JSON PII 컴플라이언스

애플리케이션 로그에는 GDPR 제5조 제1항 (e)호가 관리를 요구하는 고객 이메일 주소, IP 주소, 계정 번호가 포함됩니다.

March 6, 20266
기술

앱 간 개인정보 보호: Word, Chrome, AI 도구

고객 데이터는 브라우저 리서치에서 Word 초안으로, Claude 프롬프트로 흘러갑니다. 각 앱 전환 시점이 잠재적인 유출 지점입니다.

March 6, 20266
기술

크로스 플랫폼 PII 컴플라이언스: Mac, Linux, Windows

Mac을 사용하는 개인정보보호 담당자, Windows를 사용하는 법무팀, Linux를 사용하는 데이터 엔지니어 — 모두 동일한 데이터를 다른 도구로 처리합니다. OS에 구애받지 않는 탐지가 중요한 이유입니다.

March 6, 20266
기술

에어갭 PII: 방어를 위한 오프라인 우선 방식

기업 보안 정책의 41%는 기밀 문서의 클라우드 처리를 금지합니다. 에어갭 네트워크에서 PII 익명화가 어떻게 작동하는지 알아보세요.

March 3, 20268
기술

가역적 삭제 vs 영구 삭제: 선택 기준

GDPR은 익명화와 가명화를 구별합니다. 법원은 원본이 필요합니다. 연구는 재식별이 필요합니다. 각 방법을 언제 사용해야 하는지 알아보세요.

February 27, 20267
기술

다국어 NER: 영어 모델은 아랍어를 처리하지 못합니다

영어 NER 모델은 표준 테스트에서 85-92% 정확도를 달성합니다. 아랍어와 중국어에서는? 종종 50-70%에 그칩니다. 기술적 과제와 진정한 다국어 개인정보 탐지 구축 방법을 알아보세요.

February 26, 20268
기술

개인정보 유출 없이 Claude와 ChatGPT 사용하기

AI 어시스턴트를 안전하게 사용하기 위한 개발자 가이드. Claude Desktop, Cursor, VS Code에서 투명한 개인정보 보호를 위한 MCP Server 통합 설정 방법.

February 22, 20267

오늘 데이터 보호를 시작하세요

285개 이상의 엔티티 유형, 48개 언어, 스타트업 가격의 기업급 보안.

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

We run a full check suite on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We track recall and precision on a labelled set.

Bad runs block the deploy.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

You can top up at any time.

Unused credits roll over each month.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.