Presidio: Setup 3 Minggu vs PII Terkelola
Microsoft Presidio memiliki ribuan bintang GitHub dan ratusan isu terbuka. Kompleksitas pengaturan, overhead integrasi PySpark, dan dependensi Python.
6 Minggu Jadi 3 Hari: Setup PII Terkelola
Tim SaaS layanan kesehatan menghabiskan 6 minggu untuk deployment produksi Presidio self-hosted sebelum beralih ke API terkelola. API terkelola menggantikan deployment tersebut.
Deteksi PII "Gratis" Menghabiskan €13 Ribu/Tahun
Self-hosting Presidio membutuhkan 40–80 jam pengaturan awal dan 5–10 jam/bulan pemeliharaan berkelanjutan. Dengan tarif rekayasa €100/jam, biayanya mencapai €13.200+.
Masalah Presisi 22,7% Presidio
Benchmark 2024 menemukan bahwa pengenal nama orang Presidio mencapai presisi 22,7% dalam dokumen bisnis — artinya 77,3% deteksi adalah false positive.
Privasi yang Dapat Direproduksi: Preset ML
Anonimisasi data pelatihan ML harus konsisten dan dapat direproduksi. Jika ilmuwan data A dan B menerapkan jenis entitas yang berbeda, dataset pelatihan menjadi tidak konsisten.
Pipeline GDPR: Anonimkan PII Sebelum Disimpan
Tag kolom dbt bukan berarti kepatuhan GDPR. Data pelanggan mentah masuk ke gudang data Snowflake Anda tanpa tersamarkan sebelum kebijakan berbasis tag diterapkan.
FOIA: Redaksi dari Berminggu-minggu Menjadi Berjam-jam
Pemerintah federal menghabiskan sekitar $500 juta untuk pemrosesan FOIA pada tahun 2024, sebagian besar untuk redaksi manual. ARPA-H secara eksplisit mencari perangkat lunak redaksi berbasis AI.
Anonimisasi Data Pelatihan ML yang Patuh GDPR
GDPR membatasi penggunaan data pribadi untuk pelatihan ML di luar tujuan pengumpulan awalnya. Ilmuwan data yang mengandalkan skrip Python ad-hoc menciptakan risiko kepatuhan yang besar.
FOIA: 80% Lebih Cepat dengan Redaksi Batch
Lembaga federal AS menerima 1,5 juta permintaan FOIA pada FY2024 dengan biaya rata-rata $482 per permintaan. Redaksi PII batch mengurangi waktu pemrosesan secara dramatis.
Presidio vs. anonym.legal: Bangun vs. Beli
Microsoft Presidio secara teknis gratis tetapi membutuhkan 40-80 jam rekayasa untuk diterapkan dengan benar. anonym.legal memberikan akurasi ML yang sama sebagai SaaS terkelola.
Privasi Air-Gapped: Anonimisasi Sepenuhnya Offline
Lingkungan FedRAMP dan ITAR memiliki kesamaan — cloud bukan pilihan. Pseudonimisasi yang dapat dibalik berdasarkan Pasal GDPR.
Beban Positif Palsu pada Alat Deteksi PII
Diskusi GitHub Presidio #1071 mendokumentasikan positif palsu yang sistematis. Studi tahun 2024 menemukan presisi 22,7% pada dataset enterprise multibahasa.
PII Arab & Ibrani: Alat Barat Gagal Mendeteksinya
GDPR tidak berhenti di Bosphorus. PII dalam bahasa Arab dan Ibrani di alur kerja bisnis EU secara sistematis tidak terlindungi. Deteksi lintas bahasa XLM-RoBERTa dan.
PII Multibahasa: Alat Monolingual Gagal
72% perusahaan EU memproses dokumen dalam 3+ bahasa sekaligus. Dokumen multibahasa menyebabkan tingkat miss PII 45% lebih tinggi pada alat NER monolingual.
PII APAC: Thai, Indonesia, Vietnam
Sebuah fintech Singapura yang memproses 500.000 obrolan dukungan bulanan di 12 bahasa APAC menemukan alat hanya bahasa Inggris mereka melewatkan PII di 60% obrolan non-bahasa Inggris.
Positif Palsu: Mengapa Redaksi ML Gagal
Benchmark 2024 menemukan Presidio menghasilkan 13.536 deteksi nama positif palsu di 4.434 sampel — menandai kata ganti, nama kapal, dan negara sebagai.
ISO 27001 + ZK Mempersingkat Waktu Penilaian Vendor
Survei 2025 menemukan 'kurangnya sertifikasi keamanan yang diakui' adalah alasan #2 CISO mendiskualifikasi vendor SaaS. Inilah yang dilakukan ISO 27001 +.
Arsitektur ZK Mempersingkat Siklus Penjualan
Kuesioner keamanan vendor enterprise rata-rata memiliki 100+ pertanyaan. Arsitektur zero-knowledge menjawab pertanyaan paling sulit secara definitif — dan mengkonversi.
Pelanggaran LastPass: Pelajaran Keamanan Vendor
LastPass mengenkripsi data pengguna mereka. Vault tetap diekstrak. 600.000+ catatan Okta menyusul. Insiden keamanan SaaS meningkat 300% dari 2022 hingga 2024.
Mengevaluasi Klaim ZK Setelah LastPass
$438 juta dicuri dari pengguna LastPass setelah vault 'terenkripsi' mereka dibobol. Denda ICO sebesar £1,2 juta menyusul. Berikut daftar periksa untuk mengevaluasi apakah klaim zero-knowledge vendor benar-benar valid.
LangChain CVE-2025-68664: Cara PII Bocor melalui Pipeline RAG Anda
CVSS 9,3. Fungsi serialisasi LangChain mengekspos variabel lingkungan dan rahasia ke LLM yang dikendalikan penyerang. Cara mendeteksi dan memperbaiki kebocoran PII.
Ekstensi Anonimisasi PII LibreOffice
Panduan langkah demi langkah untuk mengaonimkan PII dalam dokumen LibreOffice menggunakan ekstensi anonym.legal.
LibreOffice vs Office: Penyuntingan PII
Perbandingan terperinci kemampuan anonimisasi PII di LibreOffice (ekstensi anonym.legal) vs. Microsoft Office (Office Add-in).
Mengapa Deteksi PII Biner Gagal dalam Kepatuhan
Tanda terdeteksi/tidak-terdeteksi tidak cukup untuk konteks kepatuhan yang memerlukan penilaian manusia. Inilah mengapa penilaian kepercayaan mengubah anonimisasi PII.
Fragmentasi Format Dokumen dalam Alat PII
Satu respons DSAR bisa mencakup kontrak Word, faktur PDF, daftar pelanggan Excel, dan ekspor CSV. Menggunakan alat berbeda untuk setiap format menciptakan celah kepatuhan.
Anonimisasi Log GDPR: Tetap Bisa Debug
Log aplikasi secara diam-diam mengumpulkan email pengguna, IP, dan nomor akun. Begini cara berbagi log dengan pihak ketiga, kontraktor, dan platform observabilitas tanpa melanggar GDPR.
GDPR di Log Aplikasi: Kepatuhan PII JSON
Log aplikasi mengandung alamat email pelanggan, IP, dan nomor akun yang harus dikelola sesuai GDPR Pasal 5(1)(e).
PII Lintas Aplikasi: Word, Chrome, dan AI
Data pelanggan mengalir dari riset browser ke draf Word hingga prompt Claude. Setiap perpindahan konteks adalah potensi kebocoran.
PII Lintas Platform: Mac, Linux, dan Windows
Petugas privasi di Mac, tim hukum di Windows, insinyur data di Linux — semua memproses data yang sama dengan alat berbeda. Inilah mengapa deteksi yang agnostik terhadap OS sangat penting.
PII Air-Gapped: Anonimisasi Offline untuk Pertahanan
41% kebijakan keamanan enterprise melarang pemrosesan cloud untuk dokumen rahasia. Inilah solusi offline-first untuk lingkungan terisolasi.
Redaksi Reversibel vs Permanen: Pilihan yang Tepat
GDPR membedakan anonimisasi dari pseudonimisasi. Pengadilan membutuhkan dokumen asli. Penelitian memerlukan re-identifikasi. Pelajari kapan harus menggunakan masing-masing pendekatan.
NER Multibahasa: Model Bahasa Inggris Gagal untuk Bahasa Arab
Model NER bahasa Inggris mencapai akurasi 85-92%. Untuk bahasa Arab dan Mandarin? Seringkali hanya 50-70%. Pelajari tantangan teknis dan cara membangun sistem yang benar-benar multibahasa.
Gunakan Claude & ChatGPT Tanpa Membocorkan PII
Panduan pengembang untuk menggunakan asisten AI secara aman. Siapkan integrasi MCP Server untuk perlindungan PII transparan di Claude Desktop, Cursor, dan VS Code.
Mulai Melindungi Data Anda Hari Ini
285+ jenis entitas, 48 bahasa, keamanan tingkat perusahaan dengan harga startup.
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.