Presidio 三周配置周期 vs. 托管 PII 服务
Microsoft Presidio 拥有数千 GitHub Star,同时也积压着数百个未解决 Issue。配置复杂度、PySpark 集成开销与 Python 依赖管理,让许多团队望而却步。
从六周DevOps痛苦到3天完成集成
医疗SaaS团队在自托管Presidio生产部署上耗费六周后切换至托管API。托管API用3天完成了替代,年度工程成本从5万欧元以上降至348欧元。
「免费」PII检测每年实际成本超1.3万欧元
自托管Presidio需要40—80小时的初始配置和每月5—10小时的持续维护。按每小时100欧元的工程师费率计算,年度总成本超过1.32万欧元。
Presidio 22.7%精准率问题
2024年基准测试发现,Presidio的人名识别器在商业文档中的精准率仅为22.7%——这意味着77.3%的检测结果是误报。
可重复的隐私保护:机器学习预设的必要性
机器学习训练数据的匿名化必须保持一致性和可重复性。如果数据科学家 A 和 B 应用了不同的实体类型,训练数据集便会产生偏差。
GDPR安全数据管道:在入库前匿名化PII
dbt列标签不等于GDPR合规。原始客户数据在基于标签的策略生效前,已以未脱敏形式进入Snowflake数据仓库。本指南介绍如何在加载前匿名化,真正消除原始层风险。
FOIA:AI将编辑时间从数周缩短至数小时
联邦政府2024年在FOIA处理上的估计支出达5亿美元,主要用于人工编辑。ARPA-H明确采购AI编辑软件以解决积压问题,自动化预筛可将审核工时减少70%至80%。
GDPR合规的机器学习训练数据匿名化
GDPR限制将个人数据用于超出原始收集目的的机器学习训练。依赖临时Python脚本的数据科学团队面临合规漏洞、DPO审批延误和Schrems II跨境限制等问题。
批量脱敏助力 FOIA 处理效率提升 80%
美国联邦机构在 2024 财年收到 150 万件 FOIA 申请,平均每件处理成本 $482。批量 PII 脱敏可将处理时间从数月压缩至数周,大幅降低人力成本。
Presidio 与 anonym.legal:自建还是购买?
Microsoft Presidio 技术上免费,但正确部署需要 40 至 80 个工程工时。anonym.legal 以托管 SaaS 的形式提供同等机器学习精度,无需任何工程投入。
气隙网络隐私保护:完全离线的个人信息匿名化
FedRAMP和ITAR环境有一个共同点——云端根本不是选项。GDPR第4条第5款规定的可逆假名化、EDPB指南要求的令牌分离……本文介绍气隙环境下的合规解决方案。
PII 检测工具的「误报税」
Presidio GitHub Issue #1071 记录了系统性误报问题。2024 年一项研究在混合语言企业数据集上测得精确率仅为 22.7%。
阿拉伯语与希伯来语 PII 检测:西方工具力不从心
GDPR 的管辖范围不止于博斯普鲁斯海峡。企业业务流程中的阿拉伯语和希伯来语 PII 长期处于系统性保护空白之中。XLM-RoBERTa 跨语言检测可以有效应对这一挑战。
混合语言文档的PII检测:单语言工具为何失效
72%的欧盟企业同时处理三种以上语言的文档。混合语言文档导致单语言NER工具的PII遗漏率高出45%。
亚太地区PII检测:泰语、印尼语、越南语
新加坡一家金融科技公司每月处理来自12种亚太语言的50万次支持聊天,发现其纯英语工具在60%的非英语聊天中遗漏了PII。
误报泛滥:为何ML文件遮蔽在法律和医疗领域失效
2024年基准测试发现,Presidio在4,434个样本中产生了13,536个人名误报——将代词、船舶名称和国家名称错误标记为人名。以下是这在法律和医疗环境中的实际代价。
ISO 27001加零知识缩短供应商评估时间
2025年一项调查发现,"缺乏认可的安全认证"是CISO淘汰SaaS供应商的第二大原因。ISO 27001加零知识组合能实现什么?
零知识架构缩短销售周期
企业供应商安全问卷平均包含100个以上问题。零知识架构能够明确回答最难的问题,并推动成交。
LastPass泄露:供应商安全教训
LastPass对用户数据进行了加密,保险库仍然被窃取。60万条以上Okta记录随之而来。SaaS安全事件从2022年到2024年增加了300%。
LastPass之后:评估零知识声明
LastPass用户的4.38亿美元在其"加密"保险库遭到攻击后被盗。ICO随后开出120万英镑罚款。这里是评估供应商零知识声明是否成立的核查清单。
LangChain CVE-2025-68664:个人信息如何通过 RAG 管道泄露及修复方案
CVSS 9.3。LangChain 的序列化函数将环境变量和密钥暴露给攻击者控制的 LLM。如何检测并修复个人信息泄露问题。
LibreOffice个人信息匿名化扩展
使用anonym.legal扩展在LibreOffice文档中匿名化个人信息的分步指南,支持Writer、Calc和Impress,覆盖285种以上实体类型。
LibreOffice 与 Office:个人信息脱敏对比
LibreOffice(anonym.legal 扩展)与 Microsoft Office(Office 加载项)个人信息匿名化功能的详细对比。
二值 PII 检测为何无法满足合规要求
「已检测 / 未检测」的判断对于需要人工裁量的合规场景远远不够。置信度评分将 PII 匿名化从二元猜测转变为可审计的合规控制。
文档格式碎片化:个人信息匿名化的隐藏合规漏洞
一份数据主体访问请求(DSAR)回应可能横跨Word合同、PDF发票、Excel客户列表和CSV导出文件。使用不同工具处理不同格式,会产生难以发现的合规漏洞。
GDPR合规日志匿名化:在保护隐私的同时保留调试能力
应用程序日志会悄悄积累用户电子邮件、IP地址和账号信息。了解如何在与第三方、承包商和可观测性平台共享日志时,在合规的前提下保留其全部调试价值。
应用日志中的 GDPR 合规:JSON PII 脱敏实践
应用日志中包含客户邮箱地址、IP 地址和账户号码,GDPR 第 5 条第 1 款 (e) 项对此有明确的管理要求。
跨应用个人数据保护:Word、Chrome 与 AI 工具的全链路防护
客户数据在日常工作中流转于浏览器调研、Word 草稿与 Claude 提示词之间,每次应用切换都是潜在的泄露节点。
跨平台个人数据合规:Mac、Linux 与 Windows
隐私官使用 Mac,法律团队使用 Windows,数据工程师使用 Linux——处理的却是同一份合规义务。本文解释为何操作系统无关的检测方案至关重要。
气隙网络PII:国防领域的离线优先方案
41%的企业安全策略禁止将机密文件上传至云端处理。
可逆遮盖与永久遮盖的选择
GDPR区分匿名化与假名化。法院需要原件。研究需要重新识别。了解何时使用哪种方法。
多语言NER:英语模型在阿拉伯语上的失败
英语NER模型准确率达85-92%。阿拉伯语和中文呢?通常只有50-70%。了解技术挑战以及如何构建真正的多语言保护。
在不泄露PII的情况下使用Claude和ChatGPT
开发者AI安全使用指南。了解如何为Claude Desktop、Cursor和VS Code配置MCP服务器集成,实现透明的PII保护。
About this page
We update this page when our platform or the law changes.
Read our founder note for how we work.
Each change shows up in the timestamp at the top.
Related reading
We follow these rules
- GDPR (EU 2016/679).
- ISO/IEC 27001:2022.
- NIS2 (EU 2022/2555).
- HIPAA safe harbor under 45 CFR § 164.514(b)(2).
Our promise
We do not sell your data.
We do not train models on your text.
We store your files in Germany.
You can delete your account at any time.
You own your work.
Where we run
Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.
Hetzner holds ISO 27001 certification.
All data stays in the EU.
Backups run every day.
Need help?
Email support@anonym.legal.
We reply within one business day.
How we test
We run a full check suite on every release.
Each surface gets its own sweep script and report.
Human reviewers spot-check the output each week.
We track recall and precision on a labelled set.
Bad runs block the deploy.
What we never do
- We never sell your information to third parties.
- We never train models on what you upload.
- We never keep your work after you delete it.
- We never share keys with any outside firm.
- We never run ads inside the product.
Plans in plain words
We sell credits, not seats.
One credit covers one short job.
Long jobs use a few credits each.
You can top up at any time.
Unused credits roll over each month.
Read the plans page for current rates.
Who built this
A small team of engineers and lawyers built this.
We ship from Europe and work in the open.
Our founder note spells out why we started.
Where to start
- Open the web app and try a sample file.
- Learn how credits get counted.
- See current plans and limits.
- Meet the team behind the product.
How the parts fit
A browser add-on cleans text inside Chrome.
A Word plug-in handles drafts in Office.
A small desktop tool works on whole folders.
An agent protocol link feeds large models safely.
All four share one core engine and one rule set.
Words from our team
We started this work after a lunch about cookies.
One friend kept getting odd ads on her phone.
We asked why a court file leaked through a draft.
We sketched the first build on a napkin that week.
By month three we had a tiny demo for a friend.
She used it on her first case the next day.
Common questions we hear
Can the tool read scanned PDFs? Yes, with OCR.
Does it work on long files? Yes, in small chunks.
Can I roll my own rule set? Yes, save it as a preset.
Does it run offline? The desktop build runs offline.
Do you keep my files? No, the cloud build wipes after each run.
Will it learn from my work? No, we never train on inputs.
A short tour of the workflow
Upload a file or paste a snippet of prose.
Pick the entities you want gone from the draft.
Choose a method: replace, mask, hash, encrypt, or redact.
Press run and watch the side panel show each hit.
Skim the result and tweak any rule that misfired.
Save the cleaned file or send it to a teammate.