所有文章技术

技术

深入探讨 PII 检测、NER 和匿名化技术

33 文章

技术

Presidio 三周配置周期 vs. 托管 PII 服务

Microsoft Presidio 拥有数千 GitHub Star,同时也积压着数百个未解决 Issue。配置复杂度、PySpark 集成开销与 Python 依赖管理,让许多团队望而却步。

June 15, 20266 分钟
技术

从六周DevOps痛苦到3天完成集成

医疗SaaS团队在自托管Presidio生产部署上耗费六周后切换至托管API。托管API用3天完成了替代,年度工程成本从5万欧元以上降至348欧元。

June 14, 20267 分钟
技术

「免费」PII检测每年实际成本超1.3万欧元

自托管Presidio需要40—80小时的初始配置和每月5—10小时的持续维护。按每小时100欧元的工程师费率计算,年度总成本超过1.32万欧元。

June 12, 20267 分钟
技术

Presidio 22.7%精准率问题

2024年基准测试发现,Presidio的人名识别器在商业文档中的精准率仅为22.7%——这意味着77.3%的检测结果是误报。

June 11, 20267 分钟
技术

可重复的隐私保护:机器学习预设的必要性

机器学习训练数据的匿名化必须保持一致性和可重复性。如果数据科学家 A 和 B 应用了不同的实体类型,训练数据集便会产生偏差。

June 7, 20266 分钟
技术

GDPR安全数据管道:在入库前匿名化PII

dbt列标签不等于GDPR合规。原始客户数据在基于标签的策略生效前,已以未脱敏形式进入Snowflake数据仓库。本指南介绍如何在加载前匿名化,真正消除原始层风险。

May 29, 20268 分钟
技术

FOIA:AI将编辑时间从数周缩短至数小时

联邦政府2024年在FOIA处理上的估计支出达5亿美元,主要用于人工编辑。ARPA-H明确采购AI编辑软件以解决积压问题,自动化预筛可将审核工时减少70%至80%。

May 28, 20268 分钟
技术

GDPR合规的机器学习训练数据匿名化

GDPR限制将个人数据用于超出原始收集目的的机器学习训练。依赖临时Python脚本的数据科学团队面临合规漏洞、DPO审批延误和Schrems II跨境限制等问题。

May 27, 20267 分钟
技术

批量脱敏助力 FOIA 处理效率提升 80%

美国联邦机构在 2024 财年收到 150 万件 FOIA 申请,平均每件处理成本 $482。批量 PII 脱敏可将处理时间从数月压缩至数周,大幅降低人力成本。

May 23, 20269 分钟
技术

Presidio 与 anonym.legal:自建还是购买?

Microsoft Presidio 技术上免费,但正确部署需要 40 至 80 个工程工时。anonym.legal 以托管 SaaS 的形式提供同等机器学习精度,无需任何工程投入。

May 18, 20268 分钟
技术

气隙网络隐私保护:完全离线的个人信息匿名化

FedRAMP和ITAR环境有一个共同点——云端根本不是选项。GDPR第4条第5款规定的可逆假名化、EDPB指南要求的令牌分离……本文介绍气隙环境下的合规解决方案。

April 13, 20269 分钟
技术

PII 检测工具的「误报税」

Presidio GitHub Issue #1071 记录了系统性误报问题。2024 年一项研究在混合语言企业数据集上测得精确率仅为 22.7%。

April 3, 20268 分钟
技术

阿拉伯语与希伯来语 PII 检测:西方工具力不从心

GDPR 的管辖范围不止于博斯普鲁斯海峡。企业业务流程中的阿拉伯语和希伯来语 PII 长期处于系统性保护空白之中。XLM-RoBERTa 跨语言检测可以有效应对这一挑战。

April 1, 20268 分钟
技术

混合语言文档的PII检测:单语言工具为何失效

72%的欧盟企业同时处理三种以上语言的文档。混合语言文档导致单语言NER工具的PII遗漏率高出45%。

March 26, 20267 分钟
技术

亚太地区PII检测:泰语、印尼语、越南语

新加坡一家金融科技公司每月处理来自12种亚太语言的50万次支持聊天,发现其纯英语工具在60%的非英语聊天中遗漏了PII。

March 24, 20267 分钟
技术

误报泛滥:为何ML文件遮蔽在法律和医疗领域失效

2024年基准测试发现,Presidio在4,434个样本中产生了13,536个人名误报——将代词、船舶名称和国家名称错误标记为人名。以下是这在法律和医疗环境中的实际代价。

March 23, 20268 分钟
技术

ISO 27001加零知识缩短供应商评估时间

2025年一项调查发现,"缺乏认可的安全认证"是CISO淘汰SaaS供应商的第二大原因。ISO 27001加零知识组合能实现什么?

March 19, 20267 分钟
技术

零知识架构缩短销售周期

企业供应商安全问卷平均包含100个以上问题。零知识架构能够明确回答最难的问题,并推动成交。

March 18, 20267 分钟
技术

LastPass泄露:供应商安全教训

LastPass对用户数据进行了加密,保险库仍然被窃取。60万条以上Okta记录随之而来。SaaS安全事件从2022年到2024年增加了300%。

March 17, 20268 分钟
技术

LastPass之后:评估零知识声明

LastPass用户的4.38亿美元在其"加密"保险库遭到攻击后被盗。ICO随后开出120万英镑罚款。这里是评估供应商零知识声明是否成立的核查清单。

March 16, 20268 分钟
技术

LangChain CVE-2025-68664:个人信息如何通过 RAG 管道泄露及修复方案

CVSS 9.3。LangChain 的序列化函数将环境变量和密钥暴露给攻击者控制的 LLM。如何检测并修复个人信息泄露问题。

March 16, 20268 分钟
技术

LibreOffice个人信息匿名化扩展

使用anonym.legal扩展在LibreOffice文档中匿名化个人信息的分步指南,支持Writer、Calc和Impress,覆盖285种以上实体类型。

March 10, 202610 分钟
技术

LibreOffice 与 Office:个人信息脱敏对比

LibreOffice(anonym.legal 扩展)与 Microsoft Office(Office 加载项)个人信息匿名化功能的详细对比。

March 10, 20268 分钟
技术

二值 PII 检测为何无法满足合规要求

「已检测 / 未检测」的判断对于需要人工裁量的合规场景远远不够。置信度评分将 PII 匿名化从二元猜测转变为可审计的合规控制。

March 6, 20268 分钟
技术

文档格式碎片化:个人信息匿名化的隐藏合规漏洞

一份数据主体访问请求(DSAR)回应可能横跨Word合同、PDF发票、Excel客户列表和CSV导出文件。使用不同工具处理不同格式,会产生难以发现的合规漏洞。

March 6, 20267 分钟
技术

GDPR合规日志匿名化:在保护隐私的同时保留调试能力

应用程序日志会悄悄积累用户电子邮件、IP地址和账号信息。了解如何在与第三方、承包商和可观测性平台共享日志时,在合规的前提下保留其全部调试价值。

March 6, 20267 分钟
技术

应用日志中的 GDPR 合规:JSON PII 脱敏实践

应用日志中包含客户邮箱地址、IP 地址和账户号码,GDPR 第 5 条第 1 款 (e) 项对此有明确的管理要求。

March 6, 20266 分钟
技术

跨应用个人数据保护:Word、Chrome 与 AI 工具的全链路防护

客户数据在日常工作中流转于浏览器调研、Word 草稿与 Claude 提示词之间,每次应用切换都是潜在的泄露节点。

March 6, 20266 分钟
技术

跨平台个人数据合规:Mac、Linux 与 Windows

隐私官使用 Mac,法律团队使用 Windows,数据工程师使用 Linux——处理的却是同一份合规义务。本文解释为何操作系统无关的检测方案至关重要。

March 6, 20266 分钟
技术

气隙网络PII:国防领域的离线优先方案

41%的企业安全策略禁止将机密文件上传至云端处理。

March 3, 20268 分钟
技术

可逆遮盖与永久遮盖的选择

GDPR区分匿名化与假名化。法院需要原件。研究需要重新识别。了解何时使用哪种方法。

February 27, 20267 分钟
技术

多语言NER:英语模型在阿拉伯语上的失败

英语NER模型准确率达85-92%。阿拉伯语和中文呢?通常只有50-70%。了解技术挑战以及如何构建真正的多语言保护。

February 26, 20268 分钟
技术

在不泄露PII的情况下使用Claude和ChatGPT

开发者AI安全使用指南。了解如何为Claude Desktop、Cursor和VS Code配置MCP服务器集成,实现透明的PII保护。

February 22, 20267 分钟

今天就开始保护您的数据

285+ 种实体类型,48 种语言,企业级安全,初创公司定价。

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

We run a full check suite on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We track recall and precision on a labelled set.

Bad runs block the deploy.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

You can top up at any time.

Unused credits roll over each month.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.