By · Last updated 2026-08-12

Trang chủ/Tài liệu/breadcrumb.imageRedaction
Quay lại Tài liệu

Xóa PII Trong Ảnh — Hướng Dẫn Sử Dụng

Phát hiện và che dữ liệu cá nhân bên trong ảnh scan, ảnh chụp và ảnh chụp màn hình. Hướng dẫn này trình bày quy trình tải lên, phân tích, xóa và tải xuống, các giới hạn dung lượng và định dạng, hỗ trợ ngôn ngữ OCR, và lệnh gọi API bên dưới.

Quy trình: tải lên, phân tích, xóa, tải xuống

Mọi hình ảnh đều trải qua cùng bốn bước, dù bạn sử dụng ứng dụng web, gọi trực tiếp API, hay gọi công cụ anonym_legal_redact_image qua máy chủ MCP.

1. Tải Lên

Chọn một tệp PNG hoặc JPG. Ứng dụng kiểm tra loại và dung lượng tệp theo giới hạn tải lên của gói bạn trước khi gửi bất cứ thứ gì lên máy chủ.

2. Phân Tích

OCR (Tesseract) đọc văn bản trong ảnh và ghi lại vị trí của từng đoạn văn bản. Văn bản đã trích xuất đó sau đó được đưa qua cùng bộ phát hiện PII dùng cho tài liệu, trả về các thực thể được tìm thấy và vị trí của chúng — chưa có gì bị xóa ở bước này.

3. Xóa

Gửi lại yêu cầu với mode được đặt thành "redact" để che mỗi vùng được phát hiện bằng một ô đen đặc vẽ trực tiếp lên các điểm ảnh. Đây là thao tác xóa hình ảnh một chiều, không phải mã hóa có thể đảo ngược.

4. Tải Xuống

Ảnh đã xóa PII được trả về dưới dạng tệp (PNG hoặc đúng loại nội dung gốc) mà bạn lưu về máy — không có gì được lưu giữ trên máy chủ sau khi phản hồi được gửi.

Giới hạn dung lượng và điểm ảnh

  • Chỉ hỗ trợ PNG và JPG (JPEG). Các định dạng raster khác như TIFF, BMP, WebP và GIF hiện chưa được hỗ trợ.
  • Ảnh bị giới hạn ở mức 20 MB phía máy chủ. Giới hạn riêng của gói bạn có thể thấp hơn — gói Basic giới hạn tải lên ở 5 MB (Pro 10 MB, Business 20 MB); gói miễn phí không bao gồm tính năng xóa PII trong ảnh.
  • Tổng độ phân giải (chiều rộng × chiều cao) bị giới hạn ở 150 megapixel. Các tệp tải lên vượt quá giới hạn này sẽ bị từ chối trước khi xử lý.

Hỗ trợ ngôn ngữ OCR

OCR chạy trên Tesseract. Trường language của API nhận một mã ISO 639-1 (mặc định là "en" cho tiếng Anh) được ánh xạ tới một gói ngôn ngữ Tesseract — khoảng ba mươi ngôn ngữ được ánh xạ, bao gồm tiếng Đức, Pháp, Tây Ban Nha, Ý, Bồ Đào Nha, Hà Lan, Ba Lan, Nga, Ukraina, Ả Rập, Hebrew, Hindi, Nhật, Hàn, Trung, Thái, Việt và Thổ Nhĩ Kỳ. Khả năng hỗ trợ thực tế phụ thuộc vào các gói Tesseract nào được cài đặt trên máy chủ OCR; một ngôn ngữ không khả dụng sẽ tự động chuyển về tiếng Anh.

Tài liệu tham khảo API

Tính năng ẩn danh hình ảnh khả dụng trực tiếp qua API cho các tích hợp không đi qua ứng dụng web, và qua máy chủ MCP dưới dạng công cụ anonym_legal_redact_image (chế độ "analyze" hoặc "redact") cho các client MCP như Claude.

POST /api/presidio/image

Authentication: Xác thực bằng một Bearer token trong header Authorization (một token API hoặc một phiên đã xác thực, giống như các điểm cuối phân tích văn bản). Các yêu cầu không có token hợp lệ sẽ trả về 401.

Request body: Gửi một body multipart/form-data. Các trường bắt buộc: file (ảnh PNG hoặc JPG) và mode ("analyze" hoặc "redact"). Các trường tùy chọn: language (mã ngôn ngữ OCR ISO 639-1, mặc định "en"), entities (một mảng JSON các loại thực thể cần giới hạn phát hiện), score_threshold, và fill_color (chỉ dùng cho chế độ redact, mặc định "black"), operator (redact mode only: "redact" | "replace" | "mask", default "redact"), and mask_char (redact mode with operator="mask" only, default "*").

Response: Ở chế độ analyze, phản hồi là JSON: các thực thể được phát hiện (loại, vị trí văn bản, và điểm tin cậy) cộng với trường tokens_charged. Ở chế độ redact, phản hồi là chính ảnh đã xóa PII (nhị phân, Content-Type image/png hoặc loại gốc) kèm chi phí token được trả về trong header X-Tokens-Charged.

Câu hỏi thường gặp

Những định dạng ảnh nào được hỗ trợ?

Chỉ PNG và JPG (JPEG). Các định dạng raster khác như TIFF, BMP, WebP và GIF hiện chưa được hỗ trợ.

Giới hạn dung lượng và độ phân giải là bao nhiêu?

20 MB và tổng độ phân giải 150 megapixel, còn bị giới hạn thêm bởi mức tải lên riêng của gói bạn (5 MB trên Basic, 10 MB trên Pro, 20 MB trên Business).

Xóa PII trong ảnh có yêu cầu gói trả phí không?

Có. Xóa PII trong ảnh yêu cầu gói Basic trở lên. Gói miễn phí chỉ hỗ trợ ẩn danh văn bản.

Việc xóa này có thể đảo ngược không?

Không. Việc xóa che vùng được phát hiện bằng một ô đen mờ đục trực tiếp trên các điểm ảnh — một thao tác xóa hình ảnh một chiều, không phải mã hóa có thể đảo ngược như trình ẩn danh văn bản cung cấp.

Làm sao để gọi trực tiếp API thay vì dùng web app?

Gửi một yêu cầu POST đến /api/presidio/image với một Bearer token trong header Authorization và một body multipart/form-data chứa file và mode ("analyze" hoặc "redact"). Xem phần tài liệu tham khảo API ở trên để biết danh sách trường và định dạng phản hồi đầy đủ.

Dùng thử xóa PII trong ảnh

Tải lên một ảnh scan, ảnh chụp, hoặc ảnh chụp màn hình và xem PII được phát hiện được che chỉ trong vài giây.

Mở web app

Limitations / Important note

  • OCR-based text extraction is probabilistic; low-quality scans and handwriting lower detection recall.
  • Redaction is a visual, one-way black box over the detected region — not reversible encryption.
  • This page is informational and is not legal advice.

How we measure — our methodology

About this page

We update this page when our platform or the law changes.

Read our founder note for how we work.

Each change shows up in the timestamp at the top.

We follow these rules

  • GDPR (EU 2016/679).
  • ISO/IEC 27001:2022, held by our hosting provider.
  • NIS2 (EU 2022/2555).
  • HIPAA safe harbor under 45 CFR § 164.514(b)(2).

Our promise

We do not sell your data.

We do not train models on your text.

We store your files in Germany.

You can delete your account at any time.

You own your work.

Where we run

Our company HQ is in Saarbrücken, Germany. Our servers run in Hetzner's Falkenstein datacenter.

Hetzner holds ISO 27001 certification.

All data stays in the EU.

Backups run every day.

Need help?

Email support@anonym.legal.

We reply within one business day.

How we test

Automated checks run on every release.

Each surface gets its own sweep script and report.

Human reviewers spot-check the output each week.

We test detection against sample documents before each release.

A failing unit or integration run stops the release.

What we never do

  • We never sell your information to third parties.
  • We never train models on what you upload.
  • We never keep your work after you delete it.
  • We never share keys with any outside firm.
  • We never run ads inside the product.

Plans in plain words

We sell credits, not seats.

One credit covers one short job.

Long jobs use a few credits each.

Paid plans can buy top-up credits.

Credits reset at the end of each cycle.

Read the plans page for current rates.

Who built this

A small team of engineers and lawyers built this.

We ship from Europe and work in the open.

Our founder note spells out why we started.

Where to start

How the parts fit

A browser add-on cleans text inside Chrome.

A Word plug-in handles drafts in Office.

A small desktop tool works on whole folders.

An agent protocol link feeds large models safely.

All four share one core engine and one rule set.

Words from our team

We started this work after a lunch about cookies.

One friend kept getting odd ads on her phone.

We asked why a court file leaked through a draft.

We sketched the first build on a napkin that week.

By month three we had a tiny demo for a friend.

She used it on her first case the next day.

Common questions we hear

Can the tool read scanned PDFs? Yes, with OCR.

Does it work on long files? Yes, in small chunks.

Can I roll my own rule set? Yes, save it as a preset.

Does it run offline? The desktop build runs offline.

Do you keep my files? No, the cloud build wipes after each run.

Will it learn from my work? No, we never train on inputs.

A short tour of the workflow

Upload a file or paste a snippet of prose.

Pick the entities you want gone from the draft.

Choose a method: replace, mask, hash, encrypt, or redact.

Press run and watch the side panel show each hit.

Skim the result and tweak any rule that misfired.

Save the cleaned file or send it to a teammate.