rizzo-pii 是评测安全领域的开源项目,由 Rizzo-AI-Academy 开发,是 2026 年新上线的项目。
在全站 13,199 个收录项目中,它的 GitHub 星标数(1,074)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-27。开源免费,本地运行无需付费。
它主要面向的使用场景是:律师事务所在把合同发给LLM前先脱敏当事人信息。同类可对比的替代方案包括 Presidio、scrubadub。

本地脱敏文档,再放心喂给 LLM
rizzo-pii 是一个本地优先的隐私保护工具,专门解决在把文档交给大语言模型处理前,如何自动识别并匿名化其中的个人身份信息(PII)的问题。它基于命名实体识别(NER)和 token 分类模型(如 mmBERT),在本地完成扫描与脱敏,避免敏感数据上传到云端。核心能力包括:自动检测姓名、地址、税号、电话等隐私字段,支持意大利语等语言与 GDPR 合规场景,可对文档进行替换、掩码或占位符处理后再送入 LLM。项目面向法律科技、医疗、金融等对数据出境敏感的行业,让团队在享受 LLM 能力的同时不违反隐私法规。作为本地运行的开源方案,它不依赖外部 API,数据不出本机,适合需要审计与可控性的场景。
1克隆项目仓库
从 GitHub 拉取源码并进入项目目录,后续命令都在该目录执行。
git clone https://github.com/Rizzo-AI-Academy/rizzo-pii
cd rizzo-pii2构建 Docker 镜像
联网下载 CPU 版 PyTorch 与 rizzo-pii-0.3B 模型并打包进镜像,约需 10 分钟。
docker build -t rizzo-pii .3启动服务容器
后台运行容器并把端口映射到本机 127.0.0.1,避免服务暴露到局域网。
docker run -d --name rizzo-pii -p 127.0.0.1:5005:5005 rizzo-pii4查看启动日志
gunicorn 日志显示模型加载进度;模型就绪前 /health 返回 503,首个请求需等待。
docker logs -f rizzo-pii5停止并移除容器
不再使用时清理容器,镜像仍保留,可随时用同一条 run 命令重新启动。
docker rm -f rizzo-pii6源码方式运行(可选)
不用 Docker 时,用虚拟环境装依赖后启动同一套 Web 服务;Windows 改用 ..venvScriptsActivate.ps1 激活。
python -m venv .venv && source .venv/bin/activate
pip install -r requirements.txt| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
-p 127.0.0.1:5005:5005 | 是 | 端口映射,只允许本机访问 5005 端口 | -p 127.0.0.1:5005:5005 |
HF_HUB_OFFLINE | 否 | 设为 1 时禁止联网下载模型,保证文档不出本机 | HF_HUB_OFFLINE=1 |
.env | 否 | 由 .env.example 复制而来,填 W&B / Gemini 密钥,仅重训模型时需要 | cp .env.example .env |
执行 docker ps 看到容器状态为 healthy,浏览器打开 http://127.0.0.1:5005 能正常访问页面。
Q:没有 GPU 可以用吗?
A:可以。模型本身 CPU 即可运行,量化后内存占用约 0.5 GB,官方明确说明无需 GPU。
Q:文档会被上传到云端吗?
A:不会。推理全程本地完成,容器内设置 HF_HUB_OFFLINE=1,模型和文档都不离线,也不需要 API Key。
Q:为什么端口要写成 127.0.0.1:5005:5005?
A:容器内绑定 0.0.0.0,若写成 5005:5005 会把服务暴露到局域网;用 127.0.0.1 前缀可限制为仅本机访问。
Q:启动后立刻访问页面报错或 503?
A:模型约 1.2 GB,加载需要时间;/health 在模型就绪前一直返回 503,等 docker ps 显示 healthy 后再访问。
Q:不想装 Python 或 Docker 怎么办?
A:直接从 Releases 页面下载现成安装包:Windows 安装器、macOS .dmg(Apple Silicon)或 Linux AppImage(chmod +x 后运行)。
Presidio、scrubadub
rizzo-pii 是评测安全领域的开源项目,由 Rizzo-AI-Academy 开发,是 2026 年新上线的项目。
在全站 13,199 个收录项目中,它的 GitHub 星标数(1,074)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-27。开源免费,本地运行无需付费。
它主要面向的使用场景是:律师事务所在把合同发给LLM前先脱敏当事人信息。同类可对比的替代方案包括 Presidio、scrubadub。
上一篇:SIMURG
下一篇:hanshuang-codex
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents