
LLMAIx
本地大模型读文档,抽字段+脱敏,数据不出门
LLMAIx 是一个基于本地大语言模型的文档信息抽取与匿名化工具。它解决的核心问题是:企业或个人在处理合同、发票、简历、报告等文档时,既需要提取关键字段(如金额、日期、人名、地址),又必须避免把敏感原文发送到云端 API 造成隐私泄露。项目通过集成 Ollama 等本地推理后端,让模型完全在用户自己的机器上运行,实现零数据外传。核心能力包括:支持 PDF、图片、文本等多格式文档解析;用自然语言提示词定义抽取字段,无需训练专用模型;自动识别并脱敏姓名、电话、邮箱、身份证号等 PII 信息;输出结构化 JSON 或表格,方便后续入库或分析。适合对数据合规要求高的法务、医疗、金融场景,也适合个人开发者快速搭建私有文档处理流水线。
开源
free
办公效率
GitHub 星标
★ 178
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类办公效率
开发团队KatherLab
所属国家
定价模式free
价格说明开源免费,需自行部署本地LLM
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型
GitHub 星标★ 178
30天Star增速
HF 下载量
上线时间2024-03-22 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1
使用教程
核心亮点
- 完全本地推理,敏感文档无需上传云端,满足隐私合规要求
- 用自然语言提示词定义抽取字段,改需求不用重新训练模型
- 同时覆盖信息抽取和 PII 匿名化,一份文档可先脱敏再抽取
不足之处
- 依赖本地 LLM 的推理能力,复杂版式或手写体抽取准确率不稳定
- 项目处于早期,文档和社区案例较少,遇到问题可参考的解决方案有限
适用场景
- 法务团队批量处理合同时自动提取签约方、金额、期限并脱敏个人信息
- 医疗机构从病历报告中抽取关键指标,同时隐藏患者姓名和身份证号
- 个人开发者搭建私有发票识别流水线,把 PDF 转成结构化表格且数据不外传
替代项目
Unstructured、docling、GLiNER
项目介绍
上一篇:ServiceNowDocs
下一篇:MTools
同类项目推荐
sunshine-control-panel
开源
一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。
Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···
Stirling PDF
开源
本地部署 PDF 工具箱
#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere
obsidian-md2wechat
开源
一键将 Obsidian 笔记排版成公众号文章,告别手动调格式
Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···
pdf2md
开源
浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。
Browser based tool to convert PDFs to Markdown