LLMAIx

本地大模型读文档,抽字段+脱敏,数据不出门

LLMAIx 是一个基于本地大语言模型的文档信息抽取与匿名化工具。它解决的核心问题是:企业或个人在处理合同、发票、简历、报告等文档时,既需要提取关键字段(如金额、日期、人名、地址),又必须避免把敏感原文发送到云端 API 造成隐私泄露。项目通过集成 Ollama 等本地推理后端,让模型完全在用户自己的机器上运行,实现零数据外传。核心能力包括:支持 PDF、图片、文本等多格式文档解析;用自然语言提示词定义抽取字段,无需训练专用模型;自动识别并脱敏姓名、电话、邮箱、身份证号等 PII 信息;输出结构化 JSON 或表格,方便后续入库或分析。适合对数据合规要求高的法务、医疗、金融场景,也适合个人开发者快速搭建私有文档处理流水线。

开源 free 办公效率
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 178
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类办公效率
开发团队KatherLab
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署本地LLM
访问状态
是否开源
开源协议AGPL-3.0
主要语言Python
技术栈/模型
GitHub 星标★ 178
30天Star增速
HF 下载量
上线时间2024-03-22 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

核心亮点

  • 完全本地推理,敏感文档无需上传云端,满足隐私合规要求
  • 用自然语言提示词定义抽取字段,改需求不用重新训练模型
  • 同时覆盖信息抽取和 PII 匿名化,一份文档可先脱敏再抽取

不足之处

  • 依赖本地 LLM 的推理能力,复杂版式或手写体抽取准确率不稳定
  • 项目处于早期,文档和社区案例较少,遇到问题可参考的解决方案有限

适用场景

  • 法务团队批量处理合同时自动提取签约方、金额、期限并脱敏个人信息
  • 医疗机构从病历报告中抽取关键指标,同时隐藏患者姓名和身份证号
  • 个人开发者搭建私有发票识别流水线,把 PDF 转成结构化表格且数据不外传

替代项目

Unstructured、docling、GLiNER

项目介绍

LLMAIx 是一个办公效率领域的开源项目,官方简介:Document Information Extraction & Anonymization using local LLMs。项目使用 Python 开发,在 GitHub 上获得 177 星标。

上一篇:ServiceNowDocs

下一篇:MTools

同类项目推荐

sunshine-control-panel 开源

一站式管理游戏库、监控内存,AI 助手加持,让大屏启动更高效。

Sunshine Foundation 大屏桌面管理器 | Tauri + Vue 3,游戏库管理、米塔AI助手、内存监控···

★ 442 2026-08-09
Stirling PDF 开源

本地部署 PDF 工具箱

#1 PDF Application on GitHub that lets you edit PDFs on any device anywhere

★ 92336 2026-08-19
obsidian-md2wechat 开源

一键将 Obsidian 笔记排版成公众号文章,告别手动调格式

Obsidian → WeChat | Obsidian 插件一键排版发布到微信公众号,键排版发布到微信公众号:···

★ 311 2026-08-09
pdf2md 开源

浏览器里直接把 PDF 变成 Markdown,不用上传,隐私安全。

Browser based tool to convert PDFs to Markdown

★ 376 2026-08-09