
obsidian-text-extractor
图片PDF一键变可搜索文字,笔记整理效率翻倍
obsidian-text-extractor 是一个 Obsidian 笔记软件的配套插件,用于从图片和 PDF 文件中提取文字。它解决的核心问题是:用户在 Obsidian 中收集了大量扫描件、截图或 PDF 资料,但这些内容无法被搜索和引用。插件通过集成 OCR 引擎(如 Tesseract)和 PDF 解析能力,将图像中的文字识别出来,并直接插入到笔记中,让原本不可编辑的视觉内容变成可检索、可链接的文本。核心能力包括:对常见图片格式进行 OCR 识别、解析 PDF 文档中的文本层或扫描页、在 Obsidian 内一键触发提取流程,以及将结果自动写入当前笔记或新文件。它适合需要整理纸质资料、会议白板照片或学术 PDF 的用户,是 Obsidian 生态中补全“视觉内容文本化”环节的实用工具。
开源
free
计算机视觉
GitHub 星标
★ 638
维护状态
较活跃
是否开源
是
定价模式
free
项目数据
分类计算机视觉
开发团队scambier
所属国家
定价模式free
价格说明开源免费插件
访问状态
是否开源是
开源协议GPL-3.0
主要语言TypeScript
技术栈/模型obsidian,obsidian-plugin,ocr,pdf
GitHub 星标★ 638
30天Star增速
HF 下载量
上线时间2022-12-20 00:00:00
最近更新2026-09-14 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0
使用教程
核心亮点
- 与 Obsidian 深度集成,提取结果可直接写入笔记,无需切换应用
- 同时支持图片 OCR 和 PDF 文本提取,覆盖常见资料类型
- 基于 TypeScript 开发,插件体积小、安装配置简单
不足之处
- OCR 识别准确率依赖外部引擎和语言包,中文等复杂文字效果可能不稳定
- 仅面向 Obsidian 用户,脱离该生态后无法独立使用
适用场景
- 将会议白板照片或截图中的文字提取到 Obsidian 笔记中便于搜索
- 把扫描版 PDF 教材或论文转成可编辑文本,用于摘录和双链引用
- 整理手写笔记照片时批量 OCR,快速建立可检索的知识库
替代项目
Tesseract.js、PDF.js、Obsidian OCR
项目介绍
上一篇:image-reader
下一篇:lw.PPOCR.C
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3