obsidian-text-extractor

图片PDF一键变可搜索文字,笔记整理效率翻倍

obsidian-text-extractor 是一个 Obsidian 笔记软件的配套插件,用于从图片和 PDF 文件中提取文字。它解决的核心问题是:用户在 Obsidian 中收集了大量扫描件、截图或 PDF 资料,但这些内容无法被搜索和引用。插件通过集成 OCR 引擎(如 Tesseract)和 PDF 解析能力,将图像中的文字识别出来,并直接插入到笔记中,让原本不可编辑的视觉内容变成可检索、可链接的文本。核心能力包括:对常见图片格式进行 OCR 识别、解析 PDF 文档中的文本层或扫描页、在 Obsidian 内一键触发提取流程,以及将结果自动写入当前笔记或新文件。它适合需要整理纸质资料、会议白板照片或学术 PDF 的用户,是 Obsidian 生态中补全“视觉内容文本化”环节的实用工具。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 638
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队scambier
所属国家
官网地址
定价模式free
价格说明开源免费插件
访问状态
是否开源
开源协议GPL-3.0
主要语言TypeScript
技术栈/模型obsidian,obsidian-plugin,ocr,pdf
GitHub 星标★ 638
30天Star增速
HF 下载量
上线时间2022-12-20 00:00:00
最近更新2026-09-14 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 与 Obsidian 深度集成,提取结果可直接写入笔记,无需切换应用
  • 同时支持图片 OCR 和 PDF 文本提取,覆盖常见资料类型
  • 基于 TypeScript 开发,插件体积小、安装配置简单

不足之处

  • OCR 识别准确率依赖外部引擎和语言包,中文等复杂文字效果可能不稳定
  • 仅面向 Obsidian 用户,脱离该生态后无法独立使用

适用场景

  • 将会议白板照片或截图中的文字提取到 Obsidian 笔记中便于搜索
  • 把扫描版 PDF 教材或论文转成可编辑文本,用于摘录和双链引用
  • 整理手写笔记照片时批量 OCR,快速建立可检索的知识库

替代项目

Tesseract.js、PDF.js、Obsidian OCR

项目介绍

obsidian-text-extractor 是一个计算机视觉领域的开源项目,官方简介:A (companion) plugin to facilitate the extraction of text from images (OCR) and PDFs.。项目使用 TypeScript 开发,在 GitHub 上获得 638 星标。

上一篇:image-reader

下一篇:lw.PPOCR.C

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14