ocr

本站收录 193 个带「ocr」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

PaddleOCRPaddleOCR 是百度开源的 OCR 工具库,旨在将任意 PDF 或图片文档转化为结构化数据,供 AI 系统使用。它解决了图像和 PDF 中文字信息难以被机★ 90,415MinerUMinerU 是一个开源工具,能将 PDF、Word 等复杂文档转换为适合大语言模型(LLM)使用的 Markdown 或 JSON 格式。它解决了非结构化文档★ 80,837tesseractTesseract 是当前最知名的开源 OCR(光学字符识别)引擎,由惠普实验室诞生、Google 主导维护。它解决的核心问题是从图片中提取文字,支持超过 10★ 76,756paperless-ngxpaperless-ngx 是一个社区驱动的增强型文档管理系统,旨在帮助个人和小团队摆脱纸质文件堆积的困扰。它通过扫描、索引和归档所有文档,将纸质文件转化为可搜★ 46,160OCRmyPDFOCRmyPDF 是一个开源命令行工具,专门为扫描版 PDF 文件添加 OCR 文本层,让原本不可搜索的扫描文档变得可搜索、可复制、可索引。它解决的核心问题是:★ 34,903opendataloader-pdfopendataloader-pdf 是一个专为 AI 数据准备而设计的 PDF 解析器,旨在将 PDF 文档自动转换为 AI 可读的结构化数据。它解决了传统 ★ 29,401pot-desktoppot-desktop 是一款基于 Tauri 构建的跨平台划词翻译与 OCR 文字识别工具,支持 Windows、macOS 和 Linux。它解决了用户在阅★ 19,409unstructuredUnstructured 是一个开源的 ETL 工具,专注于将复杂文档(如 PDF、Word、PPT、图片等)转换为干净、结构化的数据,以便直接用于大语言模型(★ 15,519Skill_SeekersSkill_Seekers 是一个将文档网站、GitHub 仓库和 PDF 自动转换为 Claude AI 技能(Skills)的开源工具。它解决了手动编写 C★ 15,046EasydictEasydict 是一款专为 macOS 打造的简洁优雅的词典与翻译应用,旨在解决用户在阅读、写作或浏览外文内容时频繁切换翻译工具的低效痛点。它开箱即用,无需复★ 14,802LunaTranslatorLunaTranslator 是一款专为视觉小说(Galgame)设计的翻译工具,主要解决玩家在游玩日文或英文原版游戏时的语言障碍问题。它通过 OCR 识别游戏★ 13,469liteparseliteparse 是一个用 Rust 编写的高性能开源文档解析器,专注于从 PDF、扫描件和图片中快速提取文本与结构化数据。它解决了传统 OCR 工具速度慢、★ 12,719bishengbisheng 是一个面向企业级 AI 应用的开源 LLM DevOps 平台,旨在解决大模型应用从开发到上线的全生命周期管理问题。它提供 GenAI 工作流编★ 12,015PyMuPDFPyMuPDF 是一个高性能的 Python 库,用于 PDF 及其他文档(如 EPUB)的数据提取、分析、转换和操作。它基于 MuPDF 引擎,提供丰富的 A★ 10,808X-AnyLabelingX-AnyLabeling 是一款轻量、高效、跨平台的桌面标注工具,专为文本、图像、视频和多模态数据设计。它集成了丰富的内置标注工具(如矩形框、多边形、关键点等★ 10,569manga-image-translatormanga-image-translator 是一个基于深度学习的漫画/图片文字翻译工具,能够自动检测图片中的文字区域,识别原文(主要支持日文、英文等),并翻译★ 10,454BobBob 是一款专为 macOS 设计的翻译与 OCR(光学字符识别)工具,旨在解决用户在阅读外文内容、处理图片文字时的效率痛点。它支持划词翻译、截图翻译、输入翻★ 9,756STranslateSTranslate 是一款基于 WPF 开发的 Windows 桌面翻译与 OCR 工具,主打“即用即走”的轻量交互。它解决了用户在日常使用电脑时频繁切换翻译★ 8,141RapidOCRRapidOCR 是一个基于 ONNX Runtime、OpenVINO、MNN、PaddlePaddle、TensorRT 和 PyTorch 等多种推理引擎★ 7,999unstractunstract 是一个基于大语言模型(LLM)的智能数据提取平台,专门用于从非结构化文档(如 PDF、图片、扫描件)中自动抽取结构化数据,并以 JSON 格式★ 7,266eSearcheSearch 是一款基于 Electron 和 TypeScript 开发的跨平台截屏与 OCR 工具,支持 Windows、Linux 和 macOS。它解★ 7,222flyingmouse-format飞鼠格式(FlyingMouse Format)是一款面向 Windows 平台的免费离线文件格式转换工具,基于 Electron 构建,内置 FFmpeg、L★ 6,383doctrdocTR 是一个基于深度学习的 OCR 库,专注于文档文本识别,由 t2k 团队持续维护。它解决了从文档图像中高效、准确地检测和识别文字的问题,提供了文本检测★ 6,367pdf-craftpdf-craft 是一个专注于将扫描版 PDF 书籍转换为其他格式的开源工具。它利用 deepseek-ocr 等 OCR 技术,解决扫描 PDF 中文字无法★ 6,337snow-appsSnow Apps 是一个开源的桌面工具集合,主要包含两款应用:Snow Shot 和 Snow Image Viewer。Snow Shot 是一款功能强大的★ 5,301BallonsTranslatorBallonsTranslator 是一款深度学习辅助的漫画翻译工具,主要解决漫画本地化过程中人工成本高、流程繁琐的问题。它集成了从文字检测、识别、抹除到翻译、★ 5,164Text-GrabText-Grab 是一款专为 Windows 平台设计的轻量级 OCR 工具,核心目标是让用户在任何界面中快速抓取屏幕上的文字。它解决了传统 OCR 工具需要★ 5,029jabrefJabRef 是一款基于 Java 的桌面端文献管理工具,专门用于维护 BibTeX 和 BibLaTeX 格式的 .bib 文件。它解决了科研人员在撰写论文时★ 4,773naps2NAPS2是一个专为简化扫描流程而设计的开源桌面应用,旨在让用户以最少的操作步骤将纸质文档转换为PDF或其他格式。它解决了传统扫描软件界面复杂、驱动兼容性差、跨★ 4,563RuVectorRuVector 是一个用 Rust 构建的高性能实时向量数据库,专为 AI 应用设计,集成了图神经网络(GNN)和记忆数据库能力。它解决了传统向量数据库在实时★ 4,527LLPlayerLLPlayer 是一款专为语言学习设计的开源媒体播放器,基于 C# 开发。它解决了语言学习者在使用普通播放器时无法高效对照原文和译文、难以获取生词释义、以及缺★ 4,315modlensmodlens 是首个为 DeepSeek Harness 打造的视觉插件,旨在为纯文本编码代理(如 DeepSeek、GLM 等)提供视觉理解能力。它解决了文★ 4,071KillerPDFKillerPDF 是一款免费开源的 Windows 平台 PDF 编辑器,基于自研的 PDF 2.0 引擎构建,旨在替代 Adobe Acrobat 等商业订★ 4,020Hands-On-AI-EngineeringHands-On-AI-Engineering 是一个精选的实用 AI 项目集合,专注于通过动手实践来学习 AI 工程。项目涵盖了 OCR 系统、RAG(检索增★ 3,755deepdoctectiondeepdoctection 是一个面向文档 AI 的 Python 工具库,旨在帮助开发者从 PDF、扫描件等非结构化文档中提取结构化信息。它解决了文档解析中★ 3,260Pix2TextPix2Text 是一个开源的 Python3 工具,旨在将图片中的版面、表格、数学公式和文字识别并转换为 Markdown 格式。它使用小型模型,支持 80 ★ 3,259text-extract-apitext-extract-api 是一个基于 Python 的文档解析服务,旨在将 PDF、Word、PPTX 等格式的文档以及图片,通过先进的 OCR 技术和★ 3,182llm_aided_ocrllm_aided_ocr 是一个利用大语言模型(LLM)增强 Tesseract OCR 输出的开源工具。它解决传统 OCR 识别率低、输出格式杂乱的问题,通★ 3,004comic-translatecomic-translate 是一个开源的 AI 漫画与图像翻译工具,支持浏览器扩展和桌面应用,可自动翻译漫画、韩漫、日漫、欧美漫画等多种图像格式(如图片、P★ 2,957CHINESE-OCRCHINESE-OCR 是一个面向中文自然场景文字的端到端检测与识别开源项目,采用 CTPN 做文本检测、CRNN+CTC 做文本识别的经典两阶段方案。它解决的★ 2,957manga-translator-uimanga-translator-ui 是一个基于 manga-image-translator 的开源漫画翻译工具,旨在解决漫画本地化过程中人工翻译效率低、工★ 2,885normcapNormCap 是一款基于 OCR 的屏幕截图工具,核心理念是“捕获信息而非图像”。用户用快捷键框选屏幕任意区域,它立即调用 Tesseract 等 OCR 引★ 2,734paperless-gptpaperless-gpt 是一个将大语言模型(LLM)和视觉模型(OCR)能力接入 paperless-ngx 文档管理系统的开源工具。它解决的是 paper★ 2,719crosspaste-desktopCrosspaste Desktop 是一款跨平台剪贴板同步工具,支持 macOS、Windows 和 Linux,用 Kotlin 与 Compose Des★ 2,590claude-real-videoclaude-real-video 是一个让 Claude 等大语言模型真正“看懂”视频的开源工具。它解决的是 LLM 无法直接处理视频的问题,通过从视频 UR★ 2,191obsidian-omnisearchObsidian Omnisearch 是一款为 Obsidian 笔记软件打造的全文搜索插件,目标是让搜索「开箱即用」。它基于 MiniSearch 实现快速★ 2,156docextdocext 是一个本地部署的、无需 OCR 的非结构化数据提取与 Markdown 转换工具包,同时提供基准测试能力。它主要解决企业从 PDF、Word、扫描★ 2,086RPAUi.Vision 是一个开源 RPA(机器人流程自动化)工具,以浏览器扩展形式提供,结合计算机视觉、OCR 和 AI(如 Anthropic Claude)实★ 2,052ocrsocrs 是一个用 Rust 编写的 OCR 库和命令行工具,目标是从图片中提取文字。它把机器学习模型推理封装成易用的 Rust API,同时提供 CLI 方便★ 1,891extractousextractous 是一个用 Rust 编写的高性能非结构化数据提取库,旨在解决从 PDF、Word、HTML、图片等各类文件中快速提取文本和元数据的问题。它★ 1,780