
GitHub 星标
★ 6128
维护状态
活跃
是否开源
是
定价模式
unknown
项目数据
分类计算机视觉
开发团队oomol-lab
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型deepseek-ocr,document,ocr,pdf
GitHub 星标★ 6128
30天Star增速
HF 下载量
上线时间2025-02-12 00:00:00
最近更新2026-08-13 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-14
浏览次数0
核心亮点
- 基于 deepseek-ocr,识别精度高,尤其对中文扫描件效果好
- 专攻扫描书籍场景,处理流程针对性强,而非通用 PDF 工具
- Python 实现,易于集成到自动化工作流中
不足之处
- 依赖外部 OCR 服务或模型,可能需网络或算力资源
- 文档/社区待观察
适用场景
- 将扫描版 PDF 书籍转换为可搜索的电子文档
- 批量提取 PDF 中的文字用于知识库构建
- 辅助制作读书笔记或引用文献内容
替代项目
PaddleOCR、Tesseract OCR、pdf2text
项目介绍
上一篇:Lifelong-nnUNet
下一篇:DEIMv2
同类项目推荐
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
Awesome-Try-On-Models
开源
一站式找到虚拟试穿最新论文和代码,快速上手。
A repository for organizing papers, codes and other resources related to Virtual Try···
MuscleMap
开源
一键量化全身肌肉 MRI,让科研分析标准化。
MuscleMap: An Open-Source, Community-Supported Consortium for Whole-Body Quantitativ···
geti
开源
少数据快训练,轻松搞定计算机视觉模型
Build computer vision models in a fraction of the time and with less data.