scribe.js

浏览器里直接识别图片和 PDF 文字,无需后端

scribe.js 是一个纯 JavaScript 的 OCR 与文本提取库,可在浏览器和 Node.js 中直接识别图片与 PDF 中的文字,无需后端服务或本地安装 Tesseract。它把 Tesseract 编译为 WebAssembly,结合 PDF 解析能力,把扫描件、截图、PDF 页面转成可搜索、可复制的文本。核心能力包括:多语言识别、PDF 逐页文本抽取、图像预处理、版面/段落切分,并支持通过 MCP 协议接入 AI 工具链,让大模型直接调用 OCR 能力。适合做文档数字化、发票/合同信息提取、图片文字检索等场景,前端即可完成识别,数据不出本地,兼顾隐私与成本。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 320
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队scribeocr
所属国家
官网地址
定价模式free
价格说明开源免费,基于Tesseract与WebAssembly
访问状态
是否开源
开源协议AGPL-3.0
主要语言JavaScript
技术栈/模型javascript,mcp,ocr,tesseract,webassembly
GitHub 星标★ 320
30天Star增速
HF 下载量
上线时间2024-08-15 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-19
浏览次数0

使用教程

核心亮点

  • 纯前端运行,基于 WebAssembly,图片和 PDF 不上传服务器,隐私友好
  • 同时支持图像 OCR 与 PDF 文本提取,一套 API 覆盖两类常见文档
  • 提供 MCP 接口,可被 AI Agent/大模型直接调用做文档理解

不足之处

  • 项目仅 320 星,属于早期阶段,API 可能不稳定
  • WebAssembly 版 Tesseract 首次加载体积较大,识别速度弱于原生方案
  • 复杂版面(多栏、表格、手写体)的识别准确率有限

适用场景

  • 前端上传发票或合同 PDF,直接在浏览器提取文字并结构化
  • 浏览器插件对网页截图做 OCR,实现图片文字搜索与复制
  • AI Agent 通过 MCP 调用 OCR,把扫描文档转成文本再交给大模型总结

替代项目

tesseract.js、pdf.js、PaddleOCR

项目介绍

scribe.js 是一个计算机视觉领域的开源项目,官方简介:JavaScript OCR and text extraction for images and PDFs.。项目使用 JavaScript 开发,在 GitHub 上获得 320 星标。

上一篇:PaddleOCRApi

下一篇:image-reader

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14