Edit-Banana

把 PDF/图片表格变成可编辑数据,一键搞定

Edit-Banana 是一个将统计格式(如 PDF、图像中的表格)转换为可编辑内容的开源框架。它解决的是数据提取与编辑的痛点,让用户能从非结构化文档中提取结构化数据,并支持后续编辑。核心能力包括文档解析、格式转换、数据清洗和输出为可编辑格式(如 Excel、CSV)。基于 Python,提供简单 API,适合自动化数据处理流程。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5492
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队BIT-DataLab
所属国家
定价模式free
价格说明开源框架,AGPL-3.0许可,可免费使用和修改,无在线服务或付费版本。
访问状态
是否开源是
开源协议AGPL-3.0
主要语言Python
技术栈/模型ai,data,figure,llm,nanobanana,open-source,python,pythonprogramming
GitHub 星标★ 5492
30天Star增速
HF 下载量
上线时间2026-01-16 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 8 步

环境要求

  • Python 3.10+
  • 推荐 NVIDIA GPU(CUDA)环境,也支持 CPU 运行
  • 系统需安装 Tesseract OCR 或 PaddleOCR
  • 需自行准备 SAM3 权重 sam3.pt 与 BPE 词表文件并放入 models/ 目录
  • 至少 3GB 以上磁盘空间用于依赖与模型权重(README 未给出具体数值)

安装与启动步骤

  1. 1克隆代码仓库

    把 Edit-Banana 源码克隆到本地并进入项目目录,后续所有命令都在该目录下执行。

    git clone https://github.com/BIT-DataLab/Edit-Banana.git && cd Edit-Banana
  2. 2创建虚拟环境

    用 venv 隔离依赖。Linux/macOS 用 source 激活;Windows 执行 .venvScriptsctivate。

    python3 -m venv .venv && source .venv/bin/activate
  3. 3安装 PyTorch 与依赖

    先装 PyTorch(按 README 的 cu118 源,CPU 版请换官方 CPU 索引),再装 requirements.txt。

    pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118
    pip install -r requirements.txt
  4. 4安装 OCR 引擎

    README 给出 Debian/Ubuntu 的 Tesseract 安装方式;其他系统请装等价包,或改用 PaddleOCR。

    sudo apt install tesseract-ocr tesseract-ocr-chi-sim
  5. 5安装 SAM3 并下权重

    README 提示需安装 SAM3 库并下载模型权重与 BPE 词表,权重放到 models/ 目录下。

    bash scripts/setup_sam3.sh
  6. 6准备目录与配置

    创建输入输出目录并复制配置模板;随后编辑 config.yaml 里的模型路径。

    mkdir -p input output
    cp config/config.yaml.example config/config.yaml
  7. 7命令行跑通测试

    把测试图放入 input/,例如 input/test.png,运行 CLI,结果输出到 output//。

    python main.py -i input/test.png
  8. 8可选:启动 Web API

    另开终端调用 /convert 上传文件,或打开 /docs 页面用交互界面测试。

    python server_pa.py
    curl -X POST http://localhost:8000/convert -F "file=@input/test.png"

关键配置

配置项必填说明示例
sam3.checkpoint_path是SAM3 权重文件路径,必须与你 models/ 下实际位置一致models/sam3.pt
sam3.bpe_path是BPE 词表路径,用于模型文本编码models/bpe_simple_vocab_16e6.txt
sam3.device否运行设备,出现 GPU 架构不匹配时可改为 cpucuda
paths否设置输入与输出目录,默认 input 与 outputinput/ 与 output/
dominant_color否主色提取灵敏度,可按文档颜色情况微调0.5

如何确认成功

运行 CLI 后 output/<图片名>/ 下生成 DrawIO XML 等中间文件即成功;Web 方式可访问 http://localhost:8000/docs。

常见问题

Q:报错 no kernel image is available 怎么办?

A:这是 GPU 架构不匹配。升级 PyTorch 到匹配 CUDA 版本的构建,或在 config.yaml 中把 sam3.device 设为 "cpu" 后重试。

Q:提示 Model file not found at ...rmbg/...?

A:RMBG 是可选模块,不影响主流程。需要时按 README 说明通过脚本下载相应权重再启用即可。

Q:PaddleOCR 推理失败怎么处理?

A:按 README 建议使用 paddlepaddle==3.2.2,或直接退回到 Tesseract OCR 方案。

Q:Windows 上虚拟环境怎么激活?

A:执行 .venvScriptsctivate;OCR 依赖安装请按 README 提示改用 Windows 上的等价安装方式。

注意事项

  • README 未给出 SAM3 库的完整安装命令,需按 scripts/setup_sam3.sh 及项目文档补齐权重下载步骤。
  • 首次运行前请对照 README 的 Checklist:配置文件已复制、模型路径已设置、SAM3 权重与 BPE 已放入 models/、OCR 已安装。
  • 模型权重需自行下载,注意版权与体积;文件缺失会直接导致启动失败。
  • CPU 模式可运行但速度明显慢于 GPU,长文档建议使用 CUDA 环境。

核心亮点

  • 支持多种统计格式输入,转换准确率高
  • API 简洁,易于集成到现有 Python 项目
  • 活跃社区,持续更新,文档清晰

不足之处

  • 复杂表格布局可能转换失真
  • 文档/社区待观察

适用场景

  • 从 PDF 报表中提取数据用于分析
  • 将扫描文档中的表格转为 Excel 编辑
  • 自动化数据录入流程,减少人工操作

替代项目

Tabula、Camelot、Excalibur

项目介绍

Edit-Banana 是开发框架领域的开源项目,由 BIT-DataLab 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(5,492)位列前 8%,在开发框架分类的 803 个项目里位列前 10%。

近 41 天,它的 GitHub 星标从 5,463 增加到 5,492,净增 29。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。AGPL-3.0许可,可免费使用和修改,无在线服务或付费版本。

它主要面向的使用场景是:从PDF报表中提取数据用于分析。同类可对比的替代方案包括 Tabula、Camelot、Excalibur。

上一篇:tree-of-thought-llm

下一篇:lms

同类项目推荐

langchain 开源

组装 AI 应用的乐高积木,从想法到上线不换工具

The agent engineering platform.

★ 146874 2026-08-09
transformers 开源

全球最大的模型仓库全家桶,想用的模型一把抓

Transformers: the model-definition framework for state-of-the-art machine learning m···

★ 166529 2026-08-09
pi 开源

一套 TypeScript 工具包,快速搭出能写代码的 AI agent

AI agent toolkit: unified LLM API, agent loop, TUI, coding agent CLI

★ 108504 2026-09-12