paperbanana

让 AI 自动把论文变成图表,科研作图不再费手。

paperbanana 是 Google Research 论文中 PaperBanana 的开源实现与扩展,旨在自动化生成学术图表、示意图和研究可视化,并拓展到幻灯片生成等新领域。它利用 Gemini 等大语言模型和代理式 AI 能力,将研究论文中的复杂信息转化为清晰的视觉表达,解决科研人员手动绘制图表耗时费力的问题。核心能力包括:解析论文内容并生成结构化的学术图表、支持多种输出格式、提供 MCP 服务器以便集成到现有工作流中。项目基于 Python 构建,技术栈覆盖 LLM、MCP、Arxiv 等,适合科研人员、教育工作者和内容创作者快速制作高质量的学术视觉材料。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2379
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队llmsresearch
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型academic-diagrams,academic-research,agentic-ai,arxiv,diagram-generation,gemini,google-gemini,llm,llms,mcp,mcp-server,multiagent,neurips,paperbanana,python-ai-research-tools,research-automation,research-tools,scientific-visualization,text-to-image,vlm
GitHub 星标★ 2379
30天Star增速
HF 下载量
上线时间2026-02-04 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 7 步

环境要求

  • Python 3.10 及以上版本
  • Gemini API Key(官方 API 或兼容接口的 URL + Key)
  • 可选:Docker(使用容器方式运行时需要)
  • 可选:PyMuPDF(输入 PDF 时需安装 paperbanana[pdf])

安装与启动步骤

  1. 1安装 PaperBanana

    用 pip 从 PyPI 安装,自动装好命令行工具 paperbanana。建议在独立虚拟环境中执行,避免依赖冲突。

    pip install paperbanana
  2. 2首次交互配置

    运行交互式向导,先选择是否使用官方 Gemini API;若不用官方,则需填入自定义 Gemini 兼容 URL 和 API Key。

    paperbanana setup
  3. 3准备输入文件

    把论文方法部分的文字整理成纯文本文件(如 method.txt)放在当前目录,作为生成的输入素材。

  4. 4生成学术图表

    传入输入文件与图注说明,程序会调用模型生成示意图,结果默认写入 outputs 目录。

    paperbanana generate --input method.txt --caption "Overview of our framework"
  5. 5按反馈迭代修改

    对上一轮结果不满意时,用 --continue 加 --feedback 让模型按文字反馈继续调整图表。

    paperbanana generate --continue --feedback "Make arrows thicker and colors more distinct"
  6. 6Docker 方式运行

    先在仓库根目录构建镜像,再挂载输入文件与输出目录到 /work,并把 API Key 通过环境变量传入容器。

    docker build -t paperbanana .
    docker run --rm -e GOOGLE_API_KEY 
      -v "$(pwd)/method.txt:/work/method.txt:ro" 
      -v "$(pwd)/outputs:/work/outputs" 
      paperbanana generate --input method.txt --caption "Overview of our framework"
  7. 7源码开发安装

    需要改代码或跑测试时,克隆仓库后以可编辑模式安装,并带上 dev、openai、google 依赖。

    git clone https://github.com/llmsresearch/paperbanana.git
    cd paperbanana
    pip install -e ".[dev,openai,google]"

关键配置

配置项必填说明示例
GOOGLE_API_KEY是调用 Gemini 模型生成图表所需的 API 密钥AIzaSyxxxxxxxxxxxxxxxx
vlm.provider否选择负责理解论文文本的视觉语言模型提供方openai
vlm.model否指定使用的语言模型名称gpt-5.2
image.provider否选择实际出图的图像模型提供方openai_imagen
image.model否指定使用的图像生成模型名称gpt-image-1.5
output.dir否生成结果的保存目录,默认 outputsoutputs

如何确认成功

执行 paperbanana generate --help 能正常输出命令帮助,且生成后 outputs 目录内出现图表文件,即表示配置与运行成功。

常见问题

Q:必须联网并使用 API Key 吗?

A:是,核心生成依赖 Gemini 等云端大模型。可通过 paperbanana setup 选择官方 Gemini API,或填写自定义的兼容接口地址与密钥。

Q:可以直接拿 PDF 论文当输入吗?

A:可以。先安装 PDF 支持:pip install 'paperbanana[pdf]',然后执行 paperbanana generate --input paper.pdf --caption "..." --pdf-pages "3-8" 指定页码范围。

Q:如何修改默认配置?

A:默认配置在 configs/config.yaml,可用 --config my_config.yaml 指定自定义 YAML,或在命令行传参覆盖 vlm、image、pipeline 等设置。

Q:Docker 里为什么读不到我的文件?

A:容器内工作目录是 /work,需用 -v 把本地输入文件挂载到 /work 下,并把输出目录也挂载到 /work/outputs,否则结果会留在容器里丢失。

Q:生成结果不满意怎么办?

A:用 paperbanana generate --continue --feedback "你的修改意见" 基于上一轮继续优化,也可用 --continue-run 指定某次运行记录并要求迭代次数。

注意事项

  • Python 版本要求 3.10 以上,低版本安装会失败。
  • Docker 运行时必须通过 -e GOOGLE_API_KEY 传入密钥,并正确挂载输入输出目录。
  • PDF 输入需要额外安装 paperbanana[pdf](即 PyMuPDF 依赖)。
  • 生成的图片与元数据默认保存在 outputs 目录,注意及时备份或清理。

核心亮点

  • 直接对标 Google 官方方案,权威性有保障,且开源可自由定制
  • 支持 MCP 服务器,能无缝接入 Claude 等 AI 工具链,扩展性强
  • 从论文解析到图表生成全流程自动化,大幅节省科研绘图时间

不足之处

  • 依赖 Gemini API,可能产生费用且受限于 Google 服务可用性
  • 生成图表质量受 LLM 能力影响,复杂图表可能需人工修正

适用场景

  • 科研人员快速生成论文中的示意图和流程图
  • 教育工作者制作教学用图表和幻灯片
  • 技术写作者将技术文档转化为可视化图表

替代项目

Matplotlib、Plotly、draw.io

项目介绍

paperbanana 是智能体领域的开源项目,由 llmsresearch 开发,是 2026 年新上线的项目。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,379)位列前 30%,在智能体分类中处于中上游。

近 42 天,它的 GitHub 星标从 2,232 增加到 2,379,净增 147。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:科研人员快速生成论文中的示意图和流程图。同类可对比的替代方案包括 Matplotlib、Plotly、draw.io。

上一篇:airunner

下一篇:cli

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 199 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12