NeMo-Retriever

把PDF里的表格图表图片都抽成大模型能用的数据

NeMo-Retriever 是英伟达开源的可扩展文档内容与元数据抽取微服务库,面向 RAG 和生成式应用的数据准备环节。它解决的核心问题是:企业文档(PDF、扫描件、图表混排)中大量非结构化信息难以被大模型直接利用,传统解析工具对表格、图表、图片和版面语义的处理能力有限。该项目通过调用 NVIDIA NIM 专用微服务,完成文档的查找、上下文关联与多模态抽取,输出可被下游生成式应用消费的文本、表格、图表和图像内容,并附带元数据。整体偏向高性能、可水平扩展的生产级部署,适合需要批量处理海量文档并接入向量库或检索管线的团队。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2985
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类搜索知识
开发团队NVIDIA
所属国家
定价模式free
价格说明开源库,免费使用,需自部署
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 2985
30天Star增速
HF 下载量
上线时间2024-08-22 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:高级 约 30 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 运行环境(项目为 Python 库,README 未给出具体版本要求)
  • 可访问的 NVIDIA NIM 微服务或所支持的模型(抽取流程依赖)
  • 如需集群化部署,需具备 Helm / Kubernetes 环境(README 提到 Helm chart)
  • 可访问 GitHub 与 NVIDIA 官方文档站点

安装与启动步骤

  1. 1确认使用分支

    README 说明默认 main 为活跃开发分支,可能领先于发布版;生产请用 26.08 分支(GA PyPI 与 Helm chart 版本 26.8.1),上一稳定线为 26.03。

  2. 2获取项目代码

    从 GitHub 克隆仓库。若用于生产,克隆后切换到 26.08 分支,避免使用开发中的 main 分支。

    git clone https://github.com/NVIDIA/NeMo-Retriever.git
  3. 3阅读官方文档

    README 未给出具体安装步骤,需按官方文档中的抽取(extraction)说明完成安装与配置后再运行。

  4. 4准备 NIM 或模型

    抽取流程依赖 NVIDIA NIM 微服务或 README 所述的其他受支持模型,需先将其部署并可被调用后再接入。

如何确认成功

README 未提供启动验证方式,请按官方文档 https://docs.nvidia.com/nemo/retriever/latest/extraction/overview/ 的步骤确认。

常见问题

Q:应该使用哪个分支?

A:默认 main 跟踪活跃开发,可能领先于发布版。生产环境请使用 26.08 分支(GA PyPI 与 Helm chart 版本 26.8.1),上一稳定线为 26.03。

Q:抽取能力依赖什么?

A:README 说明同时支持 NVIDIA NIM 微服务和多种模型,用于查找、上下文化并抽取文本、表格、图表和信息图。

Q:能并行处理文档吗?

A:可以。README 指出可将文档拆分到页级并行分类与抽取文本、表格、图表等,再经 OCR 上下文化并输出为 JSON schema。

Q:NeMo Retriever 和 NVIDIA Ingest 是同一个东西吗?

A:是。README 注明 NeMo Retriever extraction 在部分 NVIDIA 产品资料中也被称为 NVIDIA Ingest。

注意事项

  • 默认分支 main 为活跃开发分支,可能领先于最新支持版本,生产环境应改用 26.08 分支。
  • README 节选未包含具体安装与运行命令,请以 NVIDIA 官方文档为准,不要凭猜测执行 pip 或 helm 命令。
  • README 提到项目通过 PyPI 包与 Helm chart 发布,具体版本号以官方文档和发布页为准。

核心亮点

  • 支持表格、图表、图片等多模态内容抽取,不止纯文本解析
  • 基于 NVIDIA NIM 微服务架构,可水平扩展,适合批量文档处理
  • 输出带元数据,便于接入 RAG 检索和下游生成式应用

不足之处

  • 强依赖 NVIDIA NIM 微服务与相关生态,非 NVIDIA 环境部署成本较高
  • 项目相对较新,社区案例和第三方集成文档仍在积累中

适用场景

  • 企业海量 PDF 合同、财报的批量解析与入库
  • 构建 RAG 知识库时对含表格图表文档的高质量抽取
  • 金融、医疗等需要保留版面语义和元数据的文档处理管线

替代项目

Unstructured、Docling

项目介绍

NeMo-Retriever 是搜索知识领域的开源项目,由 NVIDIA 开发,2024 年首次发布。

在全站 13,821 个收录项目中,它的 GitHub 星标数(2,985)位列前 30%,在搜索知识分类的 644 个项目里位列前 14%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源库,免费使用,需自部署。

它主要面向的使用场景是:企业海量PDF合同、财报的批量解析与入库。同类可对比的替代方案包括 Unstructured、Docling。

上一篇:ai-resources

下一篇:awesome-ai-tools

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

Supercharge your AI agents with data from the web and beyond. Building the library f···

★ 189121 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 124327 2026-08-09
WeKnora 开源

文档往里一扔,自动变成啥都能答的知识库

Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an auto···

★ 32279 2026-08-09