NeMo-Retriever 是搜索知识领域的开源项目,由 NVIDIA 开发,2024 年首次发布。
在全站 13,821 个收录项目中,它的 GitHub 星标数(2,985)位列前 30%,在搜索知识分类的 644 个项目里位列前 14%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源库,免费使用,需自部署。
它主要面向的使用场景是:企业海量PDF合同、财报的批量解析与入库。同类可对比的替代方案包括 Unstructured、Docling。

把PDF里的表格图表图片都抽成大模型能用的数据
NeMo-Retriever 是英伟达开源的可扩展文档内容与元数据抽取微服务库,面向 RAG 和生成式应用的数据准备环节。它解决的核心问题是:企业文档(PDF、扫描件、图表混排)中大量非结构化信息难以被大模型直接利用,传统解析工具对表格、图表、图片和版面语义的处理能力有限。该项目通过调用 NVIDIA NIM 专用微服务,完成文档的查找、上下文关联与多模态抽取,输出可被下游生成式应用消费的文本、表格、图表和图像内容,并附带元数据。整体偏向高性能、可水平扩展的生产级部署,适合需要批量处理海量文档并接入向量库或检索管线的团队。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
1确认使用分支
README 说明默认 main 为活跃开发分支,可能领先于发布版;生产请用 26.08 分支(GA PyPI 与 Helm chart 版本 26.8.1),上一稳定线为 26.03。
2获取项目代码
从 GitHub 克隆仓库。若用于生产,克隆后切换到 26.08 分支,避免使用开发中的 main 分支。
git clone https://github.com/NVIDIA/NeMo-Retriever.git3阅读官方文档
README 未给出具体安装步骤,需按官方文档中的抽取(extraction)说明完成安装与配置后再运行。
4准备 NIM 或模型
抽取流程依赖 NVIDIA NIM 微服务或 README 所述的其他受支持模型,需先将其部署并可被调用后再接入。
README 未提供启动验证方式,请按官方文档 https://docs.nvidia.com/nemo/retriever/latest/extraction/overview/ 的步骤确认。
Q:应该使用哪个分支?
A:默认 main 跟踪活跃开发,可能领先于发布版。生产环境请使用 26.08 分支(GA PyPI 与 Helm chart 版本 26.8.1),上一稳定线为 26.03。
Q:抽取能力依赖什么?
A:README 说明同时支持 NVIDIA NIM 微服务和多种模型,用于查找、上下文化并抽取文本、表格、图表和信息图。
Q:能并行处理文档吗?
A:可以。README 指出可将文档拆分到页级并行分类与抽取文本、表格、图表等,再经 OCR 上下文化并输出为 JSON schema。
Q:NeMo Retriever 和 NVIDIA Ingest 是同一个东西吗?
A:是。README 注明 NeMo Retriever extraction 在部分 NVIDIA 产品资料中也被称为 NVIDIA Ingest。
Unstructured、Docling
NeMo-Retriever 是搜索知识领域的开源项目,由 NVIDIA 开发,2024 年首次发布。
在全站 13,821 个收录项目中,它的 GitHub 星标数(2,985)位列前 30%,在搜索知识分类的 644 个项目里位列前 14%。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源库,免费使用,需自部署。
它主要面向的使用场景是:企业海量PDF合同、财报的批量解析与入库。同类可对比的替代方案包括 Unstructured、Docling。
上一篇:ai-resources
下一篇:awesome-ai-tools
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
Supercharge your AI agents with data from the web and beyond. Building the library f···
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
WeKnora
开源
文档往里一扔,自动变成啥都能答的知识库
Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an auto···