VisRAG

不解析文档,直接看图检索,提升 RAG 准确率

VisRAG 是一个基于视觉语言模型(VLM)的解析免检索增强生成(RAG)框架。传统 RAG 依赖文本解析(如 PDF 转文本),而 VisRAG 直接将文档页面渲染为图像,利用 VLM 同时理解视觉和文本信息,避免了解析过程中的信息丢失。它解决了解析复杂文档(如表格、图表、多栏排版)时准确率低的问题,核心能力包括文档图像嵌入、基于视觉的检索和生成。项目提供训练和推理代码,支持自定义模型,旨在提升 RAG 在真实文档上的鲁棒性和性能。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 981
维护状态 维护中
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队OpenBMB
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型document-retrieval,document-understanding,multi-modal,multi-modality,rag,retrieval,retrieval-augmented-generation,vision-language-model
GitHub 星标★ 981
30天Star增速
HF 下载量
上线时间2024-10-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

使用教程

核心亮点

  • 免解析流程,避免 PDF 转文本时的信息丢失,尤其适合复杂排版
  • 利用 VLM 统一视觉和文本语义,检索相关性更高
  • 提供完整训练和推理代码,便于复现和二次开发

不足之处

  • 依赖 VLM 推理,计算资源消耗大,部署成本高
  • 文档/社区待观察,早期项目示例和生态尚不完善

适用场景

  • 学术论文、技术文档等复杂 PDF 的知识库问答
  • 扫描件、图片型文档的检索增强生成
  • 需要高保真理解表格、图表的垂直领域 RAG 应用

替代项目

LlamaIndex、LangChain、Unstructured

项目介绍

VisRAG 是搜索知识领域的开源项目,由 OpenBMB 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(981)位列前 30%,在搜索知识分类中处于中上游。

项目仍在小幅维护中,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:学术论文、技术文档等复杂PDF的知识库问答。同类可对比的替代方案包括 LlamaIndex、LangChain、Unstructured。

上一篇:GraphRAG-SDK

下一篇:vectordb-recipes

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09