gpt-rag-ingestion

把企业杂文档自动切块向量化,喂给 Azure 搜索做多模态 RAG

gpt-rag-ingestion 是微软 GPT-RAG 方案中的数据摄取服务,专门解决企业把杂乱文档喂给 Azure AI Search 前的清洗与向量化问题。它支持 PDF、图片、表格、会议转录和 SharePoint 等多种来源,自动完成文档解析、智能分块、文本与图像嵌入生成,并把结果写入搜索索引,从而支撑多模态检索增强生成(RAG)。核心能力包括:按语义而非固定长度切分内容,避免上下文割裂;同时生成文本和图片向量,让图表、扫描件也能被检索;与 Azure 生态(Azure AI Search、Azure OpenAI、Document Intelligence)深度集成,适合已有微软云资源的企业快速搭建知识库。项目用 Python 编写,以服务形式运行,可被上游编排层调用。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 188
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类搜索知识
开发团队Azure
所属国家
官网地址
定价模式free
价格说明开源免费,需自行部署至Azure
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型
GitHub 星标★ 188
30天Star增速
HF 下载量
上线时间2023-06-27 00:00:00
最近更新2026-09-25 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-01
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

使用教程

核心亮点

  • 同时生成文本与图像嵌入,扫描件、图表也能被检索到
  • 智能分块按语义切分,减少上下文断裂,提升召回质量
  • 原生对接 Azure AI Search、OpenAI 和 Document Intelligence,微软云用户接入成本低

不足之处

  • 强绑定 Azure 生态,非微软云环境迁移成本高
  • 项目星标较少,社区案例和第三方文档有限

适用场景

  • 企业把历史 PDF、Word、Excel 批量导入 Azure AI Search 建知识库
  • 会议转录与 SharePoint 文档自动同步,做内部问答机器人
  • 含图表和扫描件的技术手册做多模态检索增强生成

替代项目

unstructured、llama_index、haystack

项目介绍

gpt-rag-ingestion 是搜索知识领域的开源项目,由 Azure 开发,2023 年首次发布。

它收录于搜索知识分类,该分类目前共有 603 个项目,GitHub 星标数为 188。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-25。开源免费,需自行部署至Azure。

它主要面向的使用场景是:企业把历史PDF、Word、Excel批量导入AzureAISearch建知识库。同类可对比的替代方案包括 unstructured、llama_index、haystack。

上一篇:geo-seo-claude

下一篇:没有了!

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 186524 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 122390 2026-08-09
WeKnora 开源

文档往里一扔,自动变成啥都能答的知识库

Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an auto···

★ 31212 2026-08-09