hyde

让LLM生成假设文档,零样本提升检索精度

HyDE(Hypothetical Document Embeddings)是一种零样本稠密检索技术,通过让大语言模型生成与查询相关的假设文档,再对假设文档进行嵌入,从而在不依赖标注数据的情况下提升检索精度。它解决了传统稠密检索需要大量相关性标注数据的问题,核心能力是利用LLM的生成能力将查询转换为更丰富的文档表示,适用于开放域问答、信息检索等场景。项目以Jupyter Notebook形式提供实现和示例,便于理解和复现。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 583
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队texttron
所属国家
官网地址
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Jupyter Notebook
技术栈/模型dense-retrieval,large-language-models,zeroshot
GitHub 星标★ 583
30天Star增速
HF 下载量
上线时间2022-12-19 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 无需标注数据,利用LLM生成假设文档实现零样本稠密检索
  • 在多个基准上显著提升检索性能,如BeIR数据集
  • 实现简洁,Notebook形式易于上手和实验

不足之处

  • 依赖LLM生成质量,生成成本较高
  • 文档/社区待观察,项目早期,示例和文档有限

适用场景

  • 开放域问答中的文档检索
  • 无标注数据场景下的信息检索
  • 快速原型验证检索增强生成(RAG)

替代项目

ANCE、DPR、GPL

项目介绍

hyde 是搜索知识领域的开源项目,由 texttron 开发,2022 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 583。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。无在线服务,需自行部署,完全免费。

它主要面向的使用场景是:开放域问答中的文档检索。同类可对比的替代方案包括 ANCE、DPR、GPL。

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09