beir

一个平台,跑遍15+检索数据集,看清模型真实力。

BEIR是一个异构信息检索基准测试平台,旨在解决IR模型评估碎片化的问题。它整合了超过15个多样化的检索数据集,覆盖问答、生物医学、金融、法律等多个领域,并提供统一的评估协议和易于使用的API。研究者可以轻松地在同一框架下测试和对比不同检索模型(如BM25、密集检索、重排序模型等)的性能,从而获得更全面、更具泛化性的模型能力评估。其核心价值在于标准化评估流程,促进检索模型的公平比较与迭代。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2295
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队beir-cellar
所属国家
官网地址http://beir.ai
定价模式free
价格说明开源基准测试工具,完全免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型benchmark,bert,colbert,dataset,deep-learning,dpr,elasticsearch,information-retrieval,llm,nlp,passage-retrieval,pytorch,question-generation,rag,retrieval,retrieval-models,sbert,sentence-transformers,zero-shot-retrieval
GitHub 星标★ 2295
30天Star增速
HF 下载量
上线时间2021-01-18 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 7 步

环境要求

  • Python 3.9 及以上版本(README 明确说明 Tested with python versions 3.9+)
  • pip 包管理工具
  • 如需使用 encode_and_retrieve() 密集检索,需额外安装 faiss-cpu
  • 如需 LoRA + vLLM 示例,需额外安装 peft、accelerate、vllm
  • 如需调用 Cohere 等外部 API 示例,需安装 cohere 并自备 API Key

安装与启动步骤

  1. 1检查 Python 版本

    BEIR 官方仅在 Python 3.9 及以上版本测试通过,先确认本机版本满足要求,建议在虚拟环境中安装。

    python --version
  2. 2pip 安装 BEIR

    最简安装方式,直接从 PyPI 拉取 beir 包,适合只想调用 API 的普通用户。

    pip install beir
  3. 3源码安装(可选)

    需要改动源码或跟进最新提交时使用;-e 为可编辑安装,clone 下来的目录名即 beir。

    git clone https://github.com/beir-cellar/beir.git
    cd beir
    pip install -e .
  4. 4安装 faiss 依赖(可选)

    仅在使用 encode_and_retrieve() 做密集检索时需要,README 指定安装 CPU 版 faiss。

    pip install faiss-cpu
  5. 5安装 LoRA/vLLM 依赖(可选)

    README 的 LoRA & vLLM 快速示例要求先装这三个包,用于大模型检索与重排序场景。

    pip install peft
    pip install accelerate
    pip install vllm
  6. 6安装 Cohere API 依赖(可选)

    调用 Cohere 等外部 API 的示例需要该 SDK,同样建议配合 faiss-cpu 使用。

    pip install cohere
  7. 7查阅官方快速开始文档

    README 的代码片段被截断,未给出可直接执行的完整脚本,请按 Quick Start 链接访问官方 Wiki 获取教程。

关键配置

配置项必填说明示例
results_dir否保存评估结果与 runfile 的输出目录,示例中建于脚本同级 results 目录os.path.join(pathlib.Path(__file__).parent.absolute(), "resu

如何确认成功

执行 pip show beir 能看到包版本信息,或在 Python 中 import beir 不报 ModuleNotFoundError,即表示安装成功。

常见问题

Q:安装完 beir 后 import 报错怎么办?

A:先确认 Python 版本为 3.9 及以上,并检查是否装在同一虚拟环境中;建议使用 venv 或 conda 新建环境后重新 pip install beir。

Q:运行 encode_and_retrieve() 提示缺少 faiss 怎么办?

A:README 说明该函数依赖 faiss,执行 pip install faiss-cpu 安装 CPU 版即可。

Q:想用 LoRA 或 vLLM 做检索怎么办?

A:按 README 先执行 pip install peft、pip install accelerate、pip install vllm 三个命令,再参考官方 Wiki 的对应示例。

Q:README 里的示例代码不完整怎么跑?

A:README 节选中的代码块被截断,请访问 Quick Start 中的 Installing BEIR 与 Examples and tutorials 两个 Wiki 链接获取完整示例。

注意事项

  • BEIR 是 Python 库而非独立服务,安装后按需在脚本中 import 调用即可。
  • 官方明确测试的 Python 版本为 3.9+,低版本可能出现兼容问题。
  • faiss-cpu、peft、accelerate、vllm、cohere 均为按功能选装的可选依赖,不装也能使用基础检索评估功能。
  • 本节选未提供端口、路径、模型名等具体参数,请以官方 Wiki 与 Hugging Face 页面为准。

核心亮点

  • 覆盖15+个跨领域检索数据集,评估结果更全面,避免单一数据集上的过拟合判断。
  • 提供统一且易用的Python接口,几行代码即可完成多数据集评估,上手门槛低。
  • 支持稀疏、密集、重排序等多种检索范式,方便横向对比不同技术路线。

不足之处

  • 数据集规模相对较小,可能无法完全反映大规模真实场景的检索性能。
  • 文档/社区待观察,部分数据集的预处理细节需自行查阅原始论文。

适用场景

  • 学术研究:对比新提出的检索模型与基线模型的综合性能。
  • 工业选型:在统一基准上评估不同检索方案,辅助技术决策。
  • 教学实验:作为信息检索课程的标准化评估工具,便于学生实践。

替代项目

MS MARCO、TREC CAR、LoTTE

项目介绍

beir 是评测安全领域的开源项目,由 beir-cellar 开发,2021 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,295)位列前 30%,在评测安全分类的 466 个项目里位列前 11%。

近 42 天,它的 GitHub 星标从 2,269 增加到 2,295,净增 26。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。开源基准测试工具,完全免费,无付费版本。

它主要面向的使用场景是:学术研究:对比新提出的检索模型与基线模型的综合性能。同类可对比的替代方案包括 MS MARCO、TREC CAR、LoTTE。

上一篇:evalscope

下一篇:continuous-eval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12