VibeSearchBench

专治搜索系统'听不懂人话',用200个模糊任务测出真实力

VibeSearchBench 是一个面向真实世界复杂搜索场景的基准测试集,旨在评估和推动搜索系统在模糊、多轮、主动式交互中的表现。它包含200个长时程任务,每个任务都模拟了用户带着模糊意图、需要多轮对话澄清、并期望系统主动引导的搜索过程。项目采用人物角色驱动的渐进式信息揭示方式,使测试更贴近真实用户行为。其核心创新在于使用可验证的、无模式的知识图谱评估方法,通过三元组F1分数客观衡量搜索结果的相关性和完整性,避免了传统基准测试中主观评分和简单字符串匹配的局限性。该基准旨在解决现有搜索基准(如BEIR)任务定义明确、单轮、被动响应,无法反映真实搜索中信息需求逐步明确和交互式探索的问题,为下一代搜索系统(如基于大语言模型的搜索代理)提供更严苛和全面的评测标准。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 410
维护状态 低维护
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队VibeBench
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型agentic-ai,benchmark,llm,proactive-agent,search,search-agent
GitHub 星标★ 410
30天Star增速
HF 下载量
上线时间2026-05-20 00:00:00
最近更新2026-09-15 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 任务设计贴近真实:模糊意图+多轮对话+主动引导,考验系统交互能力
  • 评估客观可验证:基于知识图谱三元组F1,避免主观评分,结果可复现
  • 覆盖长时程任务:200个任务,适合评测长期记忆和上下文管理能力

不足之处

  • 项目处于早期阶段,文档和社区支持有待完善
  • 基准测试集规模有限(200任务),可能无法覆盖所有搜索场景

适用场景

  • 评测大语言模型搜索代理的交互式搜索能力
  • 研究模糊查询下的用户意图理解和澄清策略
  • 对比不同搜索系统在复杂任务上的性能差异

替代项目

BEIR、MS MARCO、TREC CAR

项目介绍

VibeSearchBench 是评测安全领域的开源项目,由 VibeBench 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 456 个项目,GitHub 星标数为 410。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-15。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:评测大语言模型搜索代理的交互式搜索能力。同类可对比的替代方案包括 BEIR、MS MARCO、TREC CAR。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24