bergen 是评测安全领域的开源项目,由 naver 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 281。
项目仍在小幅维护中,最近一次代码更新于 2026-09-01。开源库,本地部署,完全免费。
它主要面向的使用场景是:对比不同向量数据库在RAG中的检索效果。同类可对比的替代方案包括 RAGAS、TruLens、LlamaIndex。

给RAG系统做体检,量化对比谁更强
bergen 是一个专注于 RAG(检索增强生成)系统的基准测试库。它解决了 RAG 应用开发中缺乏标准化评估工具的问题,提供了一套统一的测试框架和指标,帮助开发者量化比较不同 RAG 管线的性能。其核心能力包括:支持多种检索器和生成器组合、提供预置的测试数据集、自动计算召回率、准确率等关键指标,并生成可视化报告。通过 bergen,开发者可以快速定位 RAG 系统中的瓶颈,优化检索策略和提示词设计,从而提升整体回答质量。项目目前处于早期阶段,代码以 Jupyter Notebook 为主,适合研究者和工程师用于实验对比。
RAGAS、TruLens、LlamaIndex
bergen 是评测安全领域的开源项目,由 naver 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 281。
项目仍在小幅维护中,最近一次代码更新于 2026-09-01。开源库,本地部署,完全免费。
它主要面向的使用场景是:对比不同向量数据库在RAG中的检索效果。同类可对比的替代方案包括 RAGAS、TruLens、LlamaIndex。
上一篇:vidore-benchmark
下一篇:LLMVault
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···