
benchmark-radar
一站追踪全球 AI 评测基准,每日更新可溯源
benchmark-radar 是一个面向 AI 评测领域的数据聚合工具,它从 37 个公开来源持续抓取并整理超过 11,923 条与 AI benchmark、评测方法、数据集和数据质量相关的记录,为研究者和工程师提供统一的检索入口。项目解决的核心问题是:AI 评测信息高度分散在论文、榜单、GitHub 仓库和社区帖子中,人工追踪成本极高,且容易遗漏新发布的基准。它通过每日更新机制和证据链接,把每条记录与其原始出处关联起来,方便用户快速核实和溯源。核心能力包括多源采集、结构化归类、关键词检索以及按时间追踪新增评测。适合需要持续跟进 LLM/Agent 评测动态、选型对比基准或做评测综述的团队使用。
项目数据
使用教程
核心亮点
- 聚合 37 个公开来源、超 1.1 万条评测记录,覆盖面广
- 每条记录附带原始证据链接,便于溯源核实
- 每日自动更新,能较快反映新发布的 benchmark
不足之处
- 项目处于早期,星标数较少,社区生态和长期维护待观察
- 以数据聚合为主,缺少对评测质量或适用性的深度分析
适用场景
- 调研 LLM/Agent 评测基准时快速检索候选榜单
- 撰写评测综述或竞品分析时批量导出基准清单
- 持续监控新发布的 AI 评测数据集和评测方法
替代项目
Papers with Code、Hugging Face Datasets、OpenCompass
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents