FDAbench 是评测安全领域的开源项目,由 fdabench 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 82。
项目仍在小幅维护中,最近一次代码更新于 2026-09-08。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究机构对比不同数据智能体性能。同类可对比的替代方案包括 Spider、BIRD-SQL、DAX-Bench。

给数据智能体打分,看谁更会分析异构数据
FDABench 是一个用于评估数据智能体(Data Agents)在异构数据上执行分析查询能力的基准测试平台,源自 KDD'26 论文。它解决的核心问题是:当前数据分析和 AI 智能体在应对多源、异构数据(如数据库、表格、文档等)时缺乏统一、可量化的评估标准。FDABench 提供了一套标准化的任务集、评估指标和测试框架,能够自动生成分析查询,并衡量智能体在数据检索、推理、可视化生成等环节的表现。其核心能力包括:支持多种数据源接入、定义多维度评测指标、提供可复现的测试环境,以及集成主流 LLM(如 ChatGPT、LLaMA)作为智能体后端。该项目旨在推动数据智能体从原型走向可靠应用,为研究者和开发者提供客观的横向对比工具。
Spider、BIRD-SQL、DAX-Bench
FDAbench 是评测安全领域的开源项目,由 fdabench 开发,2025 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 82。
项目仍在小幅维护中,最近一次代码更新于 2026-09-08。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:研究机构对比不同数据智能体性能。同类可对比的替代方案包括 Spider、BIRD-SQL、DAX-Bench。
上一篇:VLMEvalKit
下一篇:AICompare
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···