attack_data 是数据集领域的开源项目,由 splunk 开发,2020 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(819)位列前 30%,在数据集分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。开源数据集,免费使用。
它主要面向的使用场景是:训练入侵检测或异常流量识别模型。同类可对比的替代方案包括 CIC-IDS2017、UNSW-NB15。

一站式获取多种攻击数据集,快速训练安全模型
attack_data 是一个汇集多种网络攻击行为数据集的仓库,主要面向安全研究、入侵检测和机器学习模型训练场景。它把来自不同来源的攻击流量、日志、样本等数据整理成统一结构,解决安全领域公开数据分散、格式不一、难以直接用于实验的问题。核心能力包括:提供多类攻击(如DDoS、暴力破解、Web攻击等)的原始数据或特征数据;附带数据说明和加载脚本,方便快速读取;支持研究者复现实验、对比算法效果。项目用 Python 编写,适合作为安全数据集入口,帮助初学者和工程师省去四处搜集清洗数据的时间。
CIC-IDS2017、UNSW-NB15
attack_data 是数据集领域的开源项目,由 splunk 开发,2020 年首次发布。
在全站 12,822 个收录项目中,它的 GitHub 星标数(819)位列前 30%,在数据集分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-19。开源数据集,免费使用。
它主要面向的使用场景是:训练入侵检测或异常流量识别模型。同类可对比的替代方案包括 CIC-IDS2017、UNSW-NB15。
上一篇:loghub
下一篇:cv-dataset
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models