crackmes-re-dataset

4598个crackme带答案和混淆标签,逆向研究直接开跑

crackmes-re-dataset 是一个面向逆向工程研究的带标注数据集,覆盖 4598 个 crackme 样本。它把每个 crackme 的正确答案(flag)、验证脚本以及归一化后的混淆标签整理成结构化数据,解决逆向工程领域长期缺乏大规模、统一标注语料的问题。核心能力包括:提供可直接用于训练和评测的 flag 标签,方便自动化求解器验证;附带 verifier 脚本,可复现样本的校验逻辑;对混淆手段做归一化标签,让模型能按混淆类型做细粒度分析。项目用 Python 组织,便于加载、过滤和扩展。适合做程序分析、二进制逆向、自动化求解、大模型代码推理等方向的研究者,用来构建基线、对比算法或做消融实验。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 140
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队crackmesone
所属国家
官网地址
定价模式free
价格说明开源数据集,免费使用
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 140
30天Star增速
HF 下载量
上线时间2026-07-11 00:00:00
最近更新2026-09-20 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-21
浏览次数0

使用教程

核心亮点

  • 提供4598个样本的flag与verifier脚本,可直接用于自动化求解评测
  • 对混淆手段做归一化标签,支持按混淆类型做细粒度分析和模型训练
  • 用Python组织数据,加载过滤方便,适合快速搭建逆向研究基线

不足之处

  • 样本以crackme为主,真实商业软件与恶意样本覆盖有限
  • 标注质量与标签体系依赖作者定义,缺少第三方交叉验证说明

适用场景

  • 训练和评测自动化逆向求解模型
  • 研究混淆手段对程序分析算法的影响
  • 作为二进制代码推理或大模型逆向能力的基准数据集

替代项目

Reveal、MalwareBazaar

项目介绍

crackmes-re-dataset 是数据集领域的开源项目,由 crackmesone 开发,是 2026 年新上线的项目。

它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 140。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源数据集,免费使用。

它主要面向的使用场景是:训练和评测自动化逆向求解模型。同类可对比的替代方案包括 Reveal、MalwareBazaar。

上一篇:nepali-datasets

下一篇:marcap

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10496 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1643 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3395 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09