rust-repos 是数据集领域的开源项目,由 rust-lang 开发,2018 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 142。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源数据集,免费使用。
它主要面向的使用场景是:训练或评测Rust代码大模型时构建语料库。同类可对比的替代方案包括 The Stack、CodeSearchNet。

一站式收集 Rust 仓库源码,省去逐个抓取的麻烦
rust-repos 是一个面向 Rust 生态的源代码仓库数据集项目,主要用途是批量收集、整理和提供 Rust 语言开源仓库的源码与元数据,方便研究者、工具开发者进行代码分析、模型训练或仓库挖掘。它解决的核心问题是:Rust 代码语料分散、缺乏统一入口,想做大样本静态分析、代码搜索、机器学习训练或仓库健康度研究时,需要自己逐个抓取和清洗仓库。项目以 Rust 语言实现,属于 rust-infra 工具链方向,当前星标约 142,处于早期阶段。核心能力包括仓库清单组织、源码数据聚合,以及为下游分析任务提供可复用的数据基础。适合作为 Rust 代码智能、依赖分析、代码克隆检测等方向的底层数据来源。
The Stack、CodeSearchNet
rust-repos 是数据集领域的开源项目,由 rust-lang 开发,2018 年首次发布。
它收录于数据集分类,该分类目前共有 278 个项目,GitHub 星标数为 142。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。开源数据集,免费使用。
它主要面向的使用场景是:训练或评测Rust代码大模型时构建语料库。同类可对比的替代方案包括 The Stack、CodeSearchNet。
上一篇:VPSCI-Dataset
下一篇:RoboVerse
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models