tech.ml.dataset 是数据集领域的开源项目,由 techascent 开发,2019 年首次发布。
它收录于数据集分类,该分类目前共有 297 个项目,GitHub 星标数为 763。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。免费使用。
它主要面向的使用场景是:Clojure项目中的ETL数据清洗与转换。同类可对比的替代方案包括 Tablecloth、Pandas (Python)、Apache Spark (Scala)。

用 Clojure 快速处理大数据集,像 pandas 一样高效
tech.ml.dataset 是一个基于 Clojure 的高性能数据处理系统,专注于提供类似 Python pandas 的 DataFrame 功能,同时充分利用 JVM 生态。它解决了 Clojure 生态中缺乏高效、易用的结构化数据处理工具的问题,支持从 CSV、XLSX 等格式加载数据,进行列式操作、过滤、聚合、连接等常见数据清洗与转换任务,并内置了与机器学习库(如 Smile)的集成接口。其核心能力包括惰性加载、内存高效利用、并行处理以及友好的 Clojure 语法,使得数据处理流程简洁且性能优异。该项目早期已获得 757 星标,表明其受到一定关注,适合需要高性能数据处理的 Clojure 开发者。
本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整
—
Tablecloth、Pandas (Python)、Apache Spark (Scala)
tech.ml.dataset 是数据集领域的开源项目,由 techascent 开发,2019 年首次发布。
它收录于数据集分类,该分类目前共有 297 个项目,GitHub 星标数为 763。
项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。免费使用。
它主要面向的使用场景是:Clojure项目中的ETL数据清洗与转换。同类可对比的替代方案包括 Tablecloth、Pandas (Python)、Apache Spark (Scala)。
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···