tech.ml.dataset

用 Clojure 快速处理大数据集,像 pandas 一样高效

tech.ml.dataset 是一个基于 Clojure 的高性能数据处理系统,专注于提供类似 Python pandas 的 DataFrame 功能,同时充分利用 JVM 生态。它解决了 Clojure 生态中缺乏高效、易用的结构化数据处理工具的问题,支持从 CSV、XLSX 等格式加载数据,进行列式操作、过滤、聚合、连接等常见数据清洗与转换任务,并内置了与机器学习库(如 Smile)的集成接口。其核心能力包括惰性加载、内存高效利用、并行处理以及友好的 Clojure 语法,使得数据处理流程简洁且性能优异。该项目早期已获得 757 星标,表明其受到一定关注,适合需要高性能数据处理的 Clojure 开发者。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 763
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类数据集
开发团队techascent
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源是
开源协议EPL-1.0
主要语言Clojure
技术栈/模型clojure,csv,dataframe,datascience,dataset,etl-pipeline,java,machine-learning,xlsx
GitHub 星标★ 763
30天Star增速
HF 下载量
上线时间2019-02-14 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-22
浏览次数8

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

核心亮点

  • 列式存储与惰性加载,内存占用低,适合处理超大数据集
  • API 设计贴近 Clojure 习惯,函数式风格,代码简洁
  • 原生支持 CSV、XLSX 等格式,并集成 Smile 机器学习库

不足之处

  • 文档和示例相对较少,新手入门门槛较高
  • 社区活跃度一般,更新频率可能不如主流数据处理框架

适用场景

  • Clojure 项目中的 ETL 数据清洗与转换
  • 需要高性能数据预处理的机器学习流水线
  • 在 JVM 环境中替代 pandas 进行数据分析

替代项目

Tablecloth、Pandas (Python)、Apache Spark (Scala)

项目介绍

tech.ml.dataset 是数据集领域的开源项目,由 techascent 开发,2019 年首次发布。

它收录于数据集分类,该分类目前共有 297 个项目,GitHub 星标数为 763。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-02。免费使用。

它主要面向的使用场景是:Clojure项目中的ETL数据清洗与转换。同类可对比的替代方案包括 Tablecloth、Pandas (Python)、Apache Spark (Scala)。

上一篇:cryptoCMD

下一篇:fastdup

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10597 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1648 2026-09-20
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3408 2026-08-10