tech.ml.dataset

用 Clojure 快速处理大数据集,像 pandas 一样高效

tech.ml.dataset 是一个基于 Clojure 的高性能数据处理系统,专注于提供类似 Python pandas 的 DataFrame 功能,同时充分利用 JVM 生态。它解决了 Clojure 生态中缺乏高效、易用的结构化数据处理工具的问题,支持从 CSV、XLSX 等格式加载数据,进行列式操作、过滤、聚合、连接等常见数据清洗与转换任务,并内置了与机器学习库(如 Smile)的集成接口。其核心能力包括惰性加载、内存高效利用、并行处理以及友好的 Clojure 语法,使得数据处理流程简洁且性能优异。该项目早期已获得 757 星标,表明其受到一定关注,适合需要高性能数据处理的 Clojure 开发者。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 757
维护状态 活跃
是否开源
定价模式 free

项目数据

分类数据集
开发团队techascent
所属国家
官网地址
定价模式free
价格说明开源项目,免费使用
访问状态
是否开源
开源协议EPL-1.0
主要语言Clojure
技术栈/模型clojure,csv,dataframe,datascience,dataset,etl-pipeline,java,machine-learning,xlsx
GitHub 星标★ 757
30天Star增速
HF 下载量
上线时间2019-02-14 00:00:00
最近更新2026-08-21 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-22
浏览次数0

核心亮点

  • 列式存储与惰性加载,内存占用低,适合处理超大数据集
  • API 设计贴近 Clojure 习惯,函数式风格,代码简洁
  • 原生支持 CSV、XLSX 等格式,并集成 Smile 机器学习库

不足之处

  • 文档和示例相对较少,新手入门门槛较高
  • 社区活跃度一般,更新频率可能不如主流数据处理框架

适用场景

  • Clojure 项目中的 ETL 数据清洗与转换
  • 需要高性能数据预处理的机器学习流水线
  • 在 JVM 环境中替代 pandas 进行数据分析

替代项目

Tablecloth、Pandas (Python)、Apache Spark (Scala)

项目介绍

tech.ml.dataset 是一个数据集领域的开源项目,官方简介:A Clojure high performance data processing system。项目使用 Clojure 开发,在 GitHub 上获得 757 星标。

上一篇:cryptoCMD

下一篇:没有了!

同类项目推荐

distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3376 2026-08-10
SynLogic 开源

大规模合成可验证推理数据,让模型逻辑更聪明

[NeurIPS 2025] The official repo of SynLogic: Synthesizing Verifiable Reasoning Data···

★ 204 2026-08-09
be_great 开源

用大模型生成以假乱真的表格数据,解决隐私和数据短缺问题。

A novel approach for synthesizing tabular data using pretrained large language model···

★ 365 2026-08-17
University1652-Baseline 开源

拿无人机图像定位全球建筑,跨视角检索基准一键跑通

ACM Multimedia2020 University-1652: A Multi-view Multi-source Benchmark for Drone-ba···

★ 673 2026-08-13