DataMate

一站式搞定大模型微调与RAG的数据处理,让数据准备不再拖后腿

DataMate 是一个面向企业级数据处理的开源平台,专注于大模型微调和 RAG(检索增强生成)场景。它解决了企业在准备高质量训练数据时面临的效率低下、流程分散和缺乏协作的问题。DataMate 提供了一套完整的数据处理流水线,包括数据导入、清洗、标注、版本管理和导出等功能,支持从原始数据到最终可用于模型训练或检索的格式化数据集的全流程管理。其核心能力包括灵活的标注工具、自动化的数据清洗规则、与主流模型训练框架的集成,以及团队协作和权限管理功能。通过可视化的操作界面和 API 接口,DataMate 旨在降低数据工程的门槛,帮助团队更高效地构建和维护高质量的领域数据集,从而提升模型微调的效果和 RAG 系统的检索准确性。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 368
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队ModelEngine-Group
所属国家
定价模式free
价格说明开源项目,MIT许可证,可免费使用和部署。
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型data-evaluation,data-pipeline,data-synthesis,rag
GitHub 星标★ 368
30天Star增速
HF 下载量
上线时间2025-08-11 00:00:00
最近更新2026-08-28 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 专为微调和RAG场景设计,数据流水线功能针对性强,避免通用工具的冗余
  • 提供可视化标注和清洗界面,降低非技术人员的参与门槛
  • 支持团队协作与权限管理,适合企业级多角色协同工作

不足之处

  • 项目早期,文档和社区生态尚待完善,上手可能需要摸索
  • 功能范围聚焦数据处理,不包含模型训练和评估环节,需搭配其他工具

适用场景

  • 企业构建领域专属大模型,需要整理清洗大量业务文档
  • 团队为RAG系统准备高质量知识库,需对文档进行切分、标注和版本管理
  • 数据标注外包或内部协作,需要统一管理标注任务和质量控制

替代项目

Label Studio、Doccano、Argilla

项目介绍

DataMate 是模型训练领域的开源项目,由 ModelEngine-Group 开发,2025 年首次发布。

它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 368。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-08-28。MIT许可证,可免费使用和部署。

它主要面向的使用场景是:企业构建领域专属大模型,需要整理清洗大量业务文档。同类可对比的替代方案包括 Label Studio、Doccano、Argilla。

上一篇:AnglE

下一篇:Graph-CoT

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13