DataMate 是模型训练领域的开源项目,由 ModelEngine-Group 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 368。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-08-28。MIT许可证,可免费使用和部署。
它主要面向的使用场景是:企业构建领域专属大模型,需要整理清洗大量业务文档。同类可对比的替代方案包括 Label Studio、Doccano、Argilla。

一站式搞定大模型微调与RAG的数据处理,让数据准备不再拖后腿
DataMate 是一个面向企业级数据处理的开源平台,专注于大模型微调和 RAG(检索增强生成)场景。它解决了企业在准备高质量训练数据时面临的效率低下、流程分散和缺乏协作的问题。DataMate 提供了一套完整的数据处理流水线,包括数据导入、清洗、标注、版本管理和导出等功能,支持从原始数据到最终可用于模型训练或检索的格式化数据集的全流程管理。其核心能力包括灵活的标注工具、自动化的数据清洗规则、与主流模型训练框架的集成,以及团队协作和权限管理功能。通过可视化的操作界面和 API 接口,DataMate 旨在降低数据工程的门槛,帮助团队更高效地构建和维护高质量的领域数据集,从而提升模型微调的效果和 RAG 系统的检索准确性。
Label Studio、Doccano、Argilla
DataMate 是模型训练领域的开源项目,由 ModelEngine-Group 开发,2025 年首次发布。
它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 368。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-08-28。MIT许可证,可免费使用和部署。
它主要面向的使用场景是:企业构建领域专属大模型,需要整理清洗大量业务文档。同类可对比的替代方案包括 Label Studio、Doccano、Argilla。
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···