data-processing

本站收录 12 个带「data-processing」标签的 AI 开源项目

pathwayPathway 是一个用 Python 编写的开源 ETL 与流处理框架,核心定位是把批处理和流处理统一到同一套代码里。它解决的是传统数据管道中批与流两套系统割★ 62,215cocoindexcocoindex 是一个面向长时程智能体的增量计算引擎,用 Rust 编写。它解决的是智能体在长时间运行中需要持续感知和利用不断变化的数据(如代码库、文档、用★ 11,630DataFlowDataFlow 是一个面向大模型时代的数据准备框架,目标是让数据清洗、合成与加工像搭积木一样简单。它把数据处理的每个环节抽象成可复用的 Operator(算子★ 8,214data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105datachaindatachain 是一个面向非结构化数据的上下文层,它将存储在 S3、GCS、Azure Blob 等对象存储中的文件(如图片、视频、文档)抽象为类型化、版本★ 2,818texartexar 是一个基于 TensorFlow 的工具包,专注于机器学习、自然语言处理和文本生成任务,属于 CASL 项目的一部分。它旨在简化 NLP 模型的开发★ 2,389CuratorCurator 是一个面向大型语言模型(LLM)的可扩展数据预处理与清洗工具包。它旨在解决 LLM 训练和微调中数据质量参差不齐、处理流程繁琐低效的问题。Cur★ 1,788dolmaDolma 是 AI2 团队为 OLMo 系列模型开发的数据工具包,专注于预训练数据的生成与质量检查。它解决的核心问题是:大模型预训练数据规模庞大、来源混杂,难★ 1,549marvis-risk-agentMARVIS-Agent 是一个面向信用风险领域的全流程智能体,旨在帮助模型开发、验证、数据处理、特征工程和策略工作流。它解决的是信用风险建模过程中多步骤、多工★ 476haupthaupt 是 Polyaxon 生态中的一个基础设施组件,提供统一的 lineage 元数据 API、工件流、沙箱、API 和 spaces 能力。它主要解决★ 451fondantFondant 是一个面向生产环境的数据处理框架,旨在简化并共享大规模数据流水线的构建。它解决了机器学习项目中数据准备阶段繁琐、重复且难以协作的问题,提供了一套★ 359docwireDocWire SDK 是一个基于 C++20 的本地优先文档数据处理框架,主打确定性、可审计、可私有化部署的工作流。它解决的是企业或开发者在处理大量异构文档时★ 113