data-pipelines
本站收录 18 个带「data-pipelines」标签的 AI 开源项目
pathwayPathway 是一个用 Python 编写的开源 ETL 与流处理框架,核心定位是把批处理和流处理统一到同一套代码里。它解决的是传统数据管道中批与流两套系统割★ 62,215
airflowApache 基金会旗下的工作流编排平台,支持以代码方式(Python)编程式地定义、调度与监控数据管道。凭借丰富的算子生态、可靠的调度机制和活跃的社区,Air★ 47,011
dagsterDagster 是一个面向数据资产的开源编排平台,专注于数据开发、生产和观测的全流程管理。它解决了传统数据管道工具在开发、部署和监控中割裂的问题,提供统一的开发★ 16,222
unstructuredUnstructured 是一个开源的 ETL 工具,专注于将复杂文档(如 PDF、Word、PPT、图片等)转换为干净、结构化的数据,以便直接用于大语言模型(★ 15,519
kedro面向生产级数据科学项目的工具箱,将软件工程最佳实践引入数据流水线开发,让管道具备可复现、可维护、模块化的特性。它提供了统一的项目结构、数据目录管理与管道抽象,帮★ 11,012
DataFlowDataFlow 是一个面向大模型时代的数据准备框架,目标是让数据清洗、合成与加工像搭积木一样简单。它把数据处理的每个环节抽象成可复用的 Operator(算子★ 8,214
preswaldPreswald 是一个面向 Python 交互式数据应用的 WASM 打包工具。它解决的核心问题是:传统数据应用(如仪表盘、报告)依赖服务器或 Python ★ 4,268
docetlDocETL 是一个面向智能体 LLM 的数据处理与 ETL 系统。它解决传统 ETL 管道无法灵活处理非结构化数据(如文本、日志、文档)的痛点,将大语言模型作★ 4,110
maestroMaestro 是 Netflix 开源的工作流编排器,用于管理和调度数据管道及机器学习工作流。它解决了大规模工作流编排中常见的依赖复杂、资源利用率低、运维困难★ 3,842
extractousextractous 是一个用 Rust 编写的高性能非结构化数据提取库,旨在解决从 PDF、Word、HTML、图片等各类文件中快速提取文本和元数据的问题。它★ 1,780
mlops-python-packagemlops-python-package 是一个用于快速启动和标准化 MLOps 项目及数据管道的 Python 包模板。它解决了 MLOps 项目从零搭建时缺★ 1,418
agentsagents 是一个面向数据工程工作流的 AI 智能体工具库,用 Python 编写。它旨在将大语言模型(LLM)与数据管道(如 Airflow、dbt)结合,★ 448
awesome-kubeflowawesome-kubeflow 是一个精选资源列表,汇集了与 Kubeflow 相关的优秀项目、工具、教程和文档。Kubeflow 是 CNCF 孵化项目,旨★ 230
duddud 是一个用 Go 编写的轻量级命令行工具,旨在将数据版本管理与源代码版本控制(如 Git)相结合,并支持构建数据管道。它解决了数据科学家和工程师在项目中追★ 220
flowcraftflowcraft 是一个轻量级的工作流引擎,专为智能体(Agent)和 LLM 编排设计。它用 TypeScript 编写,采用声明式 DAG(有向无环图)模★ 210
runtimeRuntime 是一个用于构建和管理 AI 代理(Agent)与工作流(Workflow)的运行时基础设施,基于 Python 实现。它旨在解决 AI 应用从原★ 202
beneathBeneath 是一个基于 Go 语言构建的无服务器实时数据平台,旨在简化数据管道的搭建与运维。它解决了传统数据基础设施中服务器管理、扩展性和实时处理复杂的问题★ 84
xvcxvc 是一个用 Rust 编写的 MLOps 工具,专注于数据版本管理和流水线管理。它解决了机器学习项目中数据文件、模型和实验管线的版本控制与可复现性问题,提★ 77