data-engineering
本站收录 50 个带「data-engineering」标签的 AI 开源项目
Made-With-ML一套面向生产级机器学习应用的完整学习课程,手把手教你如何开发、部署并持续迭代 ML 应用。内容覆盖从实验到上线的全流程实践,配有代码示例,适合希望系统掌握工程化★ 49,652
airflowApache 基金会旗下的工作流编排平台,支持以代码方式(Python)编程式地定义、调度与监控数据管道。凭借丰富的算子生态、可靠的调度机制和活跃的社区,Air★ 47,011
kestraKestra 是一个面向关键任务应用的事件驱动编排与调度平台。它解决了复杂工作流中数据管道、任务调度和自动化流程难以统一管理的问题。核心能力包括:基于 YAML★ 28,501
airbyteAirbyte 是一个开源数据集成平台,专注于 ELT 管道和 AI 应用的数据搬运。它解决的核心问题是:企业数据散落在 API、数据库、文件等数百种来源中,要★ 22,140
taipy让数据与 AI 算法快速变成生产级 Web 应用的开源框架。开发者只需少量 Python 代码,就能把数据处理、模型推理和可视化界面整合成可交互的应用程序,同时★ 19,439
argo-workflows运行在 Kubernetes 之上的容器原生工作流引擎,以 CRD 方式定义 DAG 任务编排,天然适配云原生环境。它支持并行任务、参数化模板、工件传递与定时触★ 17,011
dagsterDagster 是一个面向数据资产的开源编排平台,专注于数据开发、生产和观测的全流程管理。它解决了传统数据管道工具在开发、部署和监控中割裂的问题,提供统一的开发★ 16,222
semantica以图为核心的 AI 基础设施,致力于为上下文管理与可问责 AI 系统提供支撑。通过知识图谱表达实体关系与上下文,为智能体提供结构化、可追溯的推理依据,在需要透明★ 13,540
great_expectationsGreat Expectations 是一个开源的数据质量工具,帮助数据团队定义、验证和文档化数据的期望。它解决了数据管道中数据质量不可控的问题,通过声明式的期★ 11,851
cocoindexcocoindex 是一个面向长时程智能体的增量计算引擎,用 Rust 编写。它解决的是智能体在长时间运行中需要持续感知和利用不断变化的数据(如代码库、文档、用★ 11,630
feastFeast 是一个开源的 Feature Store(特征仓库),专为 AI/ML 场景设计,旨在解决机器学习模型开发与部署中特征管理混乱、训练与在线推理特征不★ 7,314
unstractunstract 是一个基于大语言模型(LLM)的智能数据提取平台,专门用于从非结构化文档(如 PDF、图片、扫描件)中自动抽取结构化数据,并以 JSON 格式★ 7,266
DeepAnalyzeDeepAnalyze 是一个基于 Agent 架构的自主数据科学分析工具,定位为你的 AI 数据分析师。它能够自动处理大规模数据集,完成从数据清洗、探索性分析★ 4,663
Data-Science-Roadmap这是一个面向数据科学学习者的从零到一路线图,覆盖数据分析、数据工程、机器学习、深度学习、大数据、数据可视化等核心领域,并提供面试准备、简历模板和速查表等实用资源★ 4,380
maestroMaestro 是 Netflix 开源的工作流编排器,用于管理和调度数据管道及机器学习工作流。它解决了大规模工作流编排中常见的依赖复杂、资源利用率低、运维困难★ 3,842
ploomberPloomber 是一个用于构建数据管道的 Python 框架,旨在加速从开发到部署的整个流程。它解决了数据工程中常见的迭代速度慢、环境切换复杂、部署困难等问题★ 3,620
mlops-course这是一个面向生产级机器学习应用的教学课程仓库,旨在帮助开发者掌握从设计、开发、部署到迭代的完整MLOps流程。课程内容涵盖数据版本管理、模型实验追踪、CI/CD★ 3,405
second-brain-ai-assistant-course这是一个教你构建“第二大脑”AI助手的开源课程项目,基于Jupyter Notebook编写。它系统性地讲解如何利用大语言模型(LLMs)、智能体(Agents★ 3,099
hamiltonHamilton 是一个帮助数据科学家和工程师定义可测试、模块化、自文档化数据流的开源框架。它通过纯 Python 函数声明数据转换逻辑,自动构建数据流图,并生★ 2,601
SAGSAG 是一个全新的 RAG(检索增强生成)检索架构,旨在解决传统 RAG 在知识检索中的准确性和效率问题。它提供了一种原创的检索架构,并附带一个面向人类和智能★ 2,512
feathrFeathr 是一个面向企业的可扩展、统一的数据与 AI 工程平台,主要用于特征工程的全生命周期管理。它解决了机器学习中特征定义、计算、存储和在线/离线一致性难★ 1,943
mlrunMLRun 是一个开源的 MLOps 平台,旨在帮助团队快速构建和管理持续运行的机器学习应用全生命周期。它解决的核心问题是 ML 项目从开发到生产的工程化难题,★ 1,700
ktxktx 是一个为数据和智能体设计的可执行上下文层,旨在解决 AI 智能体(如 Claude Code、Codex 等)在查询分析型数据库时缺乏业务上下文、准确率★ 1,605
mlops-python-packagemlops-python-package 是一个用于快速启动和标准化 MLOps 项目及数据管道的 Python 包模板。它解决了 MLOps 项目从零搭建时缺★ 1,418
around-dataengineeringaround-dataengineering 是一个数据工程与机器学习知识中心,旨在为数据从业者提供系统化的学习路径和实战参考。它聚合了数据工程、数据管道、数据★ 1,146
bacalhauBacalhau 是一个社区驱动的分布式计算框架,专注于在数据所在位置执行计算,实现快速、低成本的‘数据计算’(Compute over Data)。它解决了传★ 873
NeumAINeumAI 是一个专注于大规模向量嵌入创建与同步的框架,旨在解决 RAG(检索增强生成)应用中数据管道复杂、难以维护的痛点。它提供了一套声明式配置,让开发者能★ 869
altimate-codealtimate-code 是一个开源的智能体式数据工程工作台(agentic data engineering harness),面向 dbt、SQL 和云数★ 814
dbt-mcpdbt-mcp 是 dbt Labs 官方推出的 Model Context Protocol(MCP)服务器,用 Python 编写。它把 dbt 项目里的元★ 608
awesome-open-source-data-engineering这是一个精选开源数据工程工具列表,旨在帮助数据工程师和分析平台构建者快速找到合适的开源组件。项目按功能分类整理了数据摄取、存储、处理、查询、调度、可视化等环节的★ 604
agentsagents 是一个面向数据工程工作流的 AI 智能体工具库,用 Python 编写。它旨在将大语言模型(LLM)与数据管道(如 Airflow、dbt)结合,★ 448
feathubFeatHub 是一个面向实时机器学习的流批统一特征存储系统,旨在解决特征工程中训练与推理不一致、特征复用困难、实时与离线特征割裂等问题。它提供统一的 API ★ 352
Comprehensive-Data-Science-AI-Project-Portfolio这是一个精选的AI、数据工程和DevOps项目合集,包含真实世界应用、先进技术和教程,面向数据科学和机器学习的学习者与实践者。项目以Jupyter Notebo★ 351
extractorextractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受★ 321
hflowhflow 是面向机器人团队的 Python SDK,用于在训练 AI 模型前验证数据质量。机器人训练数据常来自多传感器采集(摄像头、激光雷达、IMU、关节状态★ 283
data-engineeringdata-engineering 是一个面向现代数据栈构建与工作流编排的开源项目,旨在帮助数据团队为分析和机器学习应用打造高质量的数据管道。它提供了一套结构化的★ 252
machine-learning这是一个面向所有人的免费AI学习与教学资源库,旨在通过协作方式帮助初学者和爱好者共同学习人工智能。项目以Jupyter Notebook为主要载体,提供从基础概★ 231
duddud 是一个用 Go 编写的轻量级命令行工具,旨在将数据版本管理与源代码版本控制(如 Git)相结合,并支持构建数据管道。它解决了数据科学家和工程师在项目中追★ 220
dcs-coredcs-core 是一个开源的 Python 数据质量监控框架,旨在帮助数据团队持续跟踪和验证数据的准确性、完整性和一致性。它解决了数据管道中因数据异常(如缺失★ 179
raptorraptor 是一个用 Go 编写的开源基础设施工具,旨在将 Python 风格的研究代码转化为工程师可直接部署的产物。它解决了研究与工程之间的鸿沟问题,即数据★ 164
genai-stackgenai-stack 是一个端到端的生成式 AI 框架,旨在帮助开发者快速搭建从数据接入、模型调用到应用部署的完整 GenAI 应用。它解决了 AI 应用开发★ 131
production-ready-data-science-code这是一个将杂乱的数据科学 notebook 转化为生产级代码的指南型项目,通过具体示例覆盖测试、CI/CD、MLOps 和可扩展部署实践。它解决了数据科学项目从★ 105
mlodamloda 是一个面向 AI 和机器学习场景的开源数据访问框架,采用插件化架构设计,旨在解决 AI 应用开发中数据获取、特征工程和上下文构建的碎片化问题。它提供★ 93
beneathBeneath 是一个基于 Go 语言构建的无服务器实时数据平台,旨在简化数据管道的搭建与运维。它解决了传统数据基础设施中服务器管理、扩展性和实时处理复杂的问题★ 84
clarilayerclarilayer 是一个为 AI 编程助手(如 Claude Code、Cursor、Codex)提供持久化数据上下文层的开源项目。它解决的核心问题是:每次★ 82
soorgeonsoorgeon 是一个将单体 Jupyter notebook 转换为可维护的 Ploomber 数据管道的开源工具。它解决的是数据科学家在 notebook★ 80
xvcxvc 是一个用 Rust 编写的 MLOps 工具,专注于数据版本管理和流水线管理。它解决了机器学习项目中数据文件、模型和实验管线的版本控制与可复现性问题,提★ 77
obsidian-note-taking-assistant这是一个为 Obsidian 用户打造的本地优先的第二大脑工具,基于 RAG(检索增强生成)技术,能对任意 Obsidian 仓库中的 Markdown 笔记进★ 67
feature-storefeature-store 是一个用于连接 DataOps 与 MLOps 工作流的特征存储开源项目,旨在解决机器学习开发中特征管理混乱、数据与模型脱节的问题。★ 62
dagster-mflix-demodagster-mflix-demo 是一个基于 Dagster 构建的示例 ELT 项目,演示如何将数据加载工具与 Snowflake 数据仓库集成。项目以 ★ 54