data-pipeline

本站收录 13 个带「data-pipeline」标签的 AI 开源项目

airbyteAirbyte 是一个开源数据集成平台,专注于 ELT 管道和 AI 应用的数据搬运。它解决的核心问题是:企业数据散落在 API、数据库、文件等数百种来源中,要★ 22,140data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105whodbwhodb 是一个面向数据访问与运维智能化的开源平台,定位在数据库管理与数据治理的交叉领域。它解决的是企业在多源数据环境中,数据访问分散、元数据混乱、血缘关系不★ 5,033dagudagu 是一个本地优先的工作流编排器,专为那些主要工作并非编排的团队设计。它通过声明式 YAML 文件来定义工作流,能够编排脚本、SSH 命令、容器和 AI ★ 4,212siesie 是一个开源的推理服务器和生产级集群,专为智能体(agent)所需的各类模型提供统一部署和调度。它解决了多模型、多副本在生产环境中难以统一管理的问题,提供★ 3,337whylogswhylogs 是一个开源的数据日志库,专为机器学习模型和数据管道设计。它通过轻量级的日志记录,持续收集数据分布、统计特征和模型性能指标,帮助团队实时监控数据质★ 2,833awesome-open-source-data-engineering这是一个精选开源数据工程工具列表,旨在帮助数据工程师和分析平台构建者快速找到合适的开源组件。项目按功能分类整理了数据摄取、存储、处理、查询、调度、可视化等环节的★ 604genblazeGenblaze 是一个开源 Python SDK,用于编排跨视频、音频和图像提供商的生成式 AI 媒体管道,并为每个输出内置来源追踪。它解决了在多个 AI 服★ 551DataMateDataMate 是一个面向企业级数据处理的开源平台,专注于大模型微调和 RAG(检索增强生成)场景。它解决了企业在准备高质量训练数据时面临的效率低下、流程分散★ 368extractorextractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受★ 321hflowhflow 是面向机器人团队的 Python SDK,用于在训练 AI 模型前验证数据质量。机器人训练数据常来自多传感器采集(摄像头、激光雷达、IMU、关节状态★ 283mlodamloda 是一个面向 AI 和机器学习场景的开源数据访问框架,采用插件化架构设计,旨在解决 AI 应用开发中数据获取、特征工程和上下文构建的碎片化问题。它提供★ 93visitranvisitran 是一个面向办公效率场景的 Python 开源项目,主打“智能体驱动”和“无代码”的数据转换能力。它解决的核心问题是:非技术人员或业务分析师在面★ 69