data-science
本站收录 194 个带「data-science」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
Made-With-ML一套面向生产级机器学习应用的完整学习课程,手把手教你如何开发、部署并持续迭代 ML 应用。内容覆盖从实验到上线的全流程实践,配有代码示例,适合希望系统掌握工程化★ 49,652
airflowApache 基金会旗下的工作流编排平台,支持以代码方式(Python)编程式地定义、调度与监控数据管道。凭借丰富的算子生态、可靠的调度机制和活跃的社区,Air★ 47,011
streamlitStreamlit 是一个开源的 Python 应用框架,专为数据科学家和机器学习工程师设计,旨在将数据脚本快速转化为可交互的 Web 应用。它解决了传统数据应★ 45,850
rayRay 是一个面向 AI 计算的分布式引擎,由核心分布式运行时和一组 AI 库组成,用于加速机器学习工作负载。它解决了大规模分布式训练、调参、推理和服务部署中的★ 43,949
500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code这是一个收录了约500个AI、机器学习、深度学习、计算机视觉和自然语言处理项目的代码合集仓库,本质上是面向学习者和开发者的资源索引。它解决的核心问题是:初学者面★ 37,051
reflexReflex 是一个基于纯 Python 的全栈 Web 应用开发框架,让你无需编写任何 JavaScript、HTML 或 CSS 代码,就能构建交互式 We★ 28,924
best-of-ml-python这是一个精选的机器学习Python库排行榜,每周自动更新,按GitHub星标数排序,帮助开发者快速发现和评估优秀的ML工具。它解决了机器学习生态中库数量庞大、质★ 23,828
pandas-aiPandasAI 是一个将大语言模型与数据分析结合的开源库,让你可以用自然语言与数据对话。它支持 SQL、CSV、Parquet 等多种数据源,通过 LLM 和★ 23,813
machine-learning-for-trading这是一个与《Machine Learning for Trading》第三版配套的开源代码仓库,旨在帮助读者和开发者系统学习如何将机器学习技术应用于金融交易。项★ 21,121
dagsterDagster 是一个面向数据资产的开源编排平台,专注于数据开发、生产和观测的全流程管理。它解决了传统数据管道工具在开发、部署和监控中割裂的问题,提供统一的开发★ 16,222
RD-AgentRD-Agent 是微软开源的自动化研发智能体框架,旨在将人工智能领域的研发流程(尤其是数据和模型相关的迭代)自动化。它解决的核心问题是传统研发过程中大量重复性★ 14,803
nni微软开源的 AutoML 工具包,覆盖机器学习生命周期的自动化,包括特征工程、神经网络架构搜索、模型压缩与超参调优等环节。借助丰富的搜索算法与可视化面板,帮助团★ 14,364
awesome-mlopsawesome-mlops 是一个精心整理的 MLOps 资源列表,旨在为机器学习工程师、数据科学家和平台团队提供一站式参考。它系统性地收集了从模型开发、训练、★ 14,227
great_expectationsGreat Expectations 是一个开源的数据质量工具,帮助数据团队定义、验证和文档化数据的期望。它解决了数据管道中数据质量不可控的问题,通过声明式的期★ 11,851
ludwigLudwig 是一个基于 Python 的低代码机器学习框架,旨在让开发者无需编写大量底层代码即可构建、训练和部署定制化的大语言模型、神经网络及其他 AI 模型★ 11,771
wandb面向 AI 开发者的实验追踪与模型管理平台,支持训练过程的实时监控、指标可视化与团队协作,并能对模型从实验到生产的全生命周期进行管理。无论是调参对比、结果复现还★ 11,266
fiftyoneFiftyOne 是一个面向计算机视觉团队的开源数据集管理与模型评估工具,由 Voxel51 开发。它解决了视觉 AI 开发中数据质量差、模型错误难以定位、数据★ 11,130
amazon-sagemaker-examplesamazon-sagemaker-examples 是亚马逊官方维护的 Jupyter Notebook 示例集,旨在帮助开发者快速上手 Amazon Sage★ 10,987
PyMuPDFPyMuPDF 是一个高性能的 Python 库,用于 PDF 及其他文档(如 EPUB)的数据提取、分析、转换和操作。它基于 MuPDF 引擎,提供丰富的 A★ 10,808
autogluonAutoGluon 是一个自动化机器学习(AutoML)库,旨在用三行代码实现快速且准确的模型训练。它解决了传统机器学习中模型选择、超参数调优和特征工程耗时费力★ 10,754
machine-learning-systems-design这是一本关于机器学习系统设计的开源小册子,以练习驱动的方式系统讲解ML系统的工程化设计。它面向希望从算法模型走向实际系统构建的工程师,解决ML项目在落地时面临的★ 10,681
pyodPyOD是一个专注于异常检测的Python库,覆盖表格、时间序列、图、文本、图像和音频等多种数据类型,内置60多种检测算法,包括经典的LOF、IForest以及★ 10,020
pycaretPython 生态中的开源低代码 AutoML 平台,几行代码即可完成数据预处理、模型训练、调参与对比。4.0 版本采用 sklearn 原生引擎并引入 Rea★ 9,848
DataFlowDataFlow 是一个面向大模型时代的数据准备框架,目标是让数据清洗、合成与加工像搭积木一样简单。它把数据处理的每个环节抽象成可复用的 Operator(算子★ 8,214
TabPFNTabPFN 是一个基于 Transformer 的表格式数据基础模型,由 Prior-Data Fitted Networks 技术驱动,旨在解决传统机器学习★ 8,083
evidentlyEvidently 是一个开源的机器学习和大型语言模型可观测性框架,用于评估、测试和监控任何 AI 驱动的系统或数据管道,覆盖从表格数据到生成式 AI 的广泛场★ 7,949
flyteFlyte 是一个开源的云原生编排平台,专注于数据、机器学习和 AI 工作流的自动化。它解决的是在复杂生产环境中,数据管道、模型训练和推理任务难以统一调度和可靠★ 7,602
feastFeast 是一个开源的 Feature Store(特征仓库),专为 AI/ML 场景设计,旨在解决机器学习模型开发与部署中特征管理混乱、训练与在线推理特征不★ 7,314
lancelance 是一个面向多模态 AI 数据的开源列式存储格式,基于 Rust 和 Apache Arrow 构建。它解决了传统 Parquet 格式在随机访问、向★ 7,123
data-juicerData-Juicer 是一个面向大模型的数据处理与分析工具,旨在解决模型训练数据质量参差不齐、处理流程繁琐低效的问题。它提供了一套系统化的数据加工流水线,包含★ 7,105
smileSmile是一个基于Java的统计机器智能与学习引擎,专注于提供全面、高效的机器学习与数据挖掘工具。它解决了Java生态中缺乏功能完整且性能优异的ML库的问题,★ 6,414
aimAim 是一个开源、易用的实验追踪工具,专为机器学习项目设计。它解决了 ML 团队在训练过程中难以高效记录、比较和可视化大量实验指标与元数据的问题。核心能力包括★ 6,271
zenmlZenML 是一个面向机器学习团队的端到端 MLOps 平台,旨在统一从数据准备、模型训练到部署和监控的整个 AI 生命周期。它通过可组合的管道(Pipelin★ 5,597
awesome-mlops这是一个精心整理的 MLOps 工具精选清单,旨在帮助机器学习工程师、数据科学家和平台团队快速发现和评估生产环境中所需的各类工具。项目将 MLOps 生态按功能★ 5,283
DeepAnalyzeDeepAnalyze 是一个基于 Agent 架构的自主数据科学分析工具,定位为你的 AI 数据分析师。它能够自动处理大规模数据集,完成从数据清洗、探索性分析★ 4,663
Data-Science-Roadmap这是一个面向数据科学学习者的从零到一路线图,覆盖数据分析、数据工程、机器学习、深度学习、大数据、数据可视化等核心领域,并提供面试准备、简历模板和速查表等实用资源★ 4,380
SwanLabSwanLab 是一个开源、现代设计的 AI 训练跟踪与可视化工具,支持云端和自托管两种使用方式。它解决了深度学习训练过程中实验管理混乱、指标监控不便、结果对比★ 4,235
pipelinespipelines 是 Kubeflow 项目下的机器学习流水线组件,用于在 Kubernetes 上构建、部署和管理端到端的 ML 工作流。它解决了机器学习实★ 4,230
deepchecksDeepchecks 是一个面向机器学习模型与数据的持续验证开源测试框架,覆盖从研究到生产的全流程。它解决的是 ML 生命周期中数据质量、模型性能、漂移和偏见等★ 4,061
maestroMaestro 是 Netflix 开源的工作流编排器,用于管理和调度数据管道及机器学习工作流。它解决了大规模工作流编排中常见的依赖复杂、资源利用率低、运维困难★ 3,842
polyaxonPolyaxon 是一个开源的 AI 基础设施平台,定位为 AI 编排与控制平面。它解决的是机器学习生命周期中实验管理、模型训练、超参数调优、模型部署等环节缺乏★ 3,737
ploomberPloomber 是一个用于构建数据管道的 Python 框架,旨在加速从开发到部署的整个流程。它解决了数据工程中常见的迭代速度慢、环境切换复杂、部署困难等问题★ 3,620
mlops-course这是一个面向生产级机器学习应用的教学课程仓库,旨在帮助开发者掌握从设计、开发、部署到迭代的完整MLOps流程。课程内容涵盖数据版本管理、模型实验追踪、CI/CD★ 3,405
determinedDetermined 是一个开源机器学习平台,旨在简化分布式训练、超参数调优、实验追踪和资源管理。它支持 PyTorch 和 TensorFlow,提供统一的 ★ 3,241
DataFlexDataFlex 是一个数据为中心的 LLM 训练工具,它嵌入在 LLaMA-Factory 训练流程中,通过动态样本选择、领域混合优化和示例重加权来提升模型训★ 2,875
whylogswhylogs 是一个开源的数据日志库,专为机器学习模型和数据管道设计。它通过轻量级的日志记录,持续收集数据分布、统计特征和模型性能指标,帮助团队实时监控数据质★ 2,833
hamiltonHamilton 是一个帮助数据科学家和工程师定义可测试、模块化、自文档化数据流的开源框架。它通过纯 Python 函数声明数据转换逻辑,自动构建数据流图,并生★ 2,601
ml-retreatml-retreat 是一个面向中高级机器学习学习者的开源项目,以 Jupyter Notebook 形式呈现一系列深入的主题教程。它旨在填补从入门到进阶之间的★ 2,376
autolabelautolabel 是一个基于大型语言模型(LLM)的文本数据标注、清洗和增强工具。它解决了传统人工标注成本高、效率低的问题,通过配置化方式让用户利用 LLM ★ 2,331
nannymlnannyml 是一个用于机器学习模型部署后监控的 Python 库。它解决的是模型上线后性能下降、数据漂移等问题难以发现和定位的痛点。核心能力包括:检测特征和★ 2,156