feature-engineering

本站收录 19 个带「feature-engineering」标签的 AI 开源项目

nni微软开源的 AutoML 工具包,覆盖机器学习生命周期的自动化,包括特征工程、神经网络架构搜索、模型压缩与超参调优等环节。借助丰富的搜索算法与可视化面板,帮助团★ 14,364hamiltonHamilton 是一个帮助数据科学家和工程师定义可测试、模块化、自文档化数据流的开源框架。它通过纯 Python 函数声明数据转换逻辑,自动构建数据流图,并生★ 2,601featureformFeatureform 是一个虚拟特征存储(Virtual Feature Store)系统,它不重新搭建存储,而是将你已有的数据基础设施(如 Postgres★ 1,991feathrFeathr 是一个面向企业的可扩展、统一的数据与 AI 工程平台,主要用于特征工程的全生命周期管理。它解决了机器学习中特征定义、计算、存储和在线/离线一致性难★ 1,943OpenMLDBOpenMLDB是一个开源的机器学习数据库,旨在解决ML特征计算中训练与推理不一致的痛点。它提供统一的特征平台,让用户能用SQL定义特征,并在训练和线上推理时获★ 1,715hopsworksHopsworks 是一个面向数据密集型 AI 的平台,核心是 Feature Store(特征存储),旨在解决机器学习特征管理混乱、训练与推理数据不一致的问题★ 1,306BharatMLStackBharatMLStack 是 Meesho 开源的一套端到端机器学习基础设施栈,旨在支撑印度“Bharat”规模的实时与批量 ML 工作负载。它解决了从模型训★ 714serverless-ml-course这是一个面向开发者的无服务器机器学习实战课程,旨在教授如何将训练好的模型和特征工程流水线部署为可扩展、低成本的AI预测服务。课程内容涵盖从模型打包、API构建到★ 685marvis-risk-agentMARVIS-Agent 是一个面向信用风险领域的全流程智能体,旨在帮助模型开发、验证、数据处理、特征工程和策略工作流。它解决的是信用风险建模过程中多步骤、多工★ 476Sklearn-genetic-optsklearn-genetic-opt 是一个面向 scikit-learn 的超参数优化与特征选择工具,采用进化算法(如遗传算法)自动搜索最佳模型配置。它解决★ 390upginiupgini 是一个面向机器学习的数据搜索与增强库,旨在帮助数据科学家快速从数百个公共和商业外部数据源(包括开放及商业大语言模型)中查找并添加相关特征到 ML/★ 358feathubFeatHub 是一个面向实时机器学习的流批统一特征存储系统,旨在解决特征工程中训练与推理不一致、特征复用困难、实时与离线特征割裂等问题。它提供统一的 API ★ 351getml-communitygetml-community 是一个面向关系型与多变量时间序列数据的高性能预测工具,基于 C++ 实现,核心是自动特征学习与自动化机器学习。它解决传统机器学习★ 244designing-ml-systems-summary这是《Designing Machine Learning Systems》(Chip Huyen 著)一书的详细中文总结项目。该书系统讲解了从数据收集、特征工★ 207raptorraptor 是一个用 Go 编写的开源基础设施工具,旨在将 Python 风格的研究代码转化为工程师可直接部署的产物。它解决了研究与工程之间的鸿沟问题,即数据★ 164build-and-deploy-real-time-feature-pipeline这是一个用Python构建和部署实时特征管道的开源项目,旨在解决机器学习中特征工程从离线批处理向实时流处理迁移的难题。项目结合Bytewax(流处理框架)和Ho★ 137mlodamloda 是一个面向 AI 和机器学习场景的开源数据访问框架,采用插件化架构设计,旨在解决 AI 应用开发中数据获取、特征工程和上下文构建的碎片化问题。它提供★ 93alignedAligned 是一个面向机器学习系统的数据依赖描述与治理工具,定位为“机器学习领域的 DBT”。它通过声明式的方式定义 ML 系统中的数据依赖关系,帮助团队理★ 61awesome-llmopsawesome-llmops 是一个专注于 LLMOps(大语言模型运维)领域的精选资源列表,旨在系统整理和展示与 LLMOps 相关的工具、框架、最佳实践和学★ 56