mrmr

高维数据下自动选特征,去冗余提精度

mRMR 是一个用于大规模自动特征选择的 Python 库,实现了最小冗余最大相关性(minimum-Redundancy-Maximum-Relevance)算法。该算法通过同时最大化特征与目标变量的相关性,并最小化特征之间的冗余性,来筛选出最具代表性的特征子集。mRMR 特别适用于高维数据集,如基因表达谱、文本分类和图像识别等场景,能有效缓解维度灾难,提升模型训练效率和预测性能。项目提供了简洁的 API,支持多种数据格式,并针对大规模数据进行了优化,能够处理数十万维的特征空间。其核心能力包括快速计算特征相关性、自动确定特征数量、支持分类与回归任务,并提供了与 scikit-learn 兼容的接口,方便集成到现有机器学习流程中。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 630
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类基础设施
开发团队smazzanti
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型data-science,feature-selection,machine-learning,mlops
GitHub 星标★ 630
30天Star增速
HF 下载量
上线时间2021-04-16 00:00:00
最近更新2026-09-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 实现经典 mRMR 算法,特征选择理论扎实,适合高维数据
  • 针对大规模数据优化,能处理数十万维特征
  • 提供与 scikit-learn 兼容的接口,易于集成到现有流程

不足之处

  • 文档相对简略,示例和最佳实践不够丰富
  • 社区活跃度一般,更新频率可能较慢

适用场景

  • 基因表达谱等生物信息学高维特征选择
  • 文本分类中的特征降维
  • 图像识别前的高维特征预处理

替代项目

scikit-learn 的 SelectKBest、Featuretools、Boruta

项目介绍

mrmr 是模型训练领域的开源项目,由 smazzanti 开发,2021 年首次发布。

它收录于模型训练分类,该分类目前共有 522 个项目,GitHub 星标数为 630。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:基因表达谱等生物信息学高维特征选择。同类可对比的替代方案包括 scikit-learn 的 SelectKBest、Featuretools、Boruta。

上一篇:CICD-for-Machine-Learning

下一篇:benderopt

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13