
ml-cvnets
一套代码训练分类检测分割视觉模型
CVNets 是苹果开源的计算机视觉训练库,基于 PyTorch 构建,目标是把分类、检测、分割等任务的训练流程统一到一套可复用的框架里。它解决的核心问题是:视觉模型训练往往要针对不同数据集(ImageNet、MS COCO、ADE20K、Pascal VOC)和不同任务重复写训练脚本、数据加载和评估逻辑。CVNets 提供了统一的训练引擎、模型库和数据处理管线,内置多种主流骨干网络与任务头,支持分类、目标检测、语义分割等常见任务,并覆盖多机多卡分布式训练、混合精度、梯度累积等工程能力。用户可以通过配置文件或命令行参数快速切换模型与数据集,减少样板代码,把精力放在模型结构和实验设计上。项目还提供预训练模型和可复现的训练配置,方便研究者对比基线、工业界快速落地。
项目数据
使用教程
环境要求
- Python 3.10 或更高版本
- PyTorch 版本 >= v1.12.0
- Conda(README 推荐用 Conda 管理环境,未安装可先装 Miniconda)
安装与启动步骤
-
1安装 Conda 环境
README 建议使用 Conda 管理环境,若本机未安装 Conda,先按官方文档安装 Miniconda,再准备一个 Python 3.10+ 的环境。
-
2获取项目代码
把 ml-cvnets 仓库克隆到本地,后续的 pip 安装都需要在项目根目录内执行。
git clone https://github.com/apple-aiml-research/ml-cvnets.git cd ml-cvnets -
3安装依赖包
按 requirements.txt 安装依赖,并用 constraints.txt 约束版本,避免依赖冲突;需在项目根目录执行。
pip install -r requirements.txt -c constraints.txt -
4安装 CVNets 本体
以可编辑模式安装当前目录下的 CVNets 包,便于后续修改源码或直接调用库。
pip install --editable . -
5查看文档与示例
README 指向 docs/source/en/general 的通用说明、docs/source/en/models 与 examples 目录下的训练与评估示例,按需阅读。
-
6按需转换 CoreML
如需把 PyTorch 模型转成 CoreML,参考文档 docs/source/en/general/README-pytorch-to-coreml.md 中的示例。
如何确认成功
两条 pip install 命令均无报错执行完成,即表示依赖与 CVNets 包已成功安装。
常见问题
Q:对 Python 和 PyTorch 版本有什么要求?
A:README 推荐 Python 3.10+,PyTorch 版本需 >= v1.12.0,版本过低可能安装或运行失败。
Q:没有安装 Conda 可以吗?
A:README 的安装步骤以 Conda 为例,并给出了 Miniconda 安装文档链接,先装好 Conda 再按步骤操作即可。
Q:安装完成后怎么开始训练或评估模型?
A:参考仓库内 docs/source/en/models 与 examples 目录中提供的训练和评估示例。
Q:如何把模型转换成 CoreML?
A:README 提供了专门文档 docs/source/en/general/README-pytorch-to-coreml.md,内含转换示例。
注意事项
- 安装命令需在克隆下来的项目根目录内执行,否则找不到 requirements.txt 和 constraints.txt。
- README 建议用 Conda 创建并管理 Python 3.10+ 环境,再进行依赖安装。
- 训练、评估等具体用法需查阅仓库内的 docs 目录和 examples 目录。
核心亮点
- 统一训练引擎覆盖分类、检测、分割多任务,减少重复脚本
- 内置 ImageNet、COCO、ADE20K、VOC 等常用数据集的加载与评估流程
- 支持分布式训练、混合精度等工程特性,并提供预训练模型与可复现配置
不足之处
- 文档和示例相对分散,新手上手需要一定时间熟悉配置体系
- 社区生态和第三方教程数量不如 torchvision、MMDetection 等成熟项目
适用场景
- 研究团队快速复现视觉模型基线并对比实验
- 工业界在自有数据上微调分类或分割模型
- 教学场景中演示从数据加载到训练评估的完整流程
替代项目
MMDetection、torchvision、timm
项目介绍
上一篇:ISAT_with_segment_anything
下一篇:tapnet
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3