
pytorch-image-models
一行代码调用数百个预训练视觉骨干,省去复现选型成本
pytorch-image-models(常被称为 timm)是 PyTorch 生态中规模最大的图像编码器与骨干网络集合,由 Hugging Face 维护。它把 ResNet、EfficientNet、Vision Transformer、ConvNeXt、Swin、MaxViT、MobileNet 系列等数百个模型统一到一致的接口下,解决研究者与工程师在选型、复现和迁移时反复造轮子的问题。核心能力包括:一行代码创建任意模型并加载 ImageNet 预训练权重,支持特征提取、微调、验证与推理;提供训练、评估、导出(ONNX/TorchScript)脚本;支持分布式训练、混合精度、EMA、AugMix 等训练技巧;模型可无缝接入 Hugging Face Hub。凭借 3.7 万以上星标和持续更新,它已成为图像分类与视觉骨干网络的事实标准库,广泛用于论文复现、工业落地和教学。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- Python 环境(项目开发语言为 Python)
- 可访问 GitHub 与 Hugging Face(获取文档与预训练权重)
- 可联网浏览外部文档站点以完成安装与选型
安装与启动步骤
-
1查阅官方文档
README 未给出安装命令,官方安装与快速上手说明在 Hugging Face 的 timm 文档页,按该页指引操作。
-
2阅读实践指南
参考 Chris Hughes 的 Practitioner's Guide,或 timm.fast.ai(timmdocs),了解完整使用流程与常见用法。
-
3浏览可选模型
通过 paperswithcode 的 timm 页面按任务与结构浏览模型,确定需要的骨干网络后再进入安装环节。
-
4查看模型导出方案
README 的 Deployment 节指向 timmx,用于把 timm 模型导出为 ONNX、CoreML、LiteRT、TensorRT 等格式。
如何确认成功
README 未提供安装验证方式;请按官方文档 https://huggingface.co/docs/hub/timm 中的示例确认环境可用。
常见问题
Q:timm 的完整安装和上手说明在哪里?
A:官方文档地址为 https://huggingface.co/docs/hub/timm,README 的 Getting Started 一节即指向该文档,README 节选中未包含安装命令。
Q:有没有更详细的实战教程?
A:可参考 Chris Hughes 的《Getting Started with PyTorch Image Models (timm): A Practitioner's Guide》,以及 Aman Arora 维护的 timmdocs(timm.fast.ai)。
Q:如何挑选 timm 里的模型?
A:可访问 paperswithcode.com/lib/timm 浏览 timm 中包含的模型,再结合自己的任务选择对应骨干网络。
Q:如何把模型导出到其他推理格式?
A:README 的 Deployment 小节推荐 timmx(https://github.com/Boulaouaney/timmx),支持导出 ONNX、CoreML、LiteRT、TensorRT 等。
Q:最近新增了哪些模型?
A:README 的 What's New 列出 Qwen3-VL、Sapiens2 ViT、iFormer、EfficientViM、DeepSeek-V4 ViT、LowFormer 等新增模型与权重。
注意事项
- README 节选未包含 pip/conda 等安装命令,安装方式请以 https://huggingface.co/docs/hub/timm 为准,不要凭猜测执行命令。
- 训练、验证、推理脚本在 README 的 Train, Validation, Inference Scripts 章节,节选中未展开具体参数。
- 预训练权重与文档托管在 Hugging Face,首次加载模型通常需要联网。
核心亮点
- 模型覆盖极广,从经典 CNN 到最新 ViT/混合架构一应俱全,且持续跟进前沿论文
- 统一 API 与预训练权重,create_model 一行即可加载,迁移学习门槛极低
- 训练/评估/导出脚本完整,支持分布式、混合精度与多种数据增强,工程可用性强
不足之处
- 模型数量庞大,版本迭代快,部分旧模型权重或接口存在兼容性变化
- 文档偏重 API 参考,缺少面向新手的端到端教程与最佳实践指南
适用场景
- 论文复现时快速对比不同骨干网络的精度与速度
- 工业项目中将预训练模型微调到自有图像分类数据集
- 作为特征提取器接入检测、分割等下游视觉任务
替代项目
torchvision、mmclassification、transformers
项目介绍
同类项目推荐
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3