pytorch-image-models

一行代码调用数百个预训练视觉骨干,省去复现选型成本

pytorch-image-models(常被称为 timm)是 PyTorch 生态中规模最大的图像编码器与骨干网络集合,由 Hugging Face 维护。它把 ResNet、EfficientNet、Vision Transformer、ConvNeXt、Swin、MaxViT、MobileNet 系列等数百个模型统一到一致的接口下,解决研究者与工程师在选型、复现和迁移时反复造轮子的问题。核心能力包括:一行代码创建任意模型并加载 ImageNet 预训练权重,支持特征提取、微调、验证与推理;提供训练、评估、导出(ONNX/TorchScript)脚本;支持分布式训练、混合精度、EMA、AugMix 等训练技巧;模型可无缝接入 Hugging Face Hub。凭借 3.7 万以上星标和持续更新,它已成为图像分类与视觉骨干网络的事实标准库,广泛用于论文复现、工业落地和教学。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 37148
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队huggingface
所属国家
官网地址
定价模式free
价格说明开源免费,Apache-2.0 许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型augmix,convnext,distributed-training,efficientnet,image-classification,imagenet,maxvit,mixnet,mobile-deep-learning,mobilenet-v2,mobilenetv3,nfnets,normalization-free-training,optimizer,pretrained-models,pretrained-weights,pytorch,randaugment,resnet,vision-transformer-models
GitHub 星标★ 37148
30天Star增速
HF 下载量
上线时间2019-02-02 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • 可访问 GitHub 与 Hugging Face(获取文档与预训练权重)
  • 可联网浏览外部文档站点以完成安装与选型

安装与启动步骤

  1. 1查阅官方文档

    README 未给出安装命令,官方安装与快速上手说明在 Hugging Face 的 timm 文档页,按该页指引操作。

  2. 2阅读实践指南

    参考 Chris Hughes 的 Practitioner's Guide,或 timm.fast.ai(timmdocs),了解完整使用流程与常见用法。

  3. 3浏览可选模型

    通过 paperswithcode 的 timm 页面按任务与结构浏览模型,确定需要的骨干网络后再进入安装环节。

  4. 4查看模型导出方案

    README 的 Deployment 节指向 timmx,用于把 timm 模型导出为 ONNX、CoreML、LiteRT、TensorRT 等格式。

如何确认成功

README 未提供安装验证方式;请按官方文档 https://huggingface.co/docs/hub/timm 中的示例确认环境可用。

常见问题

Q:timm 的完整安装和上手说明在哪里?

A:官方文档地址为 https://huggingface.co/docs/hub/timm,README 的 Getting Started 一节即指向该文档,README 节选中未包含安装命令。

Q:有没有更详细的实战教程?

A:可参考 Chris Hughes 的《Getting Started with PyTorch Image Models (timm): A Practitioner's Guide》,以及 Aman Arora 维护的 timmdocs(timm.fast.ai)。

Q:如何挑选 timm 里的模型?

A:可访问 paperswithcode.com/lib/timm 浏览 timm 中包含的模型,再结合自己的任务选择对应骨干网络。

Q:如何把模型导出到其他推理格式?

A:README 的 Deployment 小节推荐 timmx(https://github.com/Boulaouaney/timmx),支持导出 ONNX、CoreML、LiteRT、TensorRT 等。

Q:最近新增了哪些模型?

A:README 的 What's New 列出 Qwen3-VL、Sapiens2 ViT、iFormer、EfficientViM、DeepSeek-V4 ViT、LowFormer 等新增模型与权重。

注意事项

  • README 节选未包含 pip/conda 等安装命令,安装方式请以 https://huggingface.co/docs/hub/timm 为准,不要凭猜测执行命令。
  • 训练、验证、推理脚本在 README 的 Train, Validation, Inference Scripts 章节,节选中未展开具体参数。
  • 预训练权重与文档托管在 Hugging Face,首次加载模型通常需要联网。

核心亮点

  • 模型覆盖极广,从经典 CNN 到最新 ViT/混合架构一应俱全,且持续跟进前沿论文
  • 统一 API 与预训练权重,create_model 一行即可加载,迁移学习门槛极低
  • 训练/评估/导出脚本完整,支持分布式、混合精度与多种数据增强,工程可用性强

不足之处

  • 模型数量庞大,版本迭代快,部分旧模型权重或接口存在兼容性变化
  • 文档偏重 API 参考,缺少面向新手的端到端教程与最佳实践指南

适用场景

  • 论文复现时快速对比不同骨干网络的精度与速度
  • 工业项目中将预训练模型微调到自有图像分类数据集
  • 作为特征提取器接入检测、分割等下游视觉任务

替代项目

torchvision、mmclassification、transformers

项目介绍

pytorch-image-models 是一个计算机视觉领域的开源项目,官方简介:The largest collection of PyTorch image encoders / backbones. Including train, eval, inference, export scripts, and pretrained weights -- ResNet, ResNeXT, EfficientNet, NFNet, Vision Transformer (ViT), MobileNetV4, MobileNet-V3 & V2, RegNet, DPN, CSPNet, Swin Transformer, MaxViT, CoAtNet, ConvNeXt, and more。项目使用 Python 开发,在 GitHub 上获得 37139 星标。

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3995 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90893 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2035 2026-08-14