vision

一站式搞定视觉数据与模型,让 CV 开发像写文本一样简单

vision 是 Hugging Face 团队开发的计算机视觉工具库,专注于提供图像、视频数据集、变换(transforms)和预训练模型的一站式接口。它解决了视觉任务中数据加载、预处理和模型使用碎片化的问题,通过统一的 API 让开发者能够轻松访问数千个公开数据集(如 ImageNet、COCO)和主流视觉模型(如 ViT、ResNet)。核心能力包括:高效的数据集加载与流式处理、丰富的图像/视频变换操作、与 transformers 库无缝集成、支持 PyTorch 和 TensorFlow 后端。无论是做图像分类、目标检测还是视频理解,vision 都能显著简化数据管线的搭建,让研究者更专注于模型设计本身。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 17925
维护状态 活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队pytorch
所属国家
定价模式free
价格说明开源库,完全免费,无付费版本。
访问状态
是否开源
开源协议BSD-3-Clause
主要语言Python
技术栈/模型computer-vision,machine-learning
GitHub 星标★ 17925
30天Star增速
HF 下载量
上线时间2016-11-09 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.10 ~ 3.14(对应 torch 2.10~2.13 / torchvision 0.25~0.28 这一代)
  • 必须先安装与 torchvision 版本匹配的 torch,二者需成对安装
  • 可用的 pip 与网络环境(按 PyTorch 官方指引选择 CPU 或 CUDA 版本)
  • 如需源码构建,需额外的编译环境,参见 CONTRIBUTING 开发安装说明

安装与启动步骤

  1. 1确认 Python 版本

    先确认本机 Python 版本落在 torchvision 支持的区间内(新版要求 >=3.10, <=3.14),版本不符需先切换环境。

    python --version
  2. 2查版本对应关系

    打开 README 中的版本对照表,确定 torch 与 torchvision 的配对,例如 torch 2.13 对应 torchvision 0.28。

  3. 3安装 torch 与 torchvisi

    README 未给出具体安装命令,要求按 PyTorch 官方指引安装。此处为通用写法,正式安装请以官网选择器生成的命令为准。

    pip install torch torchvision
  4. 4源码构建(可选)

    若要用源码而非发行版,README 指向 contributing 页面的 development installation 说明,按其中步骤编译安装。

  5. 5验证安装

    导入 torchvision 并打印版本号,确认与已安装的 torch 版本处于同一配对行。

    python -c "import torchvision; print(torchvision.__version__)"

如何确认成功

执行 python -c "import torchvision; print(torchvision.__version__)" 能正常输出版本号,且与 torch 版本按对照表配对(如 torch 2.13 + torchvision

常见问题

Q:torch 和 torchvision 版本对不上怎么办?

A:按 README 对照表卸载后重装成同一行的组合,例如 torch 2.12 搭配 torchvision 0.27,不要跨行混装。

Q:该装哪个版本的 torchvision?

A:先看你用的 torch 版本,再在表格中找同一行对应的 torchvision 版本,同时确认 Python 版本满足该行要求。

Q:Python 版本不满足要求怎么办?

A:新版要求 Python >=3.10 且 <=3.14;若本机版本过高或过低,可改用更早的 torch/torchvision 组合或切换 Python 环境。

Q:可以直接从源码安装吗?

A:可以,README 指向 CONTRIBUTING 页面的 development installation 部分,按其中的源码构建步骤操作。

注意事项

  • README 只给出安装入口与版本对照表,没有具体安装命令,实际安装请以 PyTorch 官网(pytorch.org/get-started/locally)生成的命令为准。
  • torch 与 torchvision 必须严格按表格配对安装,版本不匹配会导致导入失败。
  • 部分 CUDA 版本需要单独指定安装源,请按官方选择器给出的命令执行。

核心亮点

  • 统一 API 访问海量视觉数据集,支持流式加载,省去下载转换的麻烦
  • 与 transformers 深度集成,可直接加载预训练模型进行微调
  • 内置多种图像/视频变换,支持自定义,兼容主流深度学习框架

不足之处

  • 文档偏重 API 参考,缺少端到端实战教程,新手上手有门槛
  • 部分数据集加载速度慢,且对视频数据集支持不如图像完善

适用场景

  • 快速加载公开数据集进行模型训练或基准测试
  • 在 Hugging Face 生态中微调视觉 Transformer 模型
  • 构建视频理解任务的数据预处理管线

替代项目

torchvision、timm、albumentations

项目介绍

vision 是计算机视觉领域的开源项目,由 pytorch 开发,2016 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(17,925)位列前 3%,在计算机视觉分类的 446 个项目里位列前 3%。

近 44 天,它的 GitHub 星标从 17,855 增加到 17,925,净增 70。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源库,完全免费,无付费版本。

它主要面向的使用场景是:快速加载公开数据集进行模型训练或基准测试。同类可对比的替代方案包括 torchvision、timm、albumentations。

上一篇:vit-pytorch

下一篇:dlib

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14