PyTorch使用教程(8)-一文了解torchvision

🕗 发布于 2025-01-20 03:22 深度学习 pytorch python 人工智能

一、什么是torchvision

torchvision提供了丰富的功能，主要包括数据集、模型、转换工具和实用方法四大模块。数据集模块内置了多种广泛使用的图像和视频数据集，如ImageNet、CIFAR-10、MNIST等，方便开发者进行训练和评估。模型模块封装了大量经典的预训练模型结构，如AlexNet、VGG、ResNet等，支持迁移学习和模型扩展。转换工具模块提供了丰富的数据增强和预处理操作，如裁剪、旋转、翻转、归一化等，有助于提升模型的泛化能力。实用方法模块则包含了一系列辅助工具，如图像保存、创建图像网格等，便于实验结果的可视化。
在这里插入图片描述

torchvision与PyTorch深度集成，支持CPU和GPU加速，能够在不同平台上高效运行。它简化了从数据准备到模型训练再到结果可视化的整个流程，为计算机视觉研究和开发提供了极大的便利。无论是初学者还是经验丰富的开发者，都可以通过torchvision快速构建和训练自己的视觉模型，加速AI应用的开发进程。

二、核心功能介绍

torchvision的核心功能主要包括数据集加载、图像转换、预训练模型加载、数据加载器以及实用工具等，以下是对这些功能的详细介绍及相关示例代码：

2.1 数据集加载

torchvision.datasets提供了多种流行的计算机视觉数据集，如CIFAR-10、MNIST、ImageNet等，支持一键下载和加载。

from torchvision import datasets

# 加载CIFAR-10数据集
train_dataset = datasets.CIFAR10(root='./data', train=True, download=True, transform=None)
test_dataset = datasets.CIFAR10(root='./data', train=False, download=True, transform=None)

2.2 图像转换

torchvision.transforms模块提供了丰富的图像转换操作，如缩放、裁剪、翻转、归一化等，这些操作可以单独使用，也可以组合使用，以形成数据增强流水线。
在这里插入图片描述

from torchvision import transforms
# 定义转换操作
transform = transforms.Compose([
    transforms.Resize((256, 256)),#缩放
    transforms.RandomCrop(224),#随机裁剪
    transforms.RandomHorizontalFlip(),#随机翻转
    transforms.ToTensor(), #张量转化
    transforms.Normalize(mean=[0.485, 0.456, 0.406], std=[0.229, 0.224, 0.225])
])

# 应用转换操作
image = Image.open('path_to_image.jpg')
processed_image = transform(image)

2.3 预训练模型加载

torchvision.models模块提供了多种经典的预训练模型，如ResNet、VGG、AlexNet等，可以直接加载这些模型进行迁移学习或作为基准模型。
在这里插入图片描述

from torchvision import models
# 加载预训练的ResNet-50模型
model = models.resnet50(pretrained=True)

2.4 数据加载器

torch.utils.data.DataLoader是一个实用的数据加载器，可以与torchvision提供的数据集一起使用，方便地进行批量加载和数据迭代。

from torch.utils.data import DataLoader

# 使用DataLoader加载数据
train_loader = DataLoader(train_dataset, batch_size=64, shuffle=True)
test_loader = DataLoader(test_dataset, batch_size=64, shuffle=False)

2.5 实用工具

torchvision还提供了一些实用工具，如torchvision.utils.make_grid，可以将多个图像拼接成一个网格图像，便于可视化。

from torchvision import utils
import matplotlib.pyplot as plt

# 获取一批图像
images, _ = next(iter(train_loader))

# 将图像拼接成网格
grid = utils.make_grid(images)

# 显示图像
plt.imshow(grid.permute(1, 2, 0))
plt.show()

3. 小结

‌TorchVision是PyTorch生态系统中的关键库，专为计算机视觉设计，提供数据集、预训练模型、图像转换工具和实用功能‌。它简化了视觉项目的开发，支持数据加载、预处理、模型迁移学习等，是构建和训练计算机视觉模型的重要工具‌

原文地址：https://blog.csdn.net/evm_doc/article/details/145229071

免责声明：本站文章内容转载自网络资源，如侵犯了原著者的合法权益，可联系本站删除。更多内容请关注自学内容网（zxcms.com）！

上一篇：Spring Boot spring.factories文件详细说明
下一篇：统信V20 1070e X86系统编译安装PostgreSQL-13.11版本以及主从构建

【2024年华为OD机试】 (B卷,100分)- 路灯照明问题（Java & JS & Python&C/C++）
该代码首先读取一组区间的半径，并计算每个区间的起始和结束位置。然后对这些区间进行排序，确保它们按起始位置升序排列。接着遍历这些区间，计算它们之间的间隙总和。最终输出区间间隙的总和。输入获取读取区间的数
阅读更多2025-01-20
MySQL基于gtid的主从同步配置
【代码】MySQL基于gtid的主从同步配置。
阅读更多2025-01-20
专业数据分析不止于Tableau，四款小众报表工具解析
在众多的报表工具中，市场上的常见报表工具如Tableau、PowerBI等被广泛使用，但一些小众工具也提供了独特的功能和优势。以下是四款小众报表工具的介绍，它们各具特色，适合不同需求的用户，下面就为大
阅读更多2025-01-20
2025年入职/转行网络安全，该如何规划？网络安全职业规划
网络安全已经成为全球企业和政府的首要任务之一。从信息泄露到国家级的网络战，网络安全的挑战正在变得越来越复杂。随着数字化转型的推进，互联网、云计算、大数据、物联网等技术的发展，带来了新的安全风险。因此，
阅读更多2025-01-20
Java 语言基础概述
什么是JDK，JREJDK是提供给Java开发人员使用的，其中包含了java的开发工具，也包括了 JRE。所以安装了JDK，就不用在单独安装JRE了。 其中的开发工具：编译工具(javac.exe)
阅读更多2025-01-20
grafana + Prometheus + node_exporter搭建监控大屏
本文介绍生产系统监控大屏的搭建，比较实用也是实际应用比较多的方式，希望能够帮助大家对监控系统有一定的认识。
阅读更多2025-01-20
JSON-stringify和parse
【代码】JSON-stringify和parse。
阅读更多2025-01-20
算法的标准描述（pseudocode）（TODO）
过去两年看了很多算法，描述和之前的还是不同，国内好像用得不多。一直说抽时间总结总结。如果以后要去投稿，还要用这种写法。卡尔曼滤波的pseudocode。
阅读更多2025-01-20
【JAVA项目】基于ssm的【游戏美术外包管理信息系统】
其次，系统能够对游戏美术外包的各个环节进行有效的管理，包括需求管理、应征管理、流程追踪管理、在线交流管理以及在线回复管理等。系统简介：管理员登录进入游戏美术外包管理信息系统可以查看首页，个人中心，用户
阅读更多2025-01-20
十一、apply家族（4）
【代码】十一、apply家族（4）
阅读更多2025-01-20