天池大赛：街景字符编码识别——Part2：数据读取与数据扩增

街景字符编码识别

更新流程↓
Task01：赛题理解
 Task02：数据读取与数据扩增
 Task03：字符识别模型
 Task04：模型训练与验证
 Task05：模型集成
 底到镜一
 比赛链接

Part2：数据读取与数据扩增

文章目录

1. 数据读取

1.1. 图像读取

1.2. 总结

2. 数据扩增

3. Pytorch读取数据

1. 数据读取

1.1. 图像读取

接下来将简单介绍以下目前较为主流的Python图像库的基本使用方法

matplotlib	PIL(pillow)	OpenCV	skimage	imageio

1.1.1. matplotlib

matplotlib是Python的绘图库，与numpy一起使用可以算是一种matlab开源替代方案，在科学绘图领域被广泛使用。当然，用来读取图像自然不在话下。
使用plt.imread()读取图片将其储存为一个RGB像素值矩阵，再进行处理。故其可以与opencv或pillow结合使用，只需要传入像素值矩阵，matplotlib便可以接手处理接下来想要完成的操作。

import matplotlib.pyplot as plt					# 导入matplotlib库
import numpy as np								# 导入numpy库

img = plt.imread('PicPath/PicName.jpg')			# 读取图片
print(img.shape)								# 输出(高度h,宽度w,通道数c)
print(img.size)									# 输出像素总数目
print(img.dtype)								# 输出图片类型,uint8为[0-255]
print(img)										# 输出所有像素的RGB值,一个像素RGB为[0-255 0-255 0-255]
plt.imshow(img)									# 将图片img插入画布
plt.axis('off')									# 座标轴刻度不显示
plt.show()										# 展示画布

imgR = image[:,:,0] 							# R通道,热量图
plt.imshow(imgR)								# 将热量图插入画布
plt.show()										# 展示画布

plt.imshow(imgR,cmap='Greys_r')					# 将灰度图插入画布
plt.show()										# 展示画布

figure = plt.figure(figsize=(80,40)) 			# 调整显示画布宽80,高40/英寸
img1 = plt.imread('PicPath/PicName1.jpg')		# 读取图片1
img2 = plt.imread('PicPath/PicName2.jpg')		# 读取图片2

plt.axis("off")									# 画布座标轴刻度不显示
ax = figure.add_subplot(121) 					# 画布以1行2列的形式显示，设置图片定位为序列1
plt.axis('off')									# 子图1座标轴刻度不显示
ax.imshow(img1) 								# 将图片1插入子图1
ax.set_title('title1')							# 给子图1加标题
ax = figure.add_subplot(122) 					# 画布以1行2列的形式显示，设置图片定位为序列2
plt.axis('off')									# 子图2座标轴刻度不显示
ax.imshow(img2)  								# 将图片2插入子图2
ax.set_title('title2')							# 给子图2加标题
plt.savefig('PicX.jpg')							# 保存画布命名为PicX.jpg
plt.show()										# 展示画布

1.1.2. PIL(pillow)

PIL即Python Imaging Library，而pillow是PIL的一个分支。pillow提供了常见的图像读取和处理的操作，它比opencv更为轻巧，且可以与ipython notebook无缝集成。
使用Image.open()读取图片储存为一个对象，并非是numpy矩阵。

from PIL import Image							# 导入PIL库
import numpy as np								# 导入numpy库

img = Image.open('PicPath/PicName.jpg')			# 读取图片
imgL = Image.open('PicName.jpg').convert('L')	# 读取图片灰度图
imgL.show()										# 展示灰度图
img1 = img.copy() 								# 复制图片
print(img.format) 								# 输出图片格式
print(img.size) 								# 输出图片(宽度w,高度h)
print(img.mode)  								# 输出图片类型,L为灰度图,RGB为真彩色,RGBA为RGB+Alpha透明度
im.show()										# 展示画布

imgData = np.array(img)							# 将对象img转化为RGB像素值矩阵
print(imgData.shape)							# 输出图片(宽度w,高度h,通道c)
print(imgData.dtype)							# 输出图片类型,uint8为[0-255]
print(imgData)									# 输出所有像素的RGB值
imgN = Image.fromarray(imgData)					# 将RGB像素值矩阵转化为对象imgN
imgN.save('PicName.jpg')						# 储存为文件PicName.jpg

r, g, b = img.split()							# 分离通道
img = Image.merge("RGB", (b, g, r))				# 合并通道

# ROI(region of interest),只对ROI区域操作
roi = img.crop((0,0,300,300)) 					# (左上x，左上y，右下x，右下y)座标
roi.show()										# 展示ROI区域

#捕捉异IOError,为读取图片失败
try:
    img = Image.open('PicName.jpg')
except IOError:
    print('image failed to load')

1.1.3. OpenCV

OpenCV是一个跨平台的计算机视觉库。其发展非常早，拥有众多的计算机视觉、数字图像处理和机器视觉等功能，OpenCV是今天介绍得所有图像库中最全面也最强大的库，学习成本也相对要高很多。
使用cv2.imread读取图片将其储存为一个BGR像素值矩阵，故若要结合使用matplotlib则要先进行转化。

import cv2										# 导入OpenCV库
import numpy as np								# 导入numpy库
 
img = cv2.imread('PicName.jpg',0)				# 读取图片：灰度模式
img = cv2.imread('PicName.jpg',-1)				# 读取图片：BRGA模式(BRG+Alpha通道)
img = cv2.imread('PicName.jpg',1)				# 读取图片：BRG模式
img = cv2.imread('PicName.jpg')					# 读取图片：第二参数默认为1，BRG模式
img = cv2.cvtColor(img,cv2.COLOR_BGR2RGB)		# 将颜色通道从BRG转为RGB
if img == None:									# 读取图片失败
	print('image failed to load')
cv2.imshow('src',img)							# 图片源src为img
print(img.shape) 								# 输出图片(高度h,宽度w,通道c)
print(img.size) 								# 像素总数目
print(img.dtype)								# 输出图片类型,uint8为[0-255]
print(img)										# 输出所有像素的RGB值
cv2.waitKey()									# 按键关闭窗口
# waitKey(delay)函数的功能是不断刷新图像，频率时间为delay，单位为ms，返回值为当前键盘按键值
# waitKey() 是在一个给定的时间内(单位ms)等待用户按键触发; 如果用户没有按下键,则接续等待(循环)

imgL = cv2.cvtColor(img,cv2.COLOR_BGR2GRAY)		# 读取img灰度图
cv2.imshow('gray',imgL)							# 图片源gray为imgL
cv2.imwrite('imgL.jpg',imgL)  					# 将imgL储存名为imgL.jpg的图片
print(imgL.shape)								# 输出图片(高度h,宽度w)
print(imgL.size)								# 像素总数目
print(imgL)										# 输出所有像素的灰度值
cv2.waitKey()									# 按键关闭窗口

img = img.transpose(2,0,1)						# 图片矩阵变换为(通道c,高度h,宽度w)
img = np.expand_dims(img, axis=0)				# 图片矩阵扩展维度添加在第一维
print(img.shape)								# (1,通道c,高度h,宽度w)

# 图片归一化处理
img = cv2.imread('PicName.jpg')						
img = img.astype("float") / 255.0  				# 转化数据类型为float后进行归一化
print(img.dtype)								# 输出为：float64
print(img)               						# 输出为[0-1 0-1 0-1]


print(img[10,10])  								# 访问图片img像素[10,10],输出 [0-255 0-255 0-255]
print(imgL[10,10]) 								# 访问灰色图片img像素[10,10],输出 0-255
img[10,10] = [255,255,255]						# 修改图片img像素点[10,10]为[255,255,255]
imgL[10,10] = 255								# 修改灰色图片img像素点[10,10]为255
img[:,:,2] = 0  								# 将R通道全部修改为0


roi = img[200:550,100:450,:]					# ROI操作,座标(高度范围,宽度范围,通道范围)
cv2.imshow('roi',roi)							# 图片源roi为roi
cv2.waitKey()									# 按键关闭窗口

1.1.4. skimage

skimage包的全称是scikit-image SciKit (toolkit for SciPy) ，它对scipy.ndimage进行了扩展，提供了更多的图片处理功能。它是由python语言编写的，由scipy 社区开发和维护。skimage包由许多的子模块组成，各个子模块提供不同的功能。
使用io.imread()读取图片将其储存为一个RGB像素值矩阵。

from skimage import io							# 导入skimage库
from skimage import color
import numpy as np								# 导入numpy库
 
img = io.imread('PicName.jpg')					# 读取图片
imgL = io.imread('PicName.jpg',as_grey=True)  	# 读取图片：灰度模式
print(img.shape) 								# 输出图片img(高度h,宽度w,通道c)
print(imgL.shape) 								# 输出图片imgL(高度h,宽度w)
print(img.size)									# img像素总数目
print(img.dtype)								# 输出img图片类型,uint8为[0-255]
print(imgL.dtype)								# 输出imgL图片类型,float64为[0-1],已经被归一化
print(img)										# 输出img所有像素的RGB值
print(imgL)										# 输出imgL所有灰度值,长度为imgL.size的numpy数组
io.imsave('img.png',img)						# 将img储存名为img.png的图片
io.imshow(img)									# 图片img插入画板
io.show()										# 展示画板

imgl = io.imread('PicName.jpg')					# 读取图片
imgl = color.rgb2grey(imgl)						# 转换为灰度模式
print(imgl.dtype)								# 以下数据同imgL
print(imgl.size)
print(imgl.shape)
io.imshow(imgl)
io.show()

'''
skimage.color.rgb2grey(rgb)
skimage.color.rgb2hsv(rgb)
skimage.color.rgb2lab(rgb)
skimage.color.gray2rgb(image)
skimage.color.hsv2rgb(hsv)
skimage.color.lab2rgb(lab)
'''

1.1.5. imageio

Imageio是一个Python库，提供了一个简单的接口用于读取和写入各种图像数据，包括动画图像，视频，体积数据和科学格式。
使用io.imread()读取图片将其储存为一个RGB像素值矩阵。

import imageio									# 导入imageio库
img = imageio.imread('PicName.jpg')				# 读取图片
imageio.imsave('img.png',img)					# 将img储存名为img.png的文件
print(img.shape) 								# 输出图片img(高度h,宽度w,通道c)
print(img.size)									# img像素总数目
print(img.dtype)								# 输出img图片类型,uint8为[0-255]
print(img)										# 输出img所有像素的RGB值
plt.imshow(img)									# 图片img插入画板
plt.show()										# 展示画板

1.2. 总结

其他图像库读取彩色图片都以RGB形式储存，而OpenCV则是以BGR形式存储。
其他图像库读取图片都以numpy十六进制彩色值形式储存，而PIL读取图片是以对象形式储存。

2. 数据扩增

为了增加数据量、丰富数据多样性、提高模型的泛化能力，同时也可以有效缓解模型过拟合的情况，给模型带来的更强的泛化能力。我们可以不实际增加原始数据，只是对原始数据做一些变换，从而创造出更多的数据。我们只需要对现有数据集进行微小改动，例如裁剪或灰度变换或翻转(数字6与9翻转会发生交换) 。无论如何，我们的神经网络会认为这些是不同的图像。从而完成数据扩增（Data Augmentation）操作。

2.1. 数据扩增方法

数据扩增方法有很多：从颜色空间、尺度空间到样本空间，同时根据不同任务数据扩增都有相应的区别。
对于图像分类，数据扩增一般不会改变标签；对于物体检测，数据扩增会改变物体座标位置；对于图像分割，数据扩增会改变像素标签。

几何变换：弹性变换（Elastic Transform）、透视变换（Perspective Transform）、分段仿射变换（Piecewise Affine transforms）、枕形畸变（Pincushion Distortion）；随机改变大小（resize），随机缩放、水平翻转（flip），竖直翻转（mirror）；
加噪声：对主成分做一个(0, 0.1)的高斯扰动。
PCA Jittering（颜色改变）：首先按照RGB三个颜色通道计算均值和标准差，对网络的输入数据进行规范化，随后我们在整个训练集上计算了协方差矩阵，进行特征分解，得到特征向量和特征值，用来做PCA Jittering。对RGB空间做PCA，然后对主成分做一个(0, 0.1)的高斯扰动。结果让错误率又下降了1%。
对比度和亮度：给图像增加一些随机的光照，对比度受限自适应直方图均衡化算法（Clahe），锐化（Sharpen），凸点（Emboss）
随机色相、饱和度、明度（HSV）变换
彩图到灰度转换（Color to Gray）
将灰度图重新映射到随机颜色的图像中
模糊（Blur）、一般模糊（Median Blur）、非常模糊（Motion Blur）

方法	中文说明
transforms.CenterCrop	对图片中心进行裁剪
transforms.ColorJitter	对图像颜色的对比度、饱和度和零度进行变换
transforms.FiveCrop	对图像四个角和中心进行裁剪得到五分图像
transforms.Grayscale	对图像进行灰度变换
transforms.Pad	使用固定值进行像素填充
transforms.RandomAffine	随机仿射变换
transforms.RandomCrop	随机区域裁剪
~~transforms.RandomHorizontalFlip~~	~~随机水平翻转~~
~~transforms.RandomRotation~~	~~随机旋转~~
~~transforms.RandomVerticalFlip~~	~~随机垂直翻转~~

2.2. 常用的数据扩增库

2.2.1.torchvision

pytorch官方提供的数据扩增库，提供了基本的数据数据扩增方法，可以无缝与torch进行集成；但数据扩增方法种类较少，且速度中等；

2.2.2. imgaug

imgaug是常用的第三方数据扩增库，提供了多样的数据扩增方法，且组合起来非常方便，速度较快；

2.2.3. albumentations

是常用的第三方数据扩增库，提供了多样的数据扩增方法，对图像分类、语义分割、物体检测和关键点检测都支持，速度较快。

3. Pytorch读取数据

本次赛题我们使用Pytorch读取赛题数据。
在Pytorch中数据是通过Dataset进行封装，并通过DataLoder进行并行读取。所以我们只需要重载一下数据读取的逻辑，之后我们将在定义好的Dataset基础上构建DataLoder，DataLoder是为了实现不同于Dataset的功能。

Dataset：对数据集的封装，提供索引方式的对数据样本进行读取
DataLoder：对Dataset进行封装，提供批量读取的迭代读取

import os, sys, glob, shutil, json
import cv2

from PIL import Image
import numpy as np

import torch
from torch.utils.data.dataset import Dataset
import torchvision.transforms as transforms

class SVHNDataset(Dataset):
    def __init__(self, img_path, img_label, transform=None):
        self.img_path = img_path
        self.img_label = img_label 
        if transform is not None:
            self.transform = transform
        else:
            self.transform = None

    def __getitem__(self, index):
        img = Image.open(self.img_path[index]).convert('RGB')

        if self.transform is not None:
            img = self.transform(img)
        
        # 原始SVHN中类别10为数字0
        lbl = np.array(self.img_label[index], dtype=np.int)
        lbl = list(lbl)  + (5 - len(lbl)) * [10]
        
        return img, torch.from_numpy(np.array(lbl[:5]))

    def __len__(self):
        return len(self.img_path)

train_path = glob.glob('../input/train/*.png')
train_path.sort()
train_json = json.load(open('../input/train.json'))
train_label = [train_json[x]['label'] for x in train_json]

train_loader = torch.utils.data.DataLoader(
        SVHNDataset(train_path, train_label,
                   transforms.Compose([
                       transforms.Resize((64, 128)),				# 缩放到固定尺寸
                       transforms.ColorJitter(0.3, 0.3, 0.2),		# 随机颜色变换
                       transforms.RandomRotation(5),				# 加入随机旋转
                       transforms.ToTensor(),						# 将图片转换为pytorch 的tesntor
                       transforms.Normalize([0.485, 0.456, 0.406], [0.229, 0.224, 0.225])		# 对图像像素进行归一化
            ])), 
    batch_size=10, # 每批样本个数
    shuffle=False, # 是否打乱顺序
    num_workers=10, # 读取的线程个数
)

for data in train_loader:
    break

在加入DataLoder后，数据按照批次获取，每批次调用Dataset读取单个样本进行拼接。
此时data的格式为：torch.Size([10, 3, 64, 128]), torch.Size([10, 6])。
前者为图像文件，为batchsize * chanel * height * width次序，
后者为字符标签。

天池大赛：街景字符编码识别——Part2：数据读取与数据扩增

文章目录

1. 数据读取

1.1. 图像读取

1.1.1. matplotlib

1.1.2. PIL(pillow)

1.1.3. OpenCV

1.1.4. skimage

1.1.5. imageio

1.2. 总结

2. 数据扩增

2.1. 数据扩增方法

2.2. 常用的数据扩增库

2.2.1.torchvision

2.2.2. imgaug

2.2.3. albumentations

3. Pytorch读取数据

linux安装cuda和cudnn

模拟手机设备：使用 Playwright 实现移动端自动化测试

Mellanox网卡开启SR-IOV

全面系统的AI学习路径，帮助普通人也能玩转AI

HTML 00 Tutorial

uni-app实现上拉加载

vue3编译优化之“静态提升”

又是一个月-20240513

flask 如何保证返回json有序

linux服务器设置ssh免密

NLP學習-Task 4: Contextual Word Embeddings

NLP學習-Task 3: 子詞模型Subword Models

NLP學習-Task 2: 詞向量和詞義Word Senses

NLP學習-Task1：簡介和詞向量Word Vectors

騰訊精選練習（41/50) ：存在重複元素（LeedCode 217）

https://yachay.unat.edu.pe/blog/index.php?comment_area=format_blog&comment_component=blog&comment_co

linux以太網驅動總結