深度学习基础：卷积神经网络原理与LeNet解析

175 浏览量更新于2024-08-30 收藏 651KB PDF 举报

"《动手学深度学习》Task05涵盖了卷积神经网络的基础知识，包括二维卷积层、填充和步幅、多通道处理，以及池化操作，并介绍了经典的LeNet模型。此外，还深入讨论了卷积神经网络的进阶内容，如AlexNet、VGG、NiN和GoogLeNet等深度模型。" 卷积神经网络（CNN）是深度学习领域中用于图像处理和计算机视觉任务的关键结构。它们通过模拟人脑的视觉皮层工作原理，以识别和提取图像特征。 1. **二维卷积层**：是CNN中最基本的组件，用于对输入图像进行特征提取。卷积层通过应用一系列小的可学习滤波器（卷积核）在输入图像上滑动，执行二维互相关运算，生成特征图。特征图的每个元素反映了其对应输入区域的特征响应。 2. **填充（Padding）和步幅（Stride）**：填充是在输入边缘添加额外的零以保持输出尺寸不变；步幅定义了滤波器移动的步长。两者都影响着特征图的大小和模型的捕获细节的能力。 3. **多输入通道和多输出通道**：当处理彩色图像时，输入有多个通道（如红绿蓝RGB三个通道），卷积层可以处理这些通道，生成多输出通道的特征图，每个通道代表不同类型的特征。 4. **卷积层与全连接层对比**：全连接层处理所有输入单元与所有输出单元之间的连接，而卷积层则只连接输入局部区域与输出。这使得卷积层在处理高维数据时更加高效且参数数量相对较少。 5. **池化（Pooling）**：是降采样技术，常用于减少计算量和防止过拟合。常见的池化操作有最大池化和平均池化，它在特征图上滑动窗口并提取最大值或平均值。 6. **LeNet**：由Yann LeCun等人提出的早期CNN模型，主要用于手写数字识别。它包含卷积层、池化层和全连接层，展示了卷积神经网络在图像分类上的潜力。 7. **卷积神经网络进阶**：随着深度学习的发展，出现了许多更复杂的CNN结构，如AlexNet、VGG、NiN和GoogLeNet等。AlexNet首次在ImageNet比赛中击败传统方法，引入了ReLU激活函数和GPU加速；VGG以其深的网络结构和重复的3x3卷积层著称；NiN强调了网络模块化，提出了“块”概念；GoogLeNet引入了Inception结构，优化了计算效率和性能。这些基础知识和进阶模型共同构成了卷积神经网络的核心，对于理解和实现深度学习项目至关重要。通过动手实践，读者可以更好地掌握CNN的工作原理及其在实际问题中的应用。

《动手学深度学习》《动手学深度学习》Task05：卷积神经网络基础：卷积神经网络基础+LeNet+卷积神经网络进阶卷积神经网络进阶

文章目录文章目录1 卷积神经网络基础1.1 二维卷积层1.2 填充和步幅1.3 多输入通道和多输出通道1.4 卷积层与全连接层的对比1.4 池化2 LeNet2.1 LeNet 模型2.2 获取数据和训练模型3 卷积神经网络

进阶3.1 深度卷积神经网络（AlexNet）3.2 使用重复元素的网络（VGG）3.3 网络中的网络（NiN）3.4 GoogLeNet

1 卷积神经网络基础卷积神经网络基础

本节我们介绍卷积神经网络的基础概念，主要是卷积层和池化层，并解释填充、步幅、输入通道和输出通道的含义。

1.1 二维卷积层二维卷积层

本节介绍的是最常见的二维卷积层，常用于处理图像数据

二维互相关运算二维互相关运算

二维互相关（cross-correlation）运算的输入是一个二维输入数组和一个二维核（kernel）数组，输出也是一个二维数组，其中核数组通常称为卷积核或过滤器（filter）。卷积核的尺寸通常

小于输入数组，卷积核在输入数组上滑动，在每个位置上，卷积核与该位置处的输入子数组按元素相乘并求和，得到输出数组中相应位置的元素。图1展示了一个互相关运算的例子，阴影部

分分别是输入的第一个计算区域、核数组以及对应的输出。

二维卷积层二维卷积层

二维卷积层将输入和卷积核做互相关运算，并加上一个标量偏置来得到输出。卷积层的模型参数包括卷积核和标量偏置。

互相关运算与卷积运算互相关运算与卷积运算

卷积层得名于卷积运算，但卷积层中用到的并非卷积运算而是互相关运算。我们将核数组上下翻转、左右翻转，再与输入数组做互相关运算，这一过程就是卷积运算。由于卷积层的核数组

是可学习的，所以使用互相关运算与使用卷积运算并无本质区别。

特征图与感受野特征图与感受野

二维卷积层输出的二维数组可以看作是输入在空间维度（宽和高）上某一级的表征，也叫特征图（feature map）。影响元素x的前向计算的所有可能输入区域（可能大于输入的实际尺寸）

叫做x的感受野（receptive field）。

以图1为例，输入中阴影部分的四个元素是输出中阴影部分元素的感受野。我们将图中形状为2×2的输出记为Y，将Y与另一个形状为2×2的核数组做互相关运算，输出单个元素z。那么，z在

Y上的感受野包括Y的全部四个元素，在输入上的感受野包括其中全部9个元素。可见，我们可以通过更深的卷积神经网络使特征图中单个元素的感受野变得更加广阔，从而捕捉输入上更大

尺寸的特征。

1.2 填充和步幅填充和步幅

我们介绍卷积层的两个超参数，即填充和步幅，它们可以对给定形状的输入和卷积核改变输出形状。

填充填充

填充（padding）是指在输入高和宽的两侧填充元素（通常是0元素），图2里我们在原输入高和宽的两侧分别添加了值为0的元素。

图2 在输入的高和宽两侧分别填充了0元素的二维互相关计算

如果原输入的高和宽是nhn_hnh和nwn_wnw，卷积核的高和宽是khk_hkh和kwk_wkw，在高的两侧一共填充php_hph行，在宽的两侧一共填充pwp_wpw列，则输出形状为：

我们在卷积神经网络中使用奇数高宽的核，比如3×3，5×5的卷积核，对于高度（或宽度）

为大小为2k+1的核，令步幅为1，在高（或宽）两侧选择大小为k的填充，便可保持输入与输出尺寸相同。

步幅步幅

在互相关运算中，卷积核在输入数组上滑动，每次滑动的行数与列数即是步幅（stride）。此前我们使用的步幅都是1，图3展示了在高上步幅为3、在宽上步幅为2的二维互相关运算。

图3 高和宽上步幅分别为3和2的二维互相关运算

一般来说，当高上步幅为shs_hsh，宽上步幅为sws_wsw时，输出形状为：

如果ph=kh−1p_h=k_h−1ph=kh−1，pw=kw−1p_w=k_w−1pw=kw−1，那么输出形状将简

⌊(nh+sh−1)/sh⌋×⌊(nw+sw−1)/sw⌋⌊(n_h+s_h−1)/s_h⌋×⌊(n_w+s_w−1)/s_w⌋⌊(nh+sh−1)/sh⌋×⌊(nw+sw−1)/sw⌋。更进一步，如果输入的高和宽能分别被高和宽上的步幅整除，那么输出形状将是

(nh/sh)×(nw/sw)(n_h/s_h)×(n_w/s_w)(nh/sh)×(nw/sw)。

当ph=pw=pp_h=p_w=pph=pw=p时，我们称填充为p；当sh=sw=ss_h=s_w=ssh=sw=s时，我们称步幅为s。

1.3 多输入通道和多输出通道多输入通道和多输出通道

之前的输入和输出都是二维数组，但真实数据的维度经常更高。例如，彩色图像在高和宽2个维度外还有RGB（红、绿、蓝）3个颜色通道。假设彩色图像的高和宽分别是h和w（像素），那

么它可以表示为一个3×h×w的多维数组，我们将大小为3的这一维称为通道（channel）维。

多输入通道多输入通道

下载后可阅读完整内容，剩余9页未读，立即下载

weixin_38672800

粉丝: 4
资源: 917

深度学习基础：卷积神经网络原理与LeNet解析

深度学习Task05：卷积神经网络基础与实现

深度学习Pytorch入门：卷积神经网络详解

深度学习基础：卷积神经网络详解

动手学DL|Task5 LeNet+卷积神经网络进阶+循环神经网络进阶

动手学 task5 卷积神经网络基础；leNet；卷积神经网络进阶

深度学习基础：LeNet-5卷积神经网络解析

动手学深度学习 Task5 学习

动手学深度学习Pytorch Task05

【动手学深度学习】Task05笔记汇总

伯禹公益AI《动手学深度学习PyTorch版》Task 05 学习笔记

最新资源