Skip to content

深度学习简介

什么是深度学习

深度学习(Deep Learning)是机器学习的一个子领域,它基于人工神经网络,通过多层非线性变换自动学习数据的层次化特征表示。"深度"指的是网络中隐层的数量较多,能够学习到从低级到高级的抽象特征。

神经网络基础

神经元模型

人工神经元是神经网络的基本单元,它模拟生物神经元的工作方式:接收多个输入信号,进行加权求和,再经过激活函数产生输出。

激活函数

激活函数为神经网络引入非线性,使其能够拟合复杂的函数关系。常见的激活函数包括:

  • Sigmoid:将输出映射到 (0, 1) 区间。
  • ReLUf(x) = max(0, x),计算简单,缓解梯度消失问题,是目前最常用的激活函数。
  • Tanh:将输出映射到 (-1, 1) 区间。

前向传播与反向传播

  • 前向传播:输入数据从输入层逐层传递到输出层,得到预测结果。
  • 反向传播:根据损失函数计算梯度,从输出层向输入层逐层更新权重,是最核心的训练算法。

经典网络结构

卷积神经网络(CNN)

CNN 专门用于处理具有网格结构的数据(如图像),通过卷积层提取局部特征、池化层降低维度,在计算机视觉领域取得了巨大成功。经典模型包括 LeNet、AlexNet、VGG、ResNet 等。

循环神经网络(RNN)

RNN 适合处理序列数据(如文本、时间序列),通过循环结构保留历史信息。LSTM 和 GRU 是其改进版本,有效缓解了长序列的梯度消失问题。

Transformer

Transformer 于 2017 年提出,基于自注意力机制(Self-Attention)并行处理序列数据,摆脱了 RNN 的顺序计算限制。它是当前大语言模型的核心架构。

深度学习的训练要素

训练一个深度学习模型通常需要:

  1. 数据:大规模、高质量的训练数据是模型效果的基础。
  2. 计算资源:GPU 等加速设备可以大幅提升训练效率。
  3. 优化算法:SGD、Adam 等优化器用于更新模型参数。
  4. 损失函数:衡量模型预测与真实值的差距,如交叉熵、均方误差。
  5. 正则化:Dropout、Batch Normalization 等技术防止过拟合。

深度学习的优势与挑战

优势:能够自动学习特征表示,省去手工特征工程的繁琐;在图像、语音、文本等领域达到甚至超越人类水平。

挑战:需要大量数据和计算资源;模型可解释性较差;容易过拟合;训练和推理成本较高。

分享人工智能、机器学习与大模型的学习笔记