目录
第1章绪论/1
1.1深度学习的背景1
1.1.1深度学习的基本概念1
1.1.2深度学习的发展史2
1.1.3深度学习的三要素6
1.2深度学习的框架8
1.2.1国外深度学习的框架8
1.2.2国内深度学习的框架11
1.3深度学习的研究内容12
1.3.1深度学习的网络模型12
1.3.2深度学习的关键技术14
1.3.3模型评估与可解释性15
1.4深度学习的研究领域16
1.4.1计算机视觉16
1.4.2自然语言处理18
1.4.3语音与音频处理19
1.4.4金融风险评估20
1.4.5医疗诊断20
1.4.6自动驾驶22
1.4.7工业优化23
1.4.8科学计算24
1.5小结25
思考题25
第2章深度学习中的数学基础/26
2.1深度学习中的线性代数26
2.1.1向量与矩阵26
2.1.2矩阵运算27
2.1.3仿射变换28
2.1.4矩阵范数28
2.1.5线性代数的应用292.2深度学习中的微积分29
2.2.1导数基础30
2.2.2偏导数基础31
2.2.3函数梯度31
2.2.4链式法则31
2.2.5微积分的应用32
2.3深度学习中的概率论33
2.3.1概率分布33
2.3.2多元高斯分布34
2.3.3贝叶斯定理35
2.3.4期望和方差35
2.3.5随机过程36
2.3.6概率论的应用36
2.4深度学习中的信息论37
2.4.1信息量和熵37
2.4.2交叉熵38
2.4.3信息论的应用38
2.5小结39
思考题40
第3章人工神经网络/41
3.1神经网络的发展史41
3.2神经元与神经网络42
3.2.1生物神经元结构42
3.2.2神经元数学模型43
3.2.3神经网络的结构45
3.2.4神经网络的学习45
3.3BP神经网络46
3.3.1单层感知机的模型46
3.3.2BP神经网络的结构47
3.3.3BP神经网络的学习48
3.3.4BP神经网络的特点50
3.4BP神经网络的应用51
3.4.1故障诊断51
3.4.2PID控制器53
3.5径向基函数网络54
3.5.1径向基函数的定义55
3.5.2RBF网络的学习55
3.5.3RBF网络的特点56
3.6Hopfield神经网络56
3.6.1Hopfield神经网络模型57
3.6.2Hopfield神经网络的学习58
3.6.3Hopfield神经网络的特点60
3.6.4Hopfield神经网络的应用60
3.7随机神经网络62
3.7.1Boltzmann机的模型62
3.7.2Boltzmann机的应用63
3.8小结63
思考题64
第4章卷积神经网络/65
4.1数字图像的特征65
4.1.1图像特征的概念65
4.1.2图像特征的提取67
4.2卷积运算68
4.2.1卷积运算的概念68
4.2.2卷积运算的过程68
4.3CNN的结构72
4.3.1卷积层73
4.3.2池化层73
4.3.3非线性激活层74
4.3.4全连接层75
4.3.5归一化指数层76
4.4CNN的训练77
4.5CNN的特点78
4.6CNN的类型79
4.6.1VGG网络79
4.6.2GoogLeNet网络79
4.6.3ResNet网络81
4.6.4DenseNet网络81
4.7CNN的应用82
4.8小结84
思考题84
第5章循环神经网络/86
5.1序列的特征86
5.1.1序列的概念86
5.1.2序列的意义87
5.2循环神经网络的模型88
5.2.1RNN的结构88
5.2.2RNN的训练89
5.2.3RNN的实现89
5.3LSTM神经网络90
5.3.1LSTM的结构91
5.3.2LSTM的特点93
5.4GRU神经网络94
5.4.1GRU的结构95
5.4.2GRU的特点98
5.5梯度消失和梯度爆炸98
5.6RNN的应用100
5.6.1文本生成101
5.6.2神经机器翻译101
5.6.3情感分析102
5.6.4股票预测103
5.6.5语音处理103
5.6.6图像描述104
5.7小结104
思考题105
第6章生成对抗网络/106
6.1图像空间的概述106
6.1.1图像数据空间106
6.1.2图像数据分布107
6.2生成对抗网络的模型107
6.2.1GAN的结构107
6.2.2GAN的原理109
6.2.3GAN的训练110
6.2.4GAN的本质111
6.2.5GAN的理论112
6.2.6GAN的特点114
6.3CGAN网络114
6.3.1CGAN的特点114
6.3.2CGAN的结构115
6.3.3CGAN的原理115
6.3.4CGAN的训练116
6.4CycleGAN网络116
6.4.1CycleGAN的特点116
6.4.2CycleGAN的结构117
6.4.3CycleGAN的原理117
6.5GAN的应用119
6.5.1数据增强119
6.5.2图像处理120
6.5.3语言处理122
6.5.4视频处理122
6.6GAN的伦理挑战123
6.7小结124
思考题125
第7章变分自编码器/127
7.1自编码器模型127
7.1.1自编码器的结构127
7.1.2自编码器的特点128
7.2变分自编码器的模型129
7.2.1VAE的背景129
7.2.2VAE的结构130
7.2.3VAE的理论基础132
7.2.4VAE的重参数化134
7.2.5VAE的训练135
7.2.6VAE的特点137
7.3VAE的应用137
7.4小结140
思考题140
第8章Transformer网络/142
8.1Transformer模型的发展史142
8.2Transformer模型的原理143
8.2.1Transformer模型的通用架构143
8.2.2EncoderDecoder结构143
8.3Transformer模型的编码器146
8.3.1位置编码146
8.3.2多头自注意力机制149
8.3.3残差连接与层归一化155
8.3.4前馈神经网络156
8.3.5编码器总览156
8.4Transformer模型的解码器157
8.4.1掩码多头自注意力机制158
8.4.2多头交叉注意力机制159
8.4.3线性层和Softmax层161
8.4.4解码器总览162
8.5Transformer的变体162
8.5.1LLM162
8.5.2BERT模型165
8.5.3GPT模型167
8.5.4预训练微调技术168
8.5.5LLM幻觉问题169
8.6Transformer模型的应用170
8.6.1机器翻译170
8.6.2文本摘要171
8.6.3问答系统173
8.6.4图像分类174
8.7小结175
思考题176
第9章YOLO网络/179
9.1目标检测179
9.1.1目标检测的概念179
9.1.2目标检测的思想180
9.1.3目标检测的算法180
9.1.4目标检测的框架182
9.1.5YOLO发展史183
9.2初级版本YOLOv1185
9.2.1YOLOv1的检测原理185
9.2.2YOLOv1的整体架构187
9.2.3YOLOv1的损失函数188
9.2.4YOLOv1的特点189
9.3经典版本YOLOv5190
9.3.1YOLOv5的输入端190
9.3.2YOLOv5的主干网络191
9.3.3YOLOv5的颈部网络192
9.3.4YOLOv5的检测头网络192
9.3.5YOLOv5的特点194
9.4进阶版本YOLOv12194
9.4.1YOLOv12的架构195
9.4.2YOLOv12的特点196
9.5YOLO网络的应用197
9.5.1自动驾驶197
9.5.2安防监控197
9.5.3工业检测199
9.5.4医疗影像201
9.6小结203
思考题204
第10章扩散模型网络/206
10.1扩散模型的背景206
10.1.1扩散模型的思想206
10.1.2扩散模型的特点207
10.1.3扩散模型的原理208
10.2去噪扩散概率模型209
10.2.1DDPM的前向扩散过程209
10.2.2DDPM的反向扩散过程211
10.2.3DDPM的训练过程214
10.2.4DDPM的网络架构215
10.3稳定扩散模型216
10.3.1模型的整体架构217
10.3.2模型的训练过程218
10.4扩散模型的变体219
10.4.1DALLE模型219
10.4.2Imagen模型221
10.5扩散模型的应用222
10.5.1图像处理222
10.5.2多模态224
10.5.3自然语言处理225
10.5.4人工智能驱动的科学研究226
10.6小结227
思考题228
第11章知识蒸馏网络/229
11.1知识蒸馏技术229
11.1.1知识蒸馏的背景229
11.1.2知识蒸馏的基本框架231
11.1.3知识蒸馏的工作原理232
11.2知识蒸馏的方式234
11.2.1离线蒸馏方法234
11.2.2在线蒸馏方法234
11.2.3自蒸馏方法234
11.3深度迁移学习235
11.3.1深度迁移学习的背景235
11.3.2深度迁移学习的原理236
11.3.3深度迁移学习的分类236
11.3.4迁移学习和知识蒸馏的异同点239
11.4知识蒸馏的应用240
11.4.1计算机视觉240
11.4.2自然语言处理240
11.4.3语音识别241
11.4.4推荐系统241
11.5小结242
思考题242
第12章深度学习性能评估/244
12.1判别网络模型和生成网络模型244
12.1.1判别网络模型244
12.1.2生成网络模型244
12.2模型评估和泛化能力246
12.2.1训练误差与测试误差246
12.2.2模型的泛化能力247
12.2.3过拟合与欠拟合248
12.3消融实验设计和指标250
12.3.1设计步骤251
12.3.2交叉验证252
12.3.3通用参数255
12.3.4损失函数256
12.3.5优化器258
12.3.6评价指标259
12.4小结263
思考题264
附录A深度学习环境配置和上机指南/266
附录B深度学习实验指导手册/278
参考文献/299
