深度学习方法 Ch.17 CNN、ViT与目标检测
本文围绕深度学习中的计算机视觉展开,首先阐述卷积神经网络(CNN)的核心概念,包括卷积核特征提取、局部连接与权值共享特性、池化层作用及卷积模式,并介绍VGGNet与GoogLeNet等典型架构。随后引入视觉Transformer(ViT),说明其将图像分割为patch并利用Transformer编码器处理的方式,以及Swin Transformer和PVT等变体。最后系统梳理目标检测模型的发展历程,涵盖R-CNN、YOLO、DETR及DINO等代表方法,并介绍MS COCO和PANDA数据集及AP、AR等评估指标。
more...










