模型选择建议
图像分类首选ResNet系列(ResNet-50/101),资源受限场景选MobileNet或EfficientNet,追求极致精度可尝试Vision Transformer或ConvNeXt。
从LeNet到EfficientNet的演进历程
自2012年AlexNet在ImageNet竞赛中取得突破性成绩以来,卷积神经网络经历了飞速发展。 从LeNet的雏形,到VGG的深度探索,再到ResNet的残差革命,每一代架构都带来了重要的技术突破。
Yann LeCun提出,用于手写数字识别。奠定CNN基础架构:卷积-池化-全连接。
深度学习复兴之作,引入ReLU、Dropout、数据增强,在ImageNet上取得突破。
探索网络深度,使用小卷积核(3x3)堆叠,证明深度对性能的重要性。
引入Inception模块,多尺度特征提取,大幅减少参数量。
残差连接解决深层网络训练难题,可训练上百层网络,成为现代网络基石。
密集连接,每一层与前面所有层连接,特征重用,参数效率高。
| 架构 | 深度 | 参数量 | Top-1准确率 | 核心创新 |
|---|---|---|---|---|
| LeNet-5 | 5层 | ~60K | - | CNN基本架构 |
| AlexNet | 8层 | ~60M | 63.3% | ReLU, Dropout |
| VGG-16 | 16层 | ~138M | 71.5% | 小卷积核堆叠 |
| ResNet-50 | 50层 | ~25M | 76.1% | 残差连接 |
| ResNet-152 | 152层 | ~60M | 78.3% | 残差连接 |
| DenseNet-121 | 121层 | ~8M | 74.9% | 密集连接 |
ResNet
H(x) = F(x) + x
解决梯度消失
多尺度卷积
1x1, 3x3, 5x5并行
捕获多尺度特征
DenseNet
特征重用
参数高效
图像分类首选ResNet系列(ResNet-50/101),资源受限场景选MobileNet或EfficientNet,追求极致精度可尝试Vision Transformer或ConvNeXt。