文件列表:
东吴证券:汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?.pdf |
下载文档 |
资源简介
>
投资要点
视觉骨干网络是机器视觉系统的核心模块,其作用是把原始像素转化为高层语义特征,并决定分类、检测、分割等下游任务上限。CNN与ViT是过去十余年最重要的两代视觉骨干,分别代表“将图像先验写入结构”和“将关系学习交给数据与规模”两种设计哲学;二者之争本质上是先验、数据和算力如何分工。
视觉架构大体经历四个阶段:手工特征时代依赖SIFT、HOG等专家设计;CNN崛起后,AlexNet、VGG、ResNet推动机器自动学习视觉特征;ViT通过把图像切成patch并当作token输入Transformer,使注意力机制进入视觉;2021年后,Swin、CoAtNet、ConvNeXt等推动CNN与ViT相互吸收,进入融合时代。
CNN的优势来自三项视觉归纳偏置:局部连接、权值共享和平移等变性。这些结构假设使模型在数据有限时更高效,也更适合端侧和实时部署;约束在于局部感受野逐层扩大,长程依赖建模较弱。ViT以自注意力实现第一层全局交互,弱先验、强规模化,在大数据预训练下上限更高,但对数据、算力和位置编码依赖更强。
核心争议在于ViT是否真正“强于”CNN,还是更多受益于更大数据和现代训练范
加载中...
已阅读到文档的结尾了



