文件列表:
东吴证券:汽车行业深度报告:AI系列深度17期:视觉智能为何引入Transformer?.pdf |
下载文档 |
资源简介
>
投资要点
视觉Transformer化的本质,不是ViT对CNN的一次性替代,而是图像被token化、视觉归纳偏置回归、视觉基础模型形成的渐进过程。CNN之所以在AI1.0时代成为视觉核心架构,源于局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据高度契合;但同样的强先验也带来局部感受野、任务专用、封闭标签和全局建模不足等约束,构成Transformer进入视觉任务的前提。
Transformer进入视觉的关键,是ViT确立“图像patch即token”的表示方式,使二维图像可被改写为一维序列,并接入自注意力和大规模预训练范式。相较CNN,Transformer具备全局建模与长距离依赖更优、接口统一利于跨任务与跨模态、可扩展性强等优势,且归纳偏置较弱,在大规模预训练下更能释放数据规模价值;但视觉数据并非天然离散序列,且高分辨率、多尺度和空间先验需求更强,因此视觉演化路径与语言不同,更多表现为融合与再平衡,而非彻底替换。
本报告将视觉Transformer演进归纳为三大阶段、九个子阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN全局建模,ViT和DETR
加载中...
已阅读到文档的结尾了



