文件列表:
东吴证券:汽车行业深度报告:AI系列深度18期:生成智能如何引入Transformer?.pdf |
下载文档 |
资源简介
>
投资要点
生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编码、骨干替换与多模态扩展四个环节渐进渗透,
以代表论文为锚,我们将2013年以来生成式视觉的发展划分为五个阶段:VAE与GAN奠基(2013—2015年)、GAN主导高真实感生成(2016
2019年)、扩散复兴与理论统一(2020—2021年)、文生图爆发(2022年)、DiT与视频/多模态扩展(2023年至今)。
Transformer进入生成式视觉领域,经历了由局部模块引入到核心架构替换的渐进式演进。早期阶段,Transformer主要作为自回归生成器,将文本与图像表示统一为离散token序列,实现视觉内容的序列化建模:2021年DALL·E将文本token与图像token联合建模,证明图像可被token化、并以类似语言模型的
加载中...
已阅读到文档的结尾了



