×
img

东吴证券:汽车行业点评报告:AI系列深度06期:Transformer如何从序列任务走向基座模型?

发布者:wx****7c
2026-07-30
554 KB 9 页
汽车 东吴证券
文件列表:
东吴证券:汽车行业点评报告:AI系列深度06期:Transformer如何从序列任务走向基座模型?.pdf
下载文档
投资要点 RNN与Transformer是序列建模的两代核心架构,解决文字、语音、视频和轨迹等有先后顺序的数据如何形成表征的问题。序列建模的难点在于变长、有序和长程依赖:模型既要保留上下文,又要把相距较远的相关信息联系起来。 RNN的基本思路是把历史压缩进一个随时间更新的隐藏状态。该结构推理成本相对恒定,适合早期机器翻译、语音识别和时间序列任务;LSTM、GRU通过门控机制缓解长程遗忘,Seq2Seq和注意力机制进一步推动模型更迭。但RNN必须逐步串行处理,难以充分利用并行算力,长距离信息也容易在压缩状态中衰减。 Transformer采取不同路径:不再把历史压缩成单一状态,而是用自注意力让每个位置直接与所有位置交互。多头注意力、位置编码和前馈层共同构成其结构基础,使训练可以并行、长程依赖路径显著缩短,并为模型规模化扩展提供架构基础。GPT、BERT以及后续LLM、VLM、VLA大多以Transformer为核心底座,反映其在云端通用基础模型中的主导地位。 两者分歧可归纳为记忆、计算和长程建模三组权衡:RNN以定长状态换取相对恒定的推理成本,但训练串行、记忆容量受限;Transform

加载中...

已阅读到文档的结尾了

下载文档

网友评论>