×
img

东吴证券:汽车行业深度报告:AI系列深度19期:多模态如何从模型拼接走向统一?

发布者:wx****a9
2026-08-07
930 KB 15 页
汽车 东吴证券
文件列表:
东吴证券:汽车行业深度报告:AI系列深度19期:多模态如何从模型拼接走向统一?.pdf
下载文档
投资要点 多模态智能的本质,是把文本、图像、音频、视频等映射进统一表示,并在此基础上完成理解、推理、生成与交互。我们认为,多模态是AI2.0“架构、任务、模态三重收敛”在模态维度的集中兑现。 我们依据“模态对齐发生在流程的哪个阶段”,将多模态的发展过程划分三阶段:2021—2023年为外挂式/组合式阶段,CLIP、Flamingo、BLIP-2、LLaVA等通过视觉编码器、投影层、Q-Former或指令微调把图像接入语言模型;2023—2024年进入原生多模态阶段,Gemini代表多模态能力从接口层前移到预训练阶段;2024年至今进入全模态Omni阶段,GPT-4o将文本、视觉和音频输入输出纳入同一实时交互闭环。 沿三阶段看,主线是对齐位置不断前移、转换损耗逐级下降。外挂式阶段工程效率高,但图像先被视觉编码器压缩再送入语言模型,细节、空间关系和时序信息存在损耗;原生阶段让文本、图像、音频、视频从训练早期共同参与表示学习,提升复杂真实任务中的泛化能力,同时显著抬高数据、训练系统和跨模态对齐门槛;Omni阶段进一步将多模态从“统一预训练”推进到“实时统一交互”,补齐听、看、说的互动性。 我

加载中...

已阅读到文档的结尾了

下载文档

网友评论>