文件列表:
东吴证券:汽车行业点评报告:AI系列深度05期:模型如何学习表征并实现对齐?.pdf |
下载文档 |
资源简介
>
投资要点
表征如何组织、如何学习、如何跨模态共享?嵌入、自监督学习和CLIP分别对应三层机制:嵌入是表征的工程形态,自监督是表征的规模化学习机制,CLIP和多模态对齐则让图像与文字进入同一语义空间。本篇位于“表征是什么”与CNN/ViT、Transformer等具体架构之间,是理解后续技术路线的基础环节。
嵌入的本质,是把文本、图像、商品、用户等对象映射为数字向量,并使语义相近的对象在向量空间中距离更近。由此,搜索、推荐、以图搜图、向量数据库和RAG等应用,都可被理解为在高维向量空间中进行近邻检索。嵌入是抽象表征最可操作、最工程化的呈现方式。
自监督学习是通用表征规模化形成的关键机制。该方法不依赖人工逐条标注,而是利用数据自身构造训练信号,通过掩码预测、对比学习、下一个token预测等任务学习上下文、语义和结构关系。BERT、MAE、GPT等路线任务形式不同,但均通过大规模自监督训练形成可迁移表征,这是预训练获得通用能力的重要基础。
CLIP的意义在于把图像和文字对齐到同一表征空间。通过海量图文配对和对比学习,模型将正确配对的图文向量拉近、错误配对推远,使文字概念与对应图像在向量空间中
加载中...
已阅读到文档的结尾了



