文件列表:
东吴证券:汽车行业深度报告:AI系列深度23期:智能驾驶的表征演进.pdf |
下载文档 |
资源简介
>
投资要点
物理AI与数字AI的根本差异,首先体现在表征获取方式上。文本天然离散且带语义,数字AI输入具备较强可token化基础;物理世界的输入则由连续光子、点云、运动和空间关系构成,缺乏天然通用的物理世界token化方案。因此,物理AI需要先构建三维物理空间的可学习表征,再进入规划、控制和行动。
以智能驾驶为例,表征演进可概括为原始像素、BEV/VectorNet、Occupancy、多模态Token和潜在状态五个阶段。原始像素端到端简洁但缺少结构约束;BEV+Transformer与矢量化VectorNet是同一层级的两条并行路线,分别以特斯拉和Waymo为代表,前者把多摄像头信息统一到鸟瞰三维空间,后者把道路和参与者抽象成数学对象;Occupancy从识别对象类别转向判断空间占据;多模态Token连接视觉、语言和动作;潜在状态则把世界压缩到可预测空间。
物理AI中的token化器本质上是重型编码网络。文本分词通常只是把离散符号映射为token,而车端BEV编码器、占用网络、VAE、3D编码器等承担了从连续物理输入到可学习表征的核心转换。离散化和嵌入不是预先给定的,而是由网络学习形成
加载中...
已阅读到文档的结尾了



