×
img

东吴证券:汽车行业深度报告:AI系列深度26期:云端基座模型如何在毫秒级车端跑起来

发布者:wx****f6
2026-08-07
784 KB 11 页
汽车 东吴证券
文件列表:
东吴证券:汽车行业深度报告:AI系列深度26期:云端基座模型如何在毫秒级车端跑起来.pdf
下载文档
投资要点 学术缩放定律与车端工程约束对应不同的优化目标。Kaplan、Chinchilla等缩放定律讨论的是给定训练算力下参数量、数据量与损失之间的最优关系,其“最优”指向训练算力前沿,并未把推理成本和毫秒级实时时延纳入目标函数。将推理成本显式纳入后,部署最优点会向更小模型、更多训练数据偏移;智能驾驶则进一步强化了这一部署约束。 车端实时性构成大模型上车的核心约束。自动驾驶模型必须在固定车规算力上满足帧率、端到端时延和功能安全要求,大型视觉Transformer叠加大语言模型难以在现有车规算力下持续满足高频推理要求。理想披露VLA推理帧率约10Hz,NVIDIAAlpamayo-R1论文披露端到端推理时延99ms,小鹏称第二代VLA指令输出时延压缩至80ms以内。 云端基座模型的效率优化主要可归纳为两类路径:一是通用模型稀疏化和注意力/KV缓存压缩,如MoE、MLA、MTP、FP8、线性注意力等;二是面向驾驶的视觉Token剪枝、动态/隐式Token和思维链压缩,用更少Token承载关键场景信息。其目标是在云端继续探索能力上限,同时降低长序列和多模态推理成本。 车端时延压缩更强调可部署

加载中...

已阅读到文档的结尾了

下载文档

网友评论>