×
img

摩尔线程:2026年MTT S5000 Prefill-as-a-Service技术白皮书

发布者:wx****ad
2026-08-31
2 MB 25 页
互联网
文件列表:
摩尔线程:2026年MTT S5000 Prefill-as-a-Service技术白皮书.pdf
下载文档

大模型推理服务正从短上下文、单请求的简单形态,演进为以Agent、AICoding与长文档分析为代表的超高并发、长上下文在线系统。在此背景下,Prefill(预填充)与Decode(解码)两个阶段在计算特性与硬件资源诉求上的根本差异日趋凸显:Prefill为计算密集型负载,受浮点算力约束;Decode为访存密集型负载,受显存带宽约束。在传统同构混部架构中,两者共享同一GPU、同一显存、同一调度域,由此引发双重困境--长Prefil挤占调度窗口导致尾延迟(P99/ITL)离散化恶化,而同构扩容因两类负载资源诉求相背离而只会加剧错配。


加载中...

本文档仅能预览20页

继续阅读请下载文档

网友评论>