把记忆交给 CPU,大模型会变快
17 小时前

在大模型推理过程中,KV Cache作为存储前文计算中间结果的“记忆体”,会随着会话和请求规模的扩大而大量占用GPU显存,进而降低并发能力、增加重复计算并延长用户等待时间。为解决这一问题,可采用“以存代算”策略,让CPU负责记忆管理:根据KV Cache的活跃程度,将其分层存储在GPU显存、CPU内存和SSD等介质中。利用英特尔QAT专用硬件对缓存进行压缩,释放通用CPU核心资源,并结合KV Shrink等技术优化存储格式和调度策略。这样能在控制额外开销的同时,缩小缓存体积、提高缓存复用效率,减少GPU的重复计算,使GPU更专注于新Token的生成,帮助运营方在响应时间、吞吐量和总成本之间找到平衡。此外,还有KV Fuse、KV Cascade、KV Infinity等技术,分别用于解决缓存融合、内容筛选和长任务缓存扩展等问题。