英特尔发布KV Shrink智能体记忆分层卸载方案

IT时代网9月4日消息,针对智能体频繁回放百万级token对话历史导致GPU显存吃紧的问题,英特尔推出KV Shrink分层卸载与硬件压缩加速方案,并与道客在联合实验室完成验证落地。

方案核心思路是以存代算、分层卸载、硬件压缩。KV Cache相当于大模型推理时的即时记忆草稿本,智能体时代这个草稿本越来越厚,占满昂贵稀缺的GPU显存后系统只能清出暂时用不到的记忆,再次提问时又得从头重算,首token时延随之飙升。

KV Shrink按访问热度把KV Cache分层流动:实时对话的极热数据常驻成本最高的L1层GPU HBM显存,保障低延迟响应;多轮对话热数据卸载至L2层DDR内存,通过大容量缓存池扩容降本;历史对话温冷数据下沉至L3/L4层本地SSD或远端存储。

相比行业既有做法,该方案在把KV Cache搬到低成本介质的同时,用硬件压缩加速降低巨量数据传输带来的性能开销,尽可能保持数据精度不受影响。

注:本文中包含AI辅助创作的内容。

THE END