技术转 AI / Agent 工程面试题更新 2026-08-05

长对话服务并发升高后显存占用和高分位延迟快速上升。你会如何从 KV cache 的作用出发分析和优化?

性能优化技术原理问题排查

考察说明

考查大模型推理缓存机制及其对并发、内存和延迟的影响。

回答思路

  1. 自回归生成需要反复关注之前的令牌,KV cache 保存各层已经计算的键和值,避免每生成一个新令牌都重新计算全部历史上下文。
  2. 缓存带来的代价是显存占用随上下文长度、层数、并发序列和缓存精度增长,长会话可能在算力耗尽前先触发内存压力。
  3. 排查时应关联活跃序列数、输入与输出长度、缓存占用、首字延迟、单令牌生成速度和请求排队时间,确认是缓存容量还是计算成为瓶颈。
  4. 连续批处理和分页式缓存管理可以减少碎片并提高设备利用率,但调度策略需要兼顾短请求,避免长序列长期占用资源。
  5. 公共且稳定的系统前缀可以使用前缀缓存,但缓存键必须包含模型、提示版本和权限相关因素,防止错误复用或跨用户泄露。
  6. 缓存量化、滑动窗口和限制上下文都能节省内存,却可能影响精度或丢失早期信息,必须用目标任务质量和高分位延迟共同验证。