寓言故事
抄录员把厚卷改成细字本
说书楼每天续讲长篇,抄手把前文的 key-value 记录放在手边。故事越长,原尺寸的记录越占显存,能同时服务的听众便越来越少。
老抄手用更小的刻度保存这些缓存,只对容易混淆的名字保留更精细的记号。每次续讲仍从缓存读取,不必重算全部前文。
在一段人物关系复杂的故事里,过度压缩让名字和指代混淆。楼主按上下文长度、批量和任务类型比较质量,找到显存节省与稳定性的可接受点。
缓存占用下降后,同一间说书楼能同时接待更多听众,长上下文也有了余量。但不同模型、层和硬件的误差并不相同,不能照搬一个比例。
KV Cache Quantization 通过低精度存储注意力缓存来降低显存压力,服务前应结合质量回归、长上下文和并发 SLA 评估收益。