大模型推理优化:量化、蒸馏与 KV 缓存
三条降本路线的适用场景与代价对比。
三条路线
推理成本的优化基本围绕「少算」「小算」「不重复算」三个方向。
量化
把权重从 FP16 降到 INT8 / INT4,显存占用近似线性下降。代价是精度损失,对生成类任务的影响大于分类任务。
蒸馏
用大模型的输出训练小模型。效果上限取决于蒸馏数据的覆盖面,长尾场景往往退化明显。
KV 缓存
多轮对话里复用已计算的 key/value,避免重复前向。收益随上下文长度增长,但显存换时间,需要配合分页管理。
| 方案 | 显存 | 延迟 | 精度损失 |
|---|---|---|---|
| INT8 量化 | 降 50% | 降 30% | 小 |
| INT4 量化 | 降 75% | 降 45% | 中 |
| 蒸馏小模型 | 降 80% | 降 70% | 大 |
| KV 缓存 | 升高 | 降 60% | 无 |
实际部署里三者常常叠加使用,先量化再配 KV 缓存是性价比最高的组合。
评论0





暂无评论,期待您的发言...