Appearance
一句话总结:推理成本三杠杆——量化(FP8/INT8 省内存 25-50%)→ 剪枝 → 蒸馏;KV 缓存复用率 <65% 时单位成本抬升 >40%(前缀缓存命中 60-90%);continuous batching 对 Agent 混合长短流量收益最大。
三杠杆(面试默写)
| 杠杆 | 机制 | 代价 |
|---|---|---|
| 量化 | FP16→FP8/INT8/INT4 | 省内存 25-50%,精度损失小,无需重训 |
| 剪枝 | 去近零权重 | 需稀疏硬件支持 |
| 知识蒸馏 | 大模型教小模型 | 目标任务同质量更便宜 |
- 非一次性:随模型与负载演进复访;4-bit AWQ + EAGLE-3 最大化单卡 KV headroom
KV Cache 优化(拉分点)
- PagedAttention / GQA / FlashAttention
- 前缀缓存(Automatic Prefix Caching):稳定 system prompt 场景 prefill 命中 60-90%
- KV 复用率 <65% → 重复 prefill 抬升单位 token 成本 >40%
- 监控:Prometheus
gpu_cache_usage_perc
Continuous Batching(深度分)
- 迭代级调度:token 级即时换入换出(不等最慢请求)
- 输出长度差异越大收益越大——Agent 混合长短流量最受益
- 典型案例:动态批处理 + KV 复用 + kernel 优化,月耗 $28 万 → $9.3 万
显存三级与 GPU 选型(深度分)
| 等级 | 场景 | 显存保障 | 抢占容忍 |
|---|---|---|---|
| 热 | 在线推理 API | ≥95% | 零抢占 |
| 温 | 批量微调 | 70-90% | 可降级 |
| 冷 | 验证/评估 | ≤50% | 允许全量抢占 |
- GPU 选型按需求量化 TCO,勿过度采购
面试要点
- 能默写三杠杆(量化/剪枝/蒸馏)
- 能报 KV 复用阈值(<65% 成本 +40%、前缀命中 60-90%)
- 能讲 continuous batching 对 Agent 的收益
- 能说显存三级分级
相关概念
- [AI-Agent-部署形态与架构](/学习笔记/AI技术/AI Agent/AI-Agent-部署形态与架构) — 架构层
- [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 模型层
- [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — 运维层
- [AI-Agent-微调实战流程与工具](/学习笔记/AI技术/AI Agent/AI-Agent-微调实战流程与工具) — 量化实践