Skip to content

一句话总结:推理成本三杠杆——量化(FP8/INT8 省内存 25-50%)→ 剪枝 → 蒸馏KV 缓存复用率 <65% 时单位成本抬升 >40%(前缀缓存命中 60-90%);continuous batching 对 Agent 混合长短流量收益最大。

三杠杆(面试默写)

杠杆机制代价
量化FP16→FP8/INT8/INT4省内存 25-50%,精度损失小,无需重训
剪枝去近零权重需稀疏硬件支持
知识蒸馏大模型教小模型目标任务同质量更便宜
  • 非一次性:随模型与负载演进复访;4-bit AWQ + EAGLE-3 最大化单卡 KV headroom

KV Cache 优化(拉分点)

  • PagedAttention / GQA / FlashAttention
  • 前缀缓存(Automatic Prefix Caching):稳定 system prompt 场景 prefill 命中 60-90%
  • KV 复用率 <65% → 重复 prefill 抬升单位 token 成本 >40%
  • 监控:Prometheus gpu_cache_usage_perc

Continuous Batching(深度分)

  • 迭代级调度:token 级即时换入换出(不等最慢请求)
  • 输出长度差异越大收益越大——Agent 混合长短流量最受益
  • 典型案例:动态批处理 + KV 复用 + kernel 优化,月耗 $28 万 → $9.3 万

显存三级与 GPU 选型(深度分)

等级场景显存保障抢占容忍
在线推理 API≥95%零抢占
批量微调70-90%可降级
验证/评估≤50%允许全量抢占
  • GPU 选型按需求量化 TCO,勿过度采购

面试要点

  • 能默写三杠杆(量化/剪枝/蒸馏)
  • 能报 KV 复用阈值(<65% 成本 +40%、前缀命中 60-90%)
  • 能讲 continuous batching 对 Agent 的收益
  • 能说显存三级分级

相关概念

  • [AI-Agent-部署形态与架构](/学习笔记/AI技术/AI Agent/AI-Agent-部署形态与架构) — 架构层
  • [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 模型层
  • [AI-Agent-生产部署与告警](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署与告警) — 运维层
  • [AI-Agent-微调实战流程与工具](/学习笔记/AI技术/AI Agent/AI-Agent-微调实战流程与工具) — 量化实践