Skip to content

一句话总结:Agent 部署形态谱系 本地 → 容器 → K8s → Serverless → 边缘推理引擎是吞吐与延迟的胜负手(vLLM:PagedAttention + continuous batching);生产标配混合模型策略——自托管开源 + 托管 API fallback。

部署形态谱系(面试默写)

形态特点
本地进程最简单、无隔离
容器化Docker 打包引擎+CUDA 运行时+模型产物,可复现单元
Kubernetes调度、扩缩容、多副本
Serverless自动扩缩容、按调用计费、Min/Max Workers(0=关闭省成本)
边缘/混合低延迟、离线可用

推理引擎(拉分点)

  • vLLM:PagedAttention KV-cache 管理、continuous batching、speculative decoding、CUDA/HIP graph、OpenAI 兼容 API、TP/PP/DP/EP 并行
  • SGLang:高性能后端 + 灵活前端
  • 无 GPU/无托管的代价:CPU 推理 10-100x 慢、无自动扩缩容(按峰值容量付费)、无多租户、无企业安全(RBAC/审计)

混合模型策略(深度分)

  • 自托管开源模型 + 托管 API fallback(GKE Inference Gateway 配置,提升可靠性)
  • 发布单元依赖:模型权重、Prompt 版本、工具 Schema 各自独立演进

面试要点

  • 能默写部署形态谱系
  • 能讲 vLLM 核心(PagedAttention/continuous batching)
  • 能说无托管的代价(CPU 慢/无扩缩容/无多租户)
  • 能讲混合模型策略

相关概念

  • [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 部署基础
  • [AI-Agent-发布与流量管理](/学习笔记/AI技术/AI Agent/AI-Agent-发布与流量管理) — 上线层
  • [AI-Agent-成本与容量优化](/学习笔记/AI技术/AI Agent/AI-Agent-成本与容量优化) — 成本层
  • [AI-Agent-模型微调与Agent适配](/学习笔记/AI技术/AI Agent/AI-Agent-模型微调与Agent适配) — 模型层