Appearance
一句话总结:生产级上下文管理 = 把 KV-cache 命中率当第一指标(缓存比未缓存便宜约 10 倍)+ 记忆分层(短期缓存/会话内/长期持久化)+ 动态工具暴露 + Token 预算门控——一句话纪律:稳定前缀绝不改、旧消息 append-only、动态内容放末尾。
Prompt Caching:复用计算,降本提速
- 原理:对已出现过的前缀内容复用此前计算结果(KV cache 表示 + 内容哈希),只算真正新的部分
- 为什么省:缓存 0.30/M vs 未缓存 3.00/M(约 10 倍差)
- 机制本质:对接 AI基础概念-大模型推理与解码 的 KV Cache——前缀相同即可命中
缓存架构纪律(生产 Agent 第一指标)
| 纪律 | 做法 | 为什么 |
|---|---|---|
| 稳定前缀 | system / 工具定义 / CLAUDE.md 绝不改 | 前缀一变缓存全失效 |
| append-only | 只追加不修改旧消息 | 改旧消息使缓存从该点失效 |
| 动态内容放末尾 | 会话变化的内容排在后面 | 最大化可复用前缀长度 |
| 缓存分层 | 静态层(1h+ 缓存)/ 会话层(5min)/ 对话层(不缓存) | 按变化频率分配缓存策略 |
记忆分层(三层架构)
| 层次 | 承载 | 对应 |
|---|---|---|
| 短期 | Prompt Cache(瞬时) | 本次调用的缓存 |
| 中期 | 会话内缓存 | 当前会话状态 |
| 长期 | 跨会话持久化(向量库/文件) | [AI-Agent-记忆系统](/学习笔记/AI技术/AI Agent/AI-Agent-记忆系统) |
- 存储分层(AWS 参考):陈述性层(对话/Skill/索引文件)→ 语义层(向量 embedding 检索)→ 情景层(实体关系/时序)
其他实战手段
| 手段 | 作用 |
|---|---|
| 动态工具暴露(SelectTools) | 不是所有工具都塞进上下文,按任务选——工具定义是膨胀源之一 |
| Token 预算门控 | EstimateTokens + Budget 控制总闸,超预算先压缩 |
| 检索编排 | RAG top-K + token budget 组装(Retrieval-Augmented Context) |
| 结构化笔记 | 常驻信息精炼成笔记,不保留原始长文 |
面试要点
- 能报出缓存 10 倍价差(0.30 vs 3.00/M)并解释机制
- 能说出三条缓存纪律(稳定前缀/append-only/动态放末尾)
- 能画记忆三层架构(短期缓存/会话内/长期持久化)
- 能解释动态工具暴露与 Token 预算门控为什么省(工具定义也是膨胀源)
相关概念
- AI基础概念-大模型推理与解码 — KV Cache 机制基础
- [AI-Agent-记忆系统](/学习笔记/AI技术/AI Agent/AI-Agent-记忆系统) — 长期记忆层
- [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 成本 FinOps
- AI基础概念-上下文压缩与管理策略 — 满窗后的处理