Skip to content

一句话总结:生产级上下文管理 = 把 KV-cache 命中率当第一指标(缓存比未缓存便宜约 10 倍)+ 记忆分层(短期缓存/会话内/长期持久化)+ 动态工具暴露 + Token 预算门控——一句话纪律:稳定前缀绝不改、旧消息 append-only、动态内容放末尾。

Prompt Caching:复用计算,降本提速

  • 原理:对已出现过的前缀内容复用此前计算结果(KV cache 表示 + 内容哈希),只算真正新的部分
  • 为什么省:缓存 0.30/M vs 未缓存 3.00/M(约 10 倍差)
  • 机制本质:对接 AI基础概念-大模型推理与解码 的 KV Cache——前缀相同即可命中

缓存架构纪律(生产 Agent 第一指标)

纪律做法为什么
稳定前缀system / 工具定义 / CLAUDE.md 绝不改前缀一变缓存全失效
append-only只追加不修改旧消息改旧消息使缓存从该点失效
动态内容放末尾会话变化的内容排在后面最大化可复用前缀长度
缓存分层静态层(1h+ 缓存)/ 会话层(5min)/ 对话层(不缓存)按变化频率分配缓存策略

记忆分层(三层架构)

层次承载对应
短期Prompt Cache(瞬时)本次调用的缓存
中期会话内缓存当前会话状态
长期跨会话持久化(向量库/文件)[AI-Agent-记忆系统](/学习笔记/AI技术/AI Agent/AI-Agent-记忆系统)
  • 存储分层(AWS 参考):陈述性层(对话/Skill/索引文件)→ 语义层(向量 embedding 检索)→ 情景层(实体关系/时序)

其他实战手段

手段作用
动态工具暴露(SelectTools)不是所有工具都塞进上下文,按任务选——工具定义是膨胀源之一
Token 预算门控EstimateTokens + Budget 控制总闸,超预算先压缩
检索编排RAG top-K + token budget 组装(Retrieval-Augmented Context)
结构化笔记常驻信息精炼成笔记,不保留原始长文

面试要点

  • 能报出缓存 10 倍价差(0.30 vs 3.00/M)并解释机制
  • 能说出三条缓存纪律(稳定前缀/append-only/动态放末尾)
  • 能画记忆三层架构(短期缓存/会话内/长期持久化)
  • 能解释动态工具暴露与 Token 预算门控为什么省(工具定义也是膨胀源)

相关概念