Appearance
一句话总结:生产 Agent 安全 = 纵深防御——沙箱隔离把爆炸半径锁死、最小权限让注入成功也无权、凭证不落执行上下文、敏感任务上 TEE、行为熔断防失控;核心哲学是"假定会被攻破,按失守设计"。
第一道防线:沙箱隔离
- 进程级沙箱:Linux 命名空间 + cgroups 限制资源可见性(Anthropic 深度方案)
- 容器沙箱:Docker 隔离文件/网络/元数据;专属文件目录、独立网络通道、资源配额
- 铁律:"隔离阻断、最小权限、用完即毁"——任务结束销毁重置,全程可追溯
- 价值:Agent 跑在受限容器,无法触碰宿主文件系统/网络/元数据
第二道防线:最小权限
- 令牌只携带完成任务所需的最小 scope,缺省拒绝
- 实践:每 Agent 独立服务账号、数据库只读就不给写、API 只限实际端点、凭证短期有效
- 理由:提示注入无法根治(见 [AI-Agent-提示注入攻防](/学习笔记/AI技术/AI Agent/AI-Agent-提示注入攻防))——权限是最后一道有效闸
凭证管理(高级模式,面试拉分点)
- Phantom Token 模式:真实凭证只存在出口代理,Agent 执行上下文里只有会话占位符——即使沙箱被完全攻破也泄露不出可用凭证
- S3 预签名 URL:文件传输不用 AK/SK,索取一次性签名链接
- 原则:关键环境变量读取后立即清除
数据防泄漏
| 手段 | 做法 |
|---|---|
| 不存储 | 运行过程敏感数据不留存 |
| 加密+脱敏 | 密码/API Key/PII 加密存储、日志脱敏 |
| TEE 可信执行环境 | 敏感任务(接触客户信息)在 TEE 沙箱执行,运维也看不到 |
行为熔断与审计
- 行为熔断:监控工具调用,超阈值/高危操作自动熔断(防死循环、防误操作链)
- 高影响操作需用户确认:涉及花钱、发送、删除等动作必须用户点头
- 全链路审计:每次工具调用留痕(对接 [AI-Agent-可观测性与评估工程](/学习笔记/AI技术/AI Agent/AI-Agent-可观测性与评估工程))
纵深防御四层(Harness 参考)
身份(注册/准入)→ 权限(最小 scope)→ 沙箱(容器隔离)→ 数据隐私(加密/TEE)面试要点
- 能说出沙箱两形态(进程级/Docker)与"隔离阻断、最小权限、用完即毁"
- 能讲最小权限为什么是注入场景最有效的防线
- 能解释 Phantom Token 模式(凭证不落执行上下文)
- 能说出 TEE 用于敏感任务 + 行为熔断 + 用户确认
相关概念
- [AI-Agent-提示注入攻防](/学习笔记/AI技术/AI Agent/AI-Agent-提示注入攻防) — 要防的攻击
- [AI-Agent-安全](/学习笔记/AI技术/AI Agent/AI-Agent-安全) — 安全概念总览
- [AI-Agent-安全评估与红队](/学习笔记/AI技术/AI Agent/AI-Agent-安全评估与红队) — 怎么验证防护
- [AI-Agent-生产部署](/学习笔记/AI技术/AI Agent/AI-Agent-生产部署) — 审计与治理落地