Appearance
一句话总结:安全评估 = 红队主动攻击(越狱/注入/数据泄漏)+ 基准量化(JailbreakBench/CyberSecEval)+ 输入输出护栏 + 治理架构(身份/模型/数据三层网关)——攻击与防御共享同一套设计逻辑:让模型"忽略想要的、执行想要的"。
红队测试(核心方法)
- 定义:主动模拟攻击者测试 AI 系统的安全边界——越狱、提示注入、数据泄漏三大类
- 框架:6 大攻击向量、4 层防御系统、3 档响应(检测→缓解→恢复)
- 自动化工具:NeuroSploit aitest 等内置 30 个攻击 Agent,一键对 LLM 应用/Agent/MCP 服务器发起系统性攻击测试,覆盖 OWASP LLM Top 10
- 价值:上线前暴露"模型拒绝不了什么"
安全基准(量化)
| 基准 | 来源 | 测什么 |
|---|---|---|
| JailbreakBench | 开源 | GCG/PAIR/手工越狱/随机搜索+自迁移,越狱鲁棒性 |
| CyberSecEval | Meta Purple Llama | 基于 CWE/MITRE ATT&CK:恶意代码生成、攻击协助倾向、提示注入防御 |
| RED QUEEN | 学术 | 多轮隐蔽越狱;RED QUEEN GUARD 把攻击成功率压到 <1% |
输入/输出护栏
- 输入护栏:系统提示硬化 + 注入特征扫描 + 数据清洗(净化检索文档)
- 输出护栏:内容过滤、敏感信息检测(PII 泄漏)、拒绝合规审查
- 局限:输出过滤不是银弹(绕过率 15-30%)——必须与权限/沙箱配合
治理架构(企业级)
三层网关:身份网关(Agent 注册制,防"影子 AI")→ AI/模型网关(审计 Skills·MCP·交互,实时拦截违规)→ 数据网关(防核心数据破坏、敏感信息泄漏)
防御框架全景(训练→推理)
训练时:Constitutional AI 自对齐 + 红队对抗训练(RLHF 见 [[AI基础概念-RLHF与模型对齐]])
推理时:系统提示硬化 + 输入护栏 + 输出过滤 + 权限沙箱面试要点
- 能说红队测什么(越狱/注入/数据泄漏)与自动化工具
- 能报出两个基准(JailbreakBench / CyberSecEval)各测什么
- 能画出三层网关治理架构
- 能主动提"攻击与防御共享设计逻辑"(诱导忽略 vs 诱导执行)——深度分
相关概念
- [AI-Agent-提示注入攻防](/学习笔记/AI技术/AI Agent/AI-Agent-提示注入攻防) — 被测的攻击对象
- [AI-Agent-Agent安全架构与防护](/学习笔记/AI技术/AI Agent/AI-Agent-Agent安全架构与防护) — 防御落地
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 安全一票否决门禁
- AI基础概念-RLHF与模型对齐 — 训练时对齐