Skip to content

一句话总结:安全评估 = 红队主动攻击(越狱/注入/数据泄漏)+ 基准量化(JailbreakBench/CyberSecEval)+ 输入输出护栏 + 治理架构(身份/模型/数据三层网关)——攻击与防御共享同一套设计逻辑:让模型"忽略想要的、执行想要的"。

红队测试(核心方法)

  • 定义:主动模拟攻击者测试 AI 系统的安全边界——越狱、提示注入、数据泄漏三大类
  • 框架:6 大攻击向量、4 层防御系统、3 档响应(检测→缓解→恢复)
  • 自动化工具:NeuroSploit aitest 等内置 30 个攻击 Agent,一键对 LLM 应用/Agent/MCP 服务器发起系统性攻击测试,覆盖 OWASP LLM Top 10
  • 价值:上线前暴露"模型拒绝不了什么"

安全基准(量化)

基准来源测什么
JailbreakBench开源GCG/PAIR/手工越狱/随机搜索+自迁移,越狱鲁棒性
CyberSecEvalMeta Purple Llama基于 CWE/MITRE ATT&CK:恶意代码生成、攻击协助倾向、提示注入防御
RED QUEEN学术多轮隐蔽越狱;RED QUEEN GUARD 把攻击成功率压到 <1%

输入/输出护栏

  • 输入护栏:系统提示硬化 + 注入特征扫描 + 数据清洗(净化检索文档)
  • 输出护栏:内容过滤、敏感信息检测(PII 泄漏)、拒绝合规审查
  • 局限:输出过滤不是银弹(绕过率 15-30%)——必须与权限/沙箱配合

治理架构(企业级)

三层网关:身份网关(Agent 注册制,防"影子 AI")→ AI/模型网关(审计 Skills·MCP·交互,实时拦截违规)→ 数据网关(防核心数据破坏、敏感信息泄漏)

防御框架全景(训练→推理)

训练时:Constitutional AI 自对齐 + 红队对抗训练(RLHF 见 [[AI基础概念-RLHF与模型对齐]])
推理时:系统提示硬化 + 输入护栏 + 输出过滤 + 权限沙箱

面试要点

  • 能说红队测什么(越狱/注入/数据泄漏)与自动化工具
  • 能报出两个基准(JailbreakBench / CyberSecEval)各测什么
  • 能画出三层网关治理架构
  • 能主动提"攻击与防御共享设计逻辑"(诱导忽略 vs 诱导执行)——深度分

相关概念

  • [AI-Agent-提示注入攻防](/学习笔记/AI技术/AI Agent/AI-Agent-提示注入攻防) — 被测的攻击对象
  • [AI-Agent-Agent安全架构与防护](/学习笔记/AI技术/AI Agent/AI-Agent-Agent安全架构与防护) — 防御落地
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 安全一票否决门禁
  • AI基础概念-RLHF与模型对齐 — 训练时对齐