Skip to content

一句话总结:生产 RAG 检索链路 = 混合检索(向量语义 + BM25 精确词)→ RRF 融合 → 重排;两阶段"混合+重排"效果全面超过单路(Recall@5 0.816 / MRR@3 0.605),评估靠 Recall@K / MRR / nDCG@K 逐级对比。

为什么混合(面试默写)

检索路擅长短板
稠密向量语义等价("如何退款"↔"退货流程")精确词/标识符弱
稀疏 BM25高区分度标识符(错误码、型号、专名)无语义理解
  • 融合是"语义 + 精确"互补——召回率显著提升

融合算法

  • RRF(倒数排名融合):不看分数看排名,天然消除量纲差 RRF_score(d) = Σ 1/(k + rank_i(d))
  • 或 alpha 加权(Weaviate):alpha=1 纯向量 / 0 纯 BM25 / 中间加权

重排(Rerank)

  • Cross-Encoder 对候选二次打分,过滤噪音文档
  • 实测(腾讯云案例,MRR):仅向量 0.62 → RRF 混合 0.71 → +重排 0.79
  • 另一案例:Recall@10 +22%、MRR +25%

检索评估指标(必背)

指标含义关注点
Recall@KTop-K 含答案块比例有没有召回对
MRR第一个相关块排多靠前prompt 有长度限制,靠前才用得到
nDCG@K分级相关性排序质量多相关块场景
Coverage多少查询 Top-K 有相关块覆盖率
  • 逐级观测:仅 BM25 → 仅稠密 → 融合 → 融合+重排,看召回提升在哪一级
  • 再往上是业务指标:答非所问率、用户追问率

面试要点

  • 能讲为什么混合(语义 vs 精确互补)与 RRF 原理
  • 能默写四个检索指标
  • 能说出"混合+重排"两阶段最优
  • 能讲评估链路(逐级对比召回)

相关概念

  • AI基础概念-RAG检索增强生成 — RAG 原理
  • [AI-Agent-向量数据库](/学习笔记/AI技术/AI Agent/AI-Agent-向量数据库) — 向量检索底座
  • [AI-Agent-AgenticRAG与高级检索](/学习笔记/AI技术/AI Agent/AI-Agent-AgenticRAG与高级检索) — 检索智能化
  • [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 检索指标与门禁