Appearance
一句话总结:生产 RAG 检索链路 = 混合检索(向量语义 + BM25 精确词)→ RRF 融合 → 重排;两阶段"混合+重排"效果全面超过单路(Recall@5 0.816 / MRR@3 0.605),评估靠 Recall@K / MRR / nDCG@K 逐级对比。
为什么混合(面试默写)
| 检索路 | 擅长 | 短板 |
|---|---|---|
| 稠密向量 | 语义等价("如何退款"↔"退货流程") | 精确词/标识符弱 |
| 稀疏 BM25 | 高区分度标识符(错误码、型号、专名) | 无语义理解 |
- 融合是"语义 + 精确"互补——召回率显著提升
融合算法
- RRF(倒数排名融合):不看分数看排名,天然消除量纲差
RRF_score(d) = Σ 1/(k + rank_i(d)) - 或 alpha 加权(Weaviate):alpha=1 纯向量 / 0 纯 BM25 / 中间加权
重排(Rerank)
- Cross-Encoder 对候选二次打分,过滤噪音文档
- 实测(腾讯云案例,MRR):仅向量 0.62 → RRF 混合 0.71 → +重排 0.79
- 另一案例:Recall@10 +22%、MRR +25%
检索评估指标(必背)
| 指标 | 含义 | 关注点 |
|---|---|---|
| Recall@K | Top-K 含答案块比例 | 有没有召回对 |
| MRR | 第一个相关块排多靠前 | prompt 有长度限制,靠前才用得到 |
| nDCG@K | 分级相关性排序质量 | 多相关块场景 |
| Coverage | 多少查询 Top-K 有相关块 | 覆盖率 |
- 逐级观测:仅 BM25 → 仅稠密 → 融合 → 融合+重排,看召回提升在哪一级
- 再往上是业务指标:答非所问率、用户追问率
面试要点
- 能讲为什么混合(语义 vs 精确互补)与 RRF 原理
- 能默写四个检索指标
- 能说出"混合+重排"两阶段最优
- 能讲评估链路(逐级对比召回)
相关概念
- AI基础概念-RAG检索增强生成 — RAG 原理
- [AI-Agent-向量数据库](/学习笔记/AI技术/AI Agent/AI-Agent-向量数据库) — 向量检索底座
- [AI-Agent-AgenticRAG与高级检索](/学习笔记/AI技术/AI Agent/AI-Agent-AgenticRAG与高级检索) — 检索智能化
- [AI-Agent-评测指标与评估流程](/学习笔记/AI技术/AI Agent/AI-Agent-评测指标与评估流程) — 检索指标与门禁