AI专项完整解析RAG 面试题

在什么场景下,你会选择使用图数据库来增强传统的向量检索?

向量检索擅长语义相似,图增强适合关系路径、实体约束和多跳问题;是否采用取决于可测增益与维护成本。

AI专项大模型AgentRAG大厂高频面试ai核心题完整解析编辑精选

直接结论

当问题不仅问“哪段文本语义相似”,还要求实体之间的明确关系、路径约束、多跳推理、时序或权限传播时,可以用图数据库增强向量检索。例如供应链影响路径、组织汇报链、知识实体关系和欺诈团伙关联。典型方案先用 embedding 召回语义相关节点或文档,再沿经过授权和类型约束的边扩展,或先用实体识别锁定图子图,再用向量为子图内容排序。若问题主要是单文档语义搜索,图层可能得不偿失。

原理与步骤

embedding 把输入映射为向量,距离度量表达模型学习到的相似性,但不天然保证实体同一性、关系方向、基数或最新事实。图模型显式保存节点、边和属性,适合回答“谁通过什么关系影响谁”。混合系统必须有稳定实体 ID、消歧、关系来源和更新时间;图遍历的深度、边类型与最大结果数要限制,防止组合爆炸。最终上下文仍需携带原始证据,图路径本身不是事实来源。

工程场景

企业知识助手收到“某客户延期会影响哪些合同和负责人”时,向量检索可找到延期说明,图查询再沿客户—合同—项目—负责人关系扩展,并按权限过滤,最后返回带来源的影响列表。研究资料搜索若只是找与问题相似的段落,先做纯向量基线;只有多跳问题的召回或正确率明显不足,且关系数据可持续维护,才引入图。上线前分别测单跳、多跳、实体歧义和无关系问题,比较质量、延迟与运维成本。

验证与边界

图数据库不会自动产生正确知识图谱,抽取错误、重复实体和过期边会让结果看似可解释却仍然错误。向量相似度阈值也不能跨模型和数据集照搬。图扩展必须在每一步执行租户和文档权限,避免从可见节点推导出不可见关系。验证要保留纯向量、纯图和混合基线,证明增益来自关系信息而非更大的上下文,并为无证据路径设置拒答。

答题练习

  1. 1语义相似与显式关系互补
  2. 2多跳和路径约束是主要触发条件
  3. 3实体治理和权限是前提

常见错误

  • 所有 RAG 都加图数据库
  • 把图路径当作原始事实证据

可能追问

  • 如何做实体消歧和更新
  • 混合检索怎样建立对照评测

来源记录

原始来源
小林面试笔记
来源页面
大模型面试题
最近收录
2026-07-05
官方复核
OpenAI Developers