AI专项完整解析RAG 面试题
在什么场景下,你会选择使用图数据库来增强传统的向量检索?
向量检索擅长语义相似,图增强适合关系路径、实体约束和多跳问题;是否采用取决于可测增益与维护成本。
AI专项大模型AgentRAG大厂高频面试ai核心题完整解析编辑精选
直接结论
当问题不仅问“哪段文本语义相似”,还要求实体之间的明确关系、路径约束、多跳推理、时序或权限传播时,可以用图数据库增强向量检索。例如供应链影响路径、组织汇报链、知识实体关系和欺诈团伙关联。典型方案先用 embedding 召回语义相关节点或文档,再沿经过授权和类型约束的边扩展,或先用实体识别锁定图子图,再用向量为子图内容排序。若问题主要是单文档语义搜索,图层可能得不偿失。
原理与步骤
embedding 把输入映射为向量,距离度量表达模型学习到的相似性,但不天然保证实体同一性、关系方向、基数或最新事实。图模型显式保存节点、边和属性,适合回答“谁通过什么关系影响谁”。混合系统必须有稳定实体 ID、消歧、关系来源和更新时间;图遍历的深度、边类型与最大结果数要限制,防止组合爆炸。最终上下文仍需携带原始证据,图路径本身不是事实来源。
工程场景
企业知识助手收到“某客户延期会影响哪些合同和负责人”时,向量检索可找到延期说明,图查询再沿客户—合同—项目—负责人关系扩展,并按权限过滤,最后返回带来源的影响列表。研究资料搜索若只是找与问题相似的段落,先做纯向量基线;只有多跳问题的召回或正确率明显不足,且关系数据可持续维护,才引入图。上线前分别测单跳、多跳、实体歧义和无关系问题,比较质量、延迟与运维成本。
验证与边界
图数据库不会自动产生正确知识图谱,抽取错误、重复实体和过期边会让结果看似可解释却仍然错误。向量相似度阈值也不能跨模型和数据集照搬。图扩展必须在每一步执行租户和文档权限,避免从可见节点推导出不可见关系。验证要保留纯向量、纯图和混合基线,证明增益来自关系信息而非更大的上下文,并为无证据路径设置拒答。
答题练习
- 1语义相似与显式关系互补
- 2多跳和路径约束是主要触发条件
- 3实体治理和权限是前提
常见错误
- 所有 RAG 都加图数据库
- 把图路径当作原始事实证据
可能追问
- 如何做实体消歧和更新
- 混合检索怎样建立对照评测
来源记录
- 原始来源
- 小林面试笔记
- 来源页面
- 大模型面试题
- 最近收录
- 2026-07-05
- 官方复核
- OpenAI Developers