术语 · AI

检索增强生成

RAG

回答前先从知识库检索相关资料,连同问题一起交给模型,让回答有据可依。

先查资料,再作答

答案不在模型脑子里
有据可查,才敢当真
模型的训练知识有截止日期,也有盲区;RAG 在回答前先从你的知识库检索相关内容,把资料连同问题一起递给模型。

换个角度想

RAG 像开卷考试:闭卷时全凭记忆,记不清就容易编;开卷时先翻到相关章节,对着材料作答——还能告诉你答案出自第几页。

模型没学过的问题,怎么答对?

  1. 递给模型的

    问题报销上限是多少?

    资料(没有)

    递给模型的

    问题报销上限是多少?

    知识库公司文档已接入

  2. 这一步不存在——
    直接作答,全凭训练记忆

    检索:报销 上限 标准

    命中手册 3.2 节 · 相关度最高

  3. 上下文里只有一句问题

    手册?模型一个字都看不见

    拼进上下文的资料

    手册 3.2差旅报销标准…

    手册 3.4特殊审批流程…

  4. 像真的「一般是 500 元」——数字是编的没有依据,错了也无从核对
    有出处单日上限 800 元(手册 3.2)答案可核对,资料更新后回答跟着更新

收到一个具体问题

什么时候会遇到它

  1. 内部知识问答

    公司文档、产品手册、历史工单——模型没学过的私有资料都能答。

  2. 需要新信息

    训练截止之后的新闻、新版 API 文档,检索到什么就能用上什么。

  3. 要求可追溯

    客服、法务这类答案必须给出处的场景,先检索才有引用。

想一想

同一个模型,直接问「我们产品支持 SSO 吗」会瞎编,接上 RAG 就答对了。是模型变聪明了吗?

看答案

不是。模型没变,变的是上下文:RAG 把产品文档里相关的段落检索出来放进窗口,模型是「看着资料回答」,不是凭训练记忆。所以 RAG 的上限取决于检索质量——搜不到对的资料,模型照样编。

最容易踩的坑

RAG 不是防幻觉的保险箱:检索错了段落、或资料本身过期,模型会拿着错误依据一本正经地回答。资料库要维护,关键回答要看出处。

⌘K搜索知识库

最近收录

正在载入知识索引…