RAG 是什么?为什么大模型应用都离不开它

乐云一
  • 笔记
  • note
  • AI
About 2899 wordsAbout 10 min

RAG 是什么?为什么大模型应用都离不开它

开头

如果你这两年关注过 AI 应用,有个词一定绕不开——RAG

企业知识库、智能客服、AI 搜索、各种"文档问答"产品……翻翻它们的技术介绍,背后几乎都挂着这三个字母。可以说,RAG 是当下大模型应用最主流、也最实用的技术方案,没有之一。

顺带说一句(这句不展开,知道就行):"检索增强"这个思想本身不算新鲜——搜索引擎、知识库匹配,本质上都是"先检索相关信息、再给出结果",跑了二十多年了。是大模型给它装上了"理解语义"和"自然语言生成"两台新引擎,RAG 才成了今天 AI 应用的标配。

这篇就老实科普一下:RAG 到底是什么、怎么工作、在 AI 里有哪些应用、什么时候该用。

RAG 是什么

RAG,全称 Retrieval-Augmented Generation,中文叫检索增强生成

一句话定义:

大模型回答问题前,先从你提供的资料库里,把相关内容检索出来,让它"照着"资料回答,而不是靠自己那点可能过时、可能瞎编的记忆。

一个比喻秒懂:

  • 普通大模型 = 闭卷考试。只能凭脑子里的记忆答题,记不清就硬编。
  • RAG = 开卷考试。允许它先翻你指定的"参考书",找到对应那几页,再照着写答案。

为什么需要 RAG:大模型的三个老毛病

不搞 RAG 行不行?行,但你会被大模型这三个毛病折磨死:

大模型的毛病具体表现RAG 怎么治
知识有保质期训练完成那天之后的事,它一概不知资料库随时更新,它永远拿到最新内容
不认识私有数据你公司的文档、你的笔记——它训练时压根没见过你把私有资料塞进资料库,它就能查
爱幻觉(胡编)不知道也敢一本正经地编,语气笃定得像个专家让它"照着资料答",没资料就别瞎说

举个最典型的场景:你问大模型"我们公司今年的差旅报销流程是什么",它洋洋洒洒给你编了一套,跟你公司的流程一个字都对不上——因为它压根没见过你们公司的制度。

给它配一本"参考书"(你的员工手册),让它开卷考试,先翻到对应那页再答,这就是 RAG。

RAG 怎么工作

RAG 分两个阶段,一个"建资料库",一个"问答"。

阶段一:建资料库(提前做一次)

你不能直接把一整份 500 页的 PDF 丢给大模型让它现翻——上下文窗口装不下。所以得先把资料预处理成好查的形态:

原始资料               切成小块              向量化               存进向量库
(文档/PDF/网页)   →   (chunk)         →    (embedding)      →   (向量数据库)

[一份产品手册]    [鉴权流程]            [0.12, -0.33, ...]     ┌──────────┐
                  [计费规则]            [0.45, 0.08, ...]      │ 向量数据库 │
                  [常见问题]            [-0.21, 0.55, ...]     │(Milvus/  │
                  ...                   ...                    │ pgvector)│
                                                                └──────────┘

两个关键词,大白话解释:

  • 切块(chunk):把长文档切成一段段小块(每块几百字)。检索要的是"精准命中相关片段",不是整篇糊你一脸。切得好不好,直接影响效果——把一个完整步骤切两半,检索出来就是半截话。

  • 向量化(embedding):RAG 的灵魂。用一个小模型,把每段文字变成一串数字(向量)。你可以理解成:给每段文字在一张**"语义地图"**上标了个坐标。

    关键魔法在于:意思相近的文字,坐标也靠得近。 "如何登录系统" 和 "登录流程是什么"——字面不一样,但意思接近,坐标离得近,能匹配上。 "如何登录系统" 和 "今天的午饭真难吃"——八竿子打不着,坐标离得老远。

    这一来,"找相关内容"就从"查关键词"升级成了"查意思","登录"和"怎么登入"这种字面不同但意思一样的,终于能匹配上了。

阶段二:问答(每次提问走一遍)

资料库建好了,用户来提问。流程是这样:

四步:问题标坐标 → 找最近的几个片段 → 拼给大模型 → 大模型照资料答,还能标注"这段出自哪份文档"。

第 2 步检索是命门。 检索没找对,后面模型再聪明也只能对着错的资料发挥——垃圾进,垃圾出。这也是为什么 RAG 项目一半的精力都花在"怎么检索得更准"上。

RAG 在 AI 领域的应用场景

这是重点。RAG 在 AI 里的应用有一个共同特征:需要大模型回答它"训练时没见过"的内容,而且最好还能查到出处。

应用一:企业知识库问答

把公司的规章制度、操作手册、产品文档、Wiki 全喂进去。

  • 新人问"年假怎么折算" → 从员工手册检索 → 答 + 附"出自《员工手册》第 X 章"
  • 销售问"我们系统支持哪些部署方式" → 从产品文档检索
  • 开发问"这个接口的鉴权流程" → 从技术文档检索

回答能溯源,对企业场景太重要了——你得知道 AI 说的到底是不是真的。

应用二:智能客服

把产品 FAQ、使用手册、常见报错处理喂进去,客服机器人从"只会说车轱辘话"升级成"真能解决问题"。用户问"你们的产品支持 Linux 吗",直接从手册检索出准确答案,而不是回一句"请咨询人工客服"。

应用三:AI 搜索

Perplexity、秘塔搜索、Kimi……这类"AI 搜索"产品,底层就是 RAG 的商用版:

你的问题
  ↓
检索互联网上的相关网页(而不是只靠模型记忆)
  ↓
大模型读懂这些网页,综合着给你一个总结性回答
  ↓
附上引用来源(每句话都能点回去看原文)

它和传统搜索引擎的区别:传统搜索给你一堆链接让你自己挑,AI 搜索直接给你一个"读完所有相关网页后总结出来的答案"。 这背后就是 RAG 在扛。

应用四:AI 编程助手 / 代码库问答

让 AI 能基于你整个项目的代码和文档来回答。"我们项目里鉴权是怎么做的?"——RAG 从代码和文档里检索相关片段再答。比让 AI 靠猜强一万倍。

很多 AI 编程工具(Copilot、Cursor 之类)的"@代码库"功能,本质就是给你的代码库建了个 RAG 索引,这样它才能"看到"你整个项目,而不是只盯着当前文件。(我在《当你在和AI说话的时候,它在想什么?》里聊过这个)

应用五:个人"第二大脑"

把你自己攒的技术笔记、收藏的文章、读书摘录全喂进去。以后不用再"我记得我记过,但找不到了",直接问 AI 帮你从自己的笔记里翻出来总结。

(MaxKB 这类工具就是干这个的,我之前体验过,感兴趣的可以翻那篇。)

应用六:Agent 的"查资料工具"

现在的 AI Agent(智能体)要干实事,几乎都会把 RAG 当成一个工具挂在身上。Agent 自己负责思考、调度,需要查资料时就调用 RAG 去检索——"Agent + RAG"是当下 AI 应用最常见的组合拳。 (这块我后面单独开一篇聊)

应用七:法律 / 医疗 / 金融等专业领域

这些领域对准确性可溯源要求极高,容不得幻觉。

  • 医疗:问"这个症状可能对应哪些疾病" → 从权威文献检索,且必须标注出处
  • 法律:问"这种情况适用哪条法规" → 从法条库检索原文

在这些场景,RAG 不是"锦上添花",是"安全护栏"。

应用场景检索什么核心价值
企业知识库内部文档/规章私有知识 + 可溯源
智能客服FAQ/产品手册准确回答,降人工
AI 搜索互联网网页总结答案 + 引用来源
代码助手项目代码/文档让 AI"看到"整个项目
第二大脑个人笔记私有知识快速检索
Agent 工具业务资料给 Agent 配查资料能力
专业领域法条/文献/研报低幻觉 + 必溯源

什么时候需要 RAG

不是所有 AI 任务都要上 RAG。判断标准一句话:你的任务,需不需要 AI 去"查外部资料"才能回答?

该上的信号

需要外部/私有知识:要查公司文档、最新数据、私有资料,这些大模型训练时没见过。

知识会变,需要更新:产品迭代了、规章改了——RAG 改资料库就行,不用重新训练模型。

答案必须能溯源:医疗、法律、合规,每个回答都要能翻回去核对。

资料量太大:几百份文档,不可能每次提问都全塞进上下文(装不下,也贵)。

不该上的情况

任务在模型能力范围内:写诗、翻译、改 bug(把代码直接给它)——靠它本来的本事就行,要啥参考书。

资料量很小:就两三页文档,直接放系统提示词里就完事了,够用就别上 RAG。RAG 自己有切分、检索、维护的成本,杀鸡焉用牛刀。

纯创意/生成类:写文案、起名字——要的是"灵感",不是"查资料"。

决策图

顺带:RAG 和微调别搞混

经常有人把 RAG 和"微调(Fine-tuning)"搞混,这俩解决的不是一回事:

RAG 喂"知识",微调练"本事"。

  • "让 AI 知道我们公司的报销流程" → RAG(给它配资料)
  • "让 AI 用我们公司的语气和格式写周报" → 微调(改它的行为)

RAG 改资料库就行,秒级更新、能溯源;微调要重新训练、成本高、知识融进权重查不到出处。很多正经项目是两者结合:微调练行话和推理,RAG 补最新事实。

最后

回到开头。

RAG不改变 AI 的智商,它改变 AI 答题的方式——从"凭记忆硬编"变成"查资料再答"。 这一下,大模型那三个老毛病(知识过期、不识私有数据、爱幻觉)就被对症治住了。

也难怪现在几乎所有正经的大模型应用都离不开它——只要你的 AI 需要回答"训练时没见过"的问题,RAG 基本就是标配。

至于怎么把这套参考书架搭起来——你自己撸向量数据库,或者直接用 MaxKB 这种开箱即用的工具,都行。工具是手段,搞懂 RAG 背后"开卷考试"这个道理,才是关键。

Last update:
Contributors: LeYunone
Comments
  • Latest
  • Oldest
  • Hottest
Powered by Waline v2.14.7