AI学习中心 / 第7课
零基础课程 · 约20分钟

第7课:Agent、RAG、Embedding 和知识库

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 理解知识库、RAG、Embedding、向量数据库、Agent之间的关系
  • 知道RAG不是训练模型
  • 理解专业知识库如何帮助CampusAI

正文

Knowledge Base:知识库

知识库不是“把文件堆在文件夹里”。 真正有用的知识库要有:

  • 分类;
  • 来源;
  • 更新时间;
  • 关键词;
  • 适用范围;
  • 可被检索的内容块。

RAG

RAG = Retrieval-Augmented Generation = 检索增强生成

普通回答: 问题 → 模型 → 回答

RAG: 问题 → 检索知识库 → 找到相关资料 → 把资料交给模型 → 模型结合资料回答

它特别适合:

  • 校内规章;
  • 竞赛规则;
  • 专业知识;
  • 项目模板;
  • 企业内部文件;
  • 课程资料。

Embedding

Embedding 可以把文本转换成一串数字。 这些数字表达语义特征,因此: “机器学习入门” 和 “如何开始学习 ML” 虽然文字不一样,但向量可能比较接近。

Vector Database

保存这些向量,并快速找到“语义最像”的内容。

Agent

Agent 不只是回答一句话。 它通常有: 目标 → 计划 → 工具/知识检索 → 执行 → 检查 → 输出。

CampusAI 的价值就在这里: 学生不是只问“这是什么”,而是让系统帮他完成一个项目过程。

1. 本课要建立的整体认识

知识库解决“可靠资料放在哪里”,Embedding和向量检索解决“怎样找到语义相关资料”,RAG解决“怎样把资料交给模型回答”,Agent解决“怎样围绕目标连续执行”。

2. 把核心概念逐层拆开

2.1 知识库需要正文

知识库需要正文,也需要标题、专业、来源、发布日期、核验日期、适用范围和版本等元数据。

2.2 切分知识块时既不能大到什么都混在一起

切分知识块时既不能大到什么都混在一起,也不能小到失去完整语义;每个块应保留来源关系。

2.3 Embedding把内容转换为向量表示

Embedding把内容转换为向量表示,适合寻找意思相近但措辞不同的内容。

2.4 向量检索并非事实裁判

向量检索并非事实裁判,通常还需关键词过滤、专业门类过滤、重排序和来源优先级。

2.5 RAG是在回答时检索

RAG是在回答时检索,不等于重新训练模型;Agent则可以调用检索、文件、代码等工具完成多步骤任务。

3. 把概念串成一条完整流程

一次可靠问答可以经历:识别用户专业与意图→改写检索问题→按元数据缩小范围→关键词与向量混合检索→重排序→把少量相关片段交给模型→生成带出处的回答→人工核验。

4. 用真实场景理解

机械专业学生询问竞赛选题时,系统不应直接让模型凭印象回答,而应先检索专业课程、可行项目、当届规则、往届成果和安全规范,再让Agent形成选题比较表。

5. 学习时应该怎样判断自己是否真正理解

不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。

遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。

6. 本课小结

本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。

7. 进一步拆解:从“知道名词”到“会做判断”

学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:

  • 知识库需要正文:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 切分知识块时既不能大到什么都混在一起:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • Embedding把内容转换为向量表示:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 向量检索并非事实裁判:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • RAG是在回答时检索:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。

8. 建立自己的操作检查表

第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。

这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。

9. 与前后课程的关系

这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?

10. 课后自查

  1. 我能否不用术语堆砌,用自己的话解释本课核心关系?
  2. 我能否画出一个包含输入、处理、输出和核验的流程?
  3. 我能否举出一个与自己专业、学习或工作有关的实例?
  4. 我能否说出至少两个容易犯的错误,以及怎样提前发现?
  5. 我能否把本课方法用于一个真实任务,并留下可检查的成果?

示例

示例1:机械工程学生问竞赛方案

先按专业和项目检索机械工程、工程基础与竞赛规则,再把片段交给Agent。

结论:先缩小知识范围,再生成更有依据的项目方案。

示例2:语义检索

“食品安全检测”和“食品质量快速检测”用词不同,但Embedding可能判断语义接近。

结论:向量检索不只依赖完全相同的关键词。

常见误区

  • “RAG就是微调。”——RAG是运行时检索资料,微调是继续训练模型。
  • “把文件扔进文件夹就是知识库。”——知识库需要结构、来源、版本和检索方式。
  • “Agent一定完全自主。”——实际产品中常需明确工具、权限、步骤和人工检查。

小测验

点击题目查看答案。

1. RAG 的核心流程是哪一个?
  1. A. 训练显卡→发布模型
  2. B. 问题→检索相关资料→模型结合资料回答
  3. C. 域名→DNS→网页
  4. D. 图片→打印机
答案:B

RAG的核心是检索增强生成。

2. Embedding 主要用于什么?
  1. A. 把内容表示成便于计算语义相似度的向量
  2. B. 把网页变成PDF
  3. C. 注册域名
  4. D. 增加内存
答案:A

Embedding把文本等内容转换成向量表示。

3. Agent 与普通单轮问答相比,最典型的差别是什么?
  1. A. 一定更便宜
  2. B. 可围绕目标执行多步骤任务并调用工具/知识
  3. C. 不需要模型
  4. D. 只能处理图片
答案:B

Agent强调目标、步骤、工具调用和持续执行。

实践任务

设计一个专业RAG

任选一个大学专业,列出至少6类应该进入知识库的资料,并写明哪些资料需要保存来源和更新时间。

提交物:知识库清单。

完成标准

  • 至少6类资料
  • 区分静态和动态资料
  • 包含来源/版本意识