AI学习中心 / 第4课
深度样板课 · 约20分钟

第4课:LLM、Token、Context 到底是什么?

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 理解 LLM、Token、Context 的基础概念
  • 知道模型API调用与自己训练模型的区别
  • 理解上下文窗口为什么会影响长文档处理

正文

1. LLM 是什么?

LLM = Large Language Model = 大语言模型

拆开看:

Large = 大型 Language = 语言 Model = 模型

它是一类能够处理和生成语言的大规模模型。

你现在使用的很多AI聊天能力,都建立在大语言模型上。


2. 为什么叫“语言模型”?

语言模型做的一件核心事情是:

根据已经出现的内容,计算接下来什么内容更合适。

最简单地想:

“今天天气很好,我准备去……”

人会自然想到:

散步、跑步、公园、旅行……

语言模型也会根据大量学习过的语言规律,判断什么内容更可能继续出现。

当然,现代大语言模型远比这个例子复杂。

它不仅能续写,还能:

  • 回答问题;
  • -总结; -翻译; -写代码; -分析结构; -进行一定程度的推理; -根据指令生成内容。


3. 模型是怎样获得这些能力的?

可以先分成两个阶段:

Training:训练

模型接触大量数据,通过计算不断调整内部参数。

训练需要大量: -数据; -算力; -时间; -算法。

Inference:推理

模型训练完成以后,用户输入新内容,模型产生回答。

你在AI网站里聊天,大多数时候是在使用:

推理阶段。

这也是为什么:

你的网站服务器不需要自己拥有训练大模型的全部GPU。

网站可以通过API调用模型厂商的推理服务。


4. Token 到底是什么?

Token 是模型处理文本时使用的基本单元。

它不是固定等于:

一个字 一个词 一个英文单词

具体怎样切分,取决于模型的分词方式。

例如一句:

“我正在学习人工智能”

在模型内部可能被拆成若干Token。

英文、数字、标点也都会占用Token。


5. 为什么需要关心Token?

因为Token影响三个重要事情。

第一:上下文容量

模型一次能处理的信息是有限的。

第二:速度

输入越长、输出越长,通常需要更多计算。

第三:成本

很多模型API会按照输入和输出Token数量计费。

所以做AI产品时,不只是“能不能回答”。

还要考虑:

每次回答用了多少上下文和Token。


6. Context 是什么?

Context = 上下文。

可以把它想成:

AI当前桌面上能够看到的全部材料。

例如:

-系统指令; -你的问题; -前面的聊天记录; -上传文件; -RAG检索出来的资料; -Agent生成的阶段结果。

模型只能基于它“当前能够看到”的内容生成回答。


7. 什么是上下文窗口?

模型一次能够处理的Token数量有上限。

这个范围就叫:

Context Window 上下文窗口

可以把它想成一张有限大小的办公桌。

资料太少:

信息不够。

资料太多:

桌面放不下。

因此长文档处理往往需要:

-切分; -摘要; -检索; -分批处理; -建立知识库。


8. 为什么不能把整个知识库全部塞给模型?

假设大学知识库未来有:

几万篇资料。

用户只问:

“机械工程学生做无人机结构设计,需要哪些基础知识?”

如果把所有专业知识都塞给模型:

-成本高; -速度慢; -噪声多; -上下文可能超限。

更好的方法是:

先检索和问题最相关的内容。

例如找到:

机械设计 材料力学 工程制图 无人机结构 相关竞赛规则

然后只把这些资料放进上下文。

这就是RAG为什么重要。


9. Prompt、Context、Knowledge Base是什么关系?

可以这样理解:

Prompt

你对AI说什么。

Context

AI当前能看到什么。

Knowledge Base

系统长期保存了什么知识。

用户提出问题后:

问题 → 系统去知识库检索 → 把相关内容加入Context → 再调用模型

所以:

知识库 ≠ 上下文

知识库可能很大。

上下文只是这一次任务真正拿出来使用的一部分。


10. 什么是模型API?

API让你的程序可以调用外部模型。

流程:

CampusAI → 后端 → 模型API → 大语言模型 → 返回结果

用户不需要直接进入模型厂商网站。

CampusAI可以在自己的工作区里调用模型。

这样还可以加入:

-项目数据; -专业知识; -权限; -Agent; -Token管理; -结果保存。


11. 为什么一个AI产品可能支持多个模型?

不同模型可能在这些方面不同:

-中文; -代码; -速度; -价格; -长文本; -图像; -推理; -稳定性。

所以好的产品架构通常不会把自己完全锁死在一个模型上。

可以建立:

Model Gateway 模型网关

然后不同任务使用不同模型。

比如:

普通问答 → 成本较低模型

复杂研究 → 更强模型

图像任务 → 多模态模型

这就是产品层的价值。


12. 什么是“幻觉”?

AI生成了:

听起来很合理, 但实际不存在或不正确的内容。

这通常被称为:

Hallucination 幻觉

例如: -虚构论文; -错误作者; -错误法规; -错误统计数字; -不存在的网站。

出现这种情况并不意味着“AI完全没用”。

正确做法是:

把AI适合做的工作交给AI,把必须核验的事实交给来源。


13. 什么时候特别需要来源?

这些信息最好都不要只依赖模型记忆:

-法律法规; -政策; -比赛日期; -报名条件; -价格; -产品参数; -医学信息; -统计数据; -新闻; -论文文献。

应该结合:

搜索 官方资料 知识库 用户文件

来回答。


14. 一个完整例子:CampusAI查竞赛规则

用户问:

“2026年某竞赛什么时候报名?”

错误流程:

问题 → 直接问模型 → 模型凭记忆回答

更可靠流程:

问题 → 判断这是动态信息 → 检索竞赛官方资料 → 找到2026通知 → 把通知相关段落加入Context → 模型总结 → 显示来源

这就是:

模型能力 + RAG + 来源管理


15. 本课总结

你现在应该能够解释这几个词之间的关系:

LLM 是大语言模型。

Token 是模型处理文本的基本单元。

Context 是模型当前能参考的内容。

Context Window 是一次能够处理内容的容量范围。

Model API 是程序调用模型能力的接口。

如果把它们串起来:

程序通过API把Prompt和Context发给LLM → LLM处理Token → 生成结果 → 程序再把结果返回用户

这就是很多AI应用背后的基本流程。

示例

示例1:长PDF为什么要分段

一本几百页资料无法一次全部塞进模型上下文,就需要分块、检索、总结或多轮处理。

结论:上下文不是无限的。

示例2:调用DeepSeek

网站把用户问题通过模型API发送给已训练好的模型并获得回复。

结论:API调用属于推理使用,不等于自己训练模型。

常见误区

  • “Token就是一个汉字。”——Token是模型内部的文本处理单元,和字数不是固定一一对应。
  • “上下文越长一定越好。”——更长会增加成本和噪声,还需要选择相关信息。
  • “调用模型API等于拥有模型。”——API通常只是远程使用能力。

小测验

点击题目查看答案。

1. LLM 的英文全称是什么?
  1. A. Large Language Model
  2. B. Long Logic Machine
  3. C. Local Learning Mode
  4. D. Language Link Module
答案:A

LLM = Large Language Model,大语言模型。

2. Token 最接近下面哪种理解?
  1. A. 固定等于一个汉字
  2. B. 模型处理文本时使用的基本单元
  3. C. 数据库表
  4. D. 图片像素
答案:B

Token 是模型处理文本的基本单元,不固定等于字或词。

3. Context 在大模型中通常指什么?
  1. A. 模型当前能够参考的信息
  2. B. 显卡品牌
  3. C. 网站备案信息
  4. D. 键盘缓存
答案:A

上下文包括当前问题、历史对话、系统指令、检索资料等。

实践任务

估计上下文内容

列出 CampusAI 回答一个竞赛问题时,可能需要放进上下文的5类信息,并说明每类为什么有用。

提交物:5类上下文信息及理由。

完成标准

  • 至少5类
  • 包含用户问题和知识库资料
  • 说明相关性