学习目标
- 理解多模态和AIGC的基本含义
- 知道生成内容类型与输入模态可以组合
- 认识AIGC发布前的真实性、版权和隐私问题
正文
Multimodal
Multimodal = 多模态。 Mode/Modality 可以理解为“信息形式”。
常见模态:
- 文本
- 图片
- 音频
- 视频
多模态模型可以同时理解两种或更多信息形式。
AIGC
AIGC = Artificial Intelligence Generated Content 中文通常称“人工智能生成内容”。
它包括:
- AI写作
- AI绘画
- AI音乐
- AI语音
- AI视频
- AI代码
一个关键区别
“能生成”不等于“可以不核验直接发布”。 商业、学术、新闻、法律、医疗等场景,都要关注真实性、版权、隐私和责任。
1. 本课要建立的整体认识
多模态强调对文字、图像、音频、视频等多种信息形式的联合处理;AIGC强调由AI生成内容,二者有交集但并不相同。
2. 把核心概念逐层拆开
2.1 同一对象在不同模态中表达的信息不同
同一对象在不同模态中表达的信息不同,图片提供空间与外观,语音提供声音与语气,文字适合精确描述。
2.2 多模态系统需要完成编码、对齐和融合
多模态系统需要完成编码、对齐和融合,确保不同信息指向同一对象或事件。
2.3 AIGC的生产流程仍需要选题、资料、提示、生成、编辑、核验、授权和发布。
AIGC的生产流程仍需要选题、资料、提示、生成、编辑、核验、授权和发布。
2.4 内容质量不仅看好不好看
内容质量不仅看好不好看,还看事实、逻辑、受众、可访问性、版权和一致性。
2.5 深度伪造、人物肖像、声音克隆和未授权素材具有明显伦理与法律风险。
深度伪造、人物肖像、声音克隆和未授权素材具有明显伦理与法律风险。
3. 把概念串成一条完整流程
制作多模态课程内容时,可先以权威资料形成文字脚本,再生成图示或拍摄素材,使用TTS或真人配音,最后把字幕、画面和口播逐项对齐并人工审看。
4. 用真实场景理解
一张AI生成的实验装置图可以用于概念示意,但不能当作真实实验照片;生成的人物访谈也不能冒充真实受访者。这是“辅助表达”和“伪造证据”的边界。
5. 学习时应该怎样判断自己是否真正理解
不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。
遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。
6. 本课小结
本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。
7. 进一步拆解:从“知道名词”到“会做判断”
学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:
- 同一对象在不同模态中表达的信息不同:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 多模态系统需要完成编码、对齐和融合:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- AIGC的生产流程仍需要选题、资料、提示、生成、编辑、核验、授权和发布。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 内容质量不仅看好不好看:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 深度伪造、人物肖像、声音克隆和未授权素材具有明显伦理与法律风险。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
8. 建立自己的操作检查表
第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。
这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。
9. 与前后课程的关系
这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?
10. 课后自查
- 我能否不用术语堆砌,用自己的话解释本课核心关系?
- 我能否画出一个包含输入、处理、输出和核验的流程?
- 我能否举出一个与自己专业、学习或工作有关的实例?
- 我能否说出至少两个容易犯的错误,以及怎样提前发现?
- 我能否把本课方法用于一个真实任务,并留下可检查的成果?
示例
示例1:图文问答
上传设备照片并用文字询问部件功能,模型同时处理图片和文本。
结论:多模态强调不同信息形式共同处理。
示例2:AI视频脚本到画面
先用语言模型写脚本,再用图像/视频模型生成素材。
结论:AIGC常是多个模型和流程的组合。
常见误区
- “AIGC只指AI写文章。”——还包括图片、音频、视频、代码等。
- “生成内容没有版权和合规问题。”——发布和商用要考虑来源、规则和权利。
- “多模态模型看到图片就一定理解全部细节。”——仍可能遗漏或误判。
小测验
点击题目查看答案。
1. AIGC 的英文全称是什么?
- A. Artificial Intelligence Generated Content
- B. Automatic Internet Graphic Code
- C. Advanced Image General Control
- D. Artificial Integrated Global Chat
AIGC = Artificial Intelligence Generated Content。
2. 下面哪项属于多模态场景?
- A. 只输入一段文字
- B. 上传图片并同时用文字提问
- C. 只打开数据库
- D. 只改文件名
图片+文字属于两种模态联合处理。
3. AI生成内容发布前需要关注什么?
- A. 只看画面是否好看
- B. 真实性、版权、隐私和使用规则
- C. 只看文件大小
- D. 只看生成速度
AIGC仍需承担真实世界中的内容责任和合规要求。
实践任务
设计一个AIGC工作流
设计“文章→配图→配音→短视频”的AI内容流程,写明每步输入、输出和人工检查点。
提交物:流程表。
完成标准
- 至少4步
- 包含人工检查
- 覆盖两种以上模态