学习目标
- 了解图像生成、图像理解、ASR、TTS和多模态
- 能把视觉任务描述成主体、场景、构图、光线等要素
- 知道不同模态有不同的数据和质量问题
正文
图像生成
输入文字描述 → 模型生成图像。 需要学会描述: 主体、场景、构图、镜头、光线、风格、比例、不要出现什么。
图像理解
给模型一张图,让它:
- 描述内容;
- 识别表格/界面;
- 分析设计;
- 提取信息。
视频生成
一般需要:
- 角色设定;
- 分镜;
- 动作;
- 镜头运动;
- 时间长度;
- 前后镜头一致性。
ASR
Automatic Speech Recognition:语音 → 文字。
TTS
Text To Speech:文字 → 语音。
多模态
Multimodal:一个模型同时处理文字、图片、声音甚至视频。
1. 本课要建立的整体认识
图像、视频、语音不是“换一种输入框”,每种模态都有自己的表达单位、质量标准和核验方式。
2. 把核心概念逐层拆开
2.1 图像生成要同时描述主体、场景、构图、镜头、光线、风格、比例以及明确排除项。
图像生成要同时描述主体、场景、构图、镜头、光线、风格、比例以及明确排除项。
2.2 图像理解要区分“画面中可见事实”和“根据画面作出的推断”
图像理解要区分“画面中可见事实”和“根据画面作出的推断”,模糊文字、遮挡和小目标都可能导致错误。
2.3 视频任务应先写脚本和分镜
视频任务应先写脚本和分镜,再控制镜头、动作、时长、转场和角色一致性。
2.4 ASR把语音转文字
ASR把语音转文字,TTS把文字合成语音;专业术语、人名、数字和噪声环境都需要校对。
2.5 多模态工作流常把识别、生成、编辑和人工审查组合起来
多模态工作流常把识别、生成、编辑和人工审查组合起来,而不是期待一个模型一次完成全部。
3. 把概念串成一条完整流程
制作一分钟科普视频时,先确定受众和核心信息,再写口播稿、拆分镜、生成或拍摄素材、制作配音、添加字幕,最后检查事实、文字、人物一致性、版权和平台规格。
4. 用真实场景理解
为大学生竞赛项目制作展示视频时,AI可以辅助脚本、示意图、配音和字幕,但实验画面、数据、获奖信息与团队贡献必须真实,不能用生成素材冒充实际完成的成果。
5. 学习时应该怎样判断自己是否真正理解
不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。
遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。
6. 本课小结
本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。
7. 进一步拆解:从“知道名词”到“会做判断”
学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:
- 图像生成要同时描述主体、场景、构图、镜头、光线、风格、比例以及明确排除项。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 图像理解要区分“画面中可见事实”和“根据画面作出的推断”:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 视频任务应先写脚本和分镜:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- ASR把语音转文字:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
- 多模态工作流常把识别、生成、编辑和人工审查组合起来:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
8. 建立自己的操作检查表
第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。
这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。
9. 与前后课程的关系
这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?
10. 课后自查
- 我能否不用术语堆砌,用自己的话解释本课核心关系?
- 我能否画出一个包含输入、处理、输出和核验的流程?
- 我能否举出一个与自己专业、学习或工作有关的实例?
- 我能否说出至少两个容易犯的错误,以及怎样提前发现?
- 我能否把本课方法用于一个真实任务,并留下可检查的成果?
示例
示例1:AI海报
为大学比赛生成海报时,明确主题、主视觉、色彩、版式、文字区域和尺寸。
结论:视觉生成也需要结构化需求。
示例2:语音转文字
将课堂录音通过ASR变成文字,再用AI整理笔记。
结论:语音识别与语言模型可以组合成工作流。
常见误区
- “多模态就是多开几个聊天窗口。”——多模态指模型处理不同信息形式。
- “AI图片里的文字一定准确。”——图像模型可能生成错误文字。
- “ASR转写结果不用校对。”——专业术语、人名和噪声环境容易识别错。
小测验
点击题目查看答案。
1. ASR 指什么?
- A. 自动语音识别
- B. 自动图片生成
- C. 应用服务器路由
- D. 高级搜索规则
ASR = Automatic Speech Recognition,语音转文字。
2. TTS 指什么?
- A. 文本转语音
- B. 表格转数据库
- C. 图像转代码
- D. 域名转IP
TTS = Text To Speech。
3. Multimodal 最接近什么含义?
- A. 只处理文字
- B. 能处理多种信息模态,如文字、图片、音频等
- C. 多台服务器
- D. 多用户账号
多模态表示系统可同时处理不同信息形式。
实践任务
设计一个多模态学习流程
设计“课堂录音→文字→笔记→知识点测验”的流程,标明每一步可能使用的AI能力。
提交物:4步以上流程。
完成标准
- 包含ASR
- 包含文本整理
- 包含核验或校对环节