AI学习中心 / 第9课
零基础课程 · 约20分钟

第9课:AI 安全、隐私与事实核验

学习目标 → 正文 → 示例 → 常见误区 → 小测验 → 实践任务

学习目标

  • 认识AI幻觉、隐私、学术诚信三类核心风险
  • 掌握三步事实核验法
  • 知道哪些敏感信息不应随便上传

正文

不要默认 AI 一定正确

AI 可能出现“幻觉”:生成看起来合理、实际上不存在或不准确的内容。

三步核验法

  1. 要求给出来源;
  2. 检查来源是否真实存在;
  3. 对关键数字、法规、论文、政策回到权威原文核验。

不要随便上传

  • 身份证;
  • 银行账户;
  • 密码;
  • 企业商业秘密;
  • 未公开科研数据;
  • 他人隐私;
  • 医疗敏感记录。

学术场景

AI 可以:

  • 辅助理解;
  • 帮助形成思路;
  • 帮助改写表达;
  • 帮助代码调试。

但不能把 AI 生成的虚假文献、虚假实验数据当成真实研究成果。

专业高风险领域

医学、法律、金融、安全工程等内容,知识库应把“学习资料”和“专业决策”明确区分。

1. 本课要建立的整体认识

AI安全不是最后加一条免责声明,而是在输入、处理、输出、保存和发布每一步做风险控制。

2. 把核心概念逐层拆开

2.1 幻觉是模型生成看似合理但缺少事实依据的内容

幻觉是模型生成看似合理但缺少事实依据的内容,尤其容易出现在日期、数据、论文、法规和冷门知识中。

2.2 隐私保护先判断信息是否有必要输入

隐私保护先判断信息是否有必要输入,再做最小化、匿名化或去标识化,而不是上传后再补救。

2.3 学术诚信要求真实数据、真实来源、清楚署名

学术诚信要求真实数据、真实来源、清楚署名,并遵守学校、期刊和赛事对AI使用的最新规则。

2.4 提示词攻击、越权访问和密钥泄漏属于系统安全问题

提示词攻击、越权访问和密钥泄漏属于系统安全问题,不能只靠提醒用户解决。

2.5 医学、法律、金融和工程安全等高风险场景必须保留专业人员判断与人工审批。

医学、法律、金融和工程安全等高风险场景必须保留专业人员判断与人工审批。

3. 把概念串成一条完整流程

事实核验可采用四步:标出关键主张→要求给出出处→打开权威原文核对内容与日期→记录核验结果。无法验证时,应明确写“尚未核实”,不能把推测包装成结论。

4. 用真实场景理解

AI列出一篇论文时,要在真实学术数据库中核对标题、作者、期刊、年份和DOI;AI给出比赛截止日期时,要回到主办方当届通知,而不能引用往届页面。

5. 学习时应该怎样判断自己是否真正理解

不要只看自己是否“听过”这些词。请尝试不用原文,向一位没有技术背景的人解释本课概念;再画出关系或流程;最后换一个与你专业相关的例子。如果无法说明输入、处理、输出、依据和风险,就说明还停留在名词记忆阶段。

遇到模型、工具或规则变化时,优先保留这里学到的判断框架:先定义任务,再确认资料与边界,随后执行、测试和核验。具体品牌和界面会变化,但这种工作方法可以持续使用。

6. 本课小结

本课不是要求一次记住全部细节,而是建立一个能够继续扩展的知识框架。完成正文后,请结合后面的示例、测验和实践任务,把理解转化成自己的语言和可检查的成果。

7. 进一步拆解:从“知道名词”到“会做判断”

学习技术概念时,最容易出现的问题是记住了定义,却不知道什么时候使用,也不知道怎样发现错误。下面逐项使用同一组问题检查理解:

  • 幻觉是模型生成看似合理但缺少事实依据的内容:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 隐私保护先判断信息是否有必要输入:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 学术诚信要求真实数据、真实来源、清楚署名:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 提示词攻击、越权访问和密钥泄漏属于系统安全问题:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。
  • 医学、法律、金融和工程安全等高风险场景必须保留专业人员判断与人工审批。:继续追问它接收什么输入、产生什么输出、依据从哪里来、失败时会出现什么现象、由谁负责复核。把这五个问题写出来,概念就会从一句定义变成可用于真实工作的判断工具。

8. 建立自己的操作检查表

第一张是“任务表”:写清服务对象、目标、已有材料、最终交付物和完成标准。第二张是“数据与来源表”:记录每项材料从哪里来、何时获得、是否允许使用、是否需要更新。第三张是“执行表”:把任务拆成可以观察状态的步骤,标明每一步的输入、处理、输出和失败提示。第四张是“核验表”:列出必须人工检查的事实、数字、引用、权限、安全和专业边界。

这四张表适用于本课所讲的大多数任务。它们能防止把“模型给出了结果”误认为“工作已经完成”,也能帮助团队在出现问题时迅速定位到底是需求不清、资料错误、流程中断,还是输出没有经过验证。

9. 与前后课程的关系

这套20课不是彼此孤立的知识点。本课涉及的概念,需要与Prompt中的任务说明、API与软件系统中的执行链、RAG中的资料依据、数据分析中的质量检查以及AI安全中的责任边界结合起来。学习时可以不断回到一个问题:如果把这个概念放进完整AI产品,它位于哪一层,会影响谁,又需要谁来检查?

10. 课后自查

  1. 我能否不用术语堆砌,用自己的话解释本课核心关系?
  2. 我能否画出一个包含输入、处理、输出和核验的流程?
  3. 我能否举出一个与自己专业、学习或工作有关的实例?
  4. 我能否说出至少两个容易犯的错误,以及怎样提前发现?
  5. 我能否把本课方法用于一个真实任务,并留下可检查的成果?

示例

示例1:虚假论文

AI给出一个看似真实的论文标题和DOI,但数据库中查不到。

结论:文献必须在真实数据库核验。

示例2:上传企业资料

把未公开合同、客户名单直接上传公共AI,可能造成隐私和商业秘密风险。

结论:先判断数据敏感性和使用政策。

常见误区

  • “AI只是工具,所以不用考虑隐私。”——输入数据可能进入外部服务。
  • “AI生成的参考文献格式正确就是真的。”——格式正确也可能是虚构。
  • “改几个词就不算学术问题。”——关键在成果真实性、署名和规则。

小测验

点击题目查看答案。

1. AI“幻觉”通常指什么?
  1. A. 网页加载慢
  2. B. 生成看似合理但不真实或无依据的内容
  3. C. GPU过热
  4. D. 账号忘记密码
答案:B

幻觉是生成内容与事实或依据不一致的问题。

2. 核验一条关键法规最可靠的做法是什么?
  1. A. 看AI语气
  2. B. 找权威官方原文并核对日期
  3. C. 让AI生成更多细节
  4. D. 看字数
答案:B

法规和政策应回到权威原文和最新版本。

3. 下面哪项通常不应直接上传公共AI?
  1. A. 公开课目录
  2. B. 公司未公开客户名单
  3. C. 公开论文摘要
  4. D. 公开比赛名称
答案:B

未公开客户数据属于敏感业务信息。

实践任务

做一次信息分级

列出你日常会接触的10类信息,把它们分为“可公开”“内部/谨慎”“敏感不上传”,并说明理由。

提交物:10项信息分级表。

完成标准

  • 至少3个等级
  • 包含个人信息和商业信息
  • 理由清楚