lmcc学习资料(自用误传,非水帖子)
2026-08-27 21:50:48
发布于:新疆
LMCC-T 第一轮学习笔记:8 月 27 日(Day 1 PPT)
使用说明:
本笔记严格按照 `LMCC大模型基础与预训练` 的顺序整理。每节标出对应 PDF 页码,并包含“术语解释—形象例子—考点—易错点”。
一、考试地图(P1—P3)
- 第一轮:30 道单项选择题,满分 100 分,考试时间 120 分钟。
- 第 1—10 题:基础题;第 11—15 题:理解辨析题;第 16—20 题:计算题,以上每题 3 分。
- 第 21—30 题:三组材料题,每题 4 分;通常分为简单程序、较难程序、长论文阅读三类材料。
- 每题答完后要点击“递交评测”;一场最多递交 32 次,最后一次结果有效,不自动递交。
考场口诀:”逐题递交,先易后难;计算写式,材料找证。“
二、人工智能与机器学习(P4—P29)
1. 人工智能(Artificial Intelligence, AI)
让机器表现出类似人类智能的行为,例如感知、理解、规划、判断和生成。
形象例子:普通定时闹钟只是固定规则;能听懂“明早下雨就提前十分钟叫我”的助手,需要理解语言和环境信息,更接近 AI。
考点:机器学习是实现 AI 的重要方法,但 AI 不等于机器学习;规则系统也可能属于 AI。
2. 图灵与人工智能发展
- 图灵提出图灵机等重要思想,被称为人工智能先驱。
-人工智能发展经历符号与规则、专家系统与知识工程、机器学习与神经网络等浪潮。
考点:技术发展并非一直上升,会受到算力、数据、算法和应用条件限制。
3. 机器学习(Machine Learning, ML)
机器从数据中发现规律,并用规律完成预测或决策,而不是由程序员把每一条规则都写死。
形象例子:不是把“猫的所有规则”写给机器,而是给它看大量猫和非猫图片,让它总结区别。
4. 机器学习基本流程
"数据预处理 → 模型训练 → 模型验证 → 模型测试"
- 数据预处理:清除缺失、错误、重复、格式混乱等“脏数据”。
- 训练:模型利用训练数据调整参数、学习规律。
- 验证:训练过程中检查效果、选择模型和超参数。
- 测试:用模型从未见过的数据进行最终评价。
形象例子:整理教材→日常练习→模拟考试→密封期末考试。
易错点:测试集不是训练材料,不能为了提高测试分数反复调整模型。
5. 监督学习与无监督学习
- 监督学习:训练数据带有标签,好像练习册附有标准答案。
- 无监督学习:数据没有人工标签,模型自己发现结构,好像把一堆没写名字的水果按相似程度分组。
考点:分类、回归通常属于监督学习;聚类、降维通常属于无监督学习。
6. 分类、回归、聚类、降维
- 分类(Classification):预测离散类别,如“猫/狗”“垃圾邮件/正常邮件”。
- 回归(Regression):预测连续数值,如气温、房价、身高。
- 聚类(Clustering):把相似数据自动归为一组,组名不一定预先给出。
- 降维(Dimensionality Reduction):在尽量保留重要信息时减少特征数量。
口诀:分类问哪类,回归问多少,聚类自己抱团,降维压缩重点。
7. 混淆矩阵
- TP:真实为正,预测也为正。
- FP:真实为负,却预测为正,称“误报”。
- FN:真实为正,却预测为负,称“漏报”。
- TN:真实为负,预测也为负。
常考方向:
- Precision(精确率)关注“预测为正的结果中有多少是真的”,怕误报。
- Recall(召回率)关注“所有真实正例中找回了多少”,怕漏报。
火警例子:警报响了 10 次,只有 6 次真着火,Precision 为 6/10;实际发生 8 次火灾,发现 6 次,Recall 为 6/8。
8. 训练集、验证集、测试集
- 训练集:直接用来学习参数,像日常练习。
- 验证集:选择方案、调整超参数,像模拟考。
- 测试集:最终公平评分,像密封期末卷。
9. 过拟合、欠拟合与泛化
- 过拟合(Overfitting):训练集很好,新数据很差;像死记答案。
- 欠拟合(Underfitting):模型太简单或训练不足,训练集也学不好。
- 泛化(Generalization):面对没见过的数据也能表现良好。
- 交叉验证(Cross-validation):把数据轮流分成训练部分和验证部分,多次评估,降低一次划分带来的偶然性。
三、语言与大语言模型(P38—P54)
10. 语言的三个特点
- 任意性:同一动物中文叫“狗”,英文叫“dog”,符号与事物的对应来自约定。
- 创造性:有限词汇和规则能组合出无数新句子,像乐高积木。
- 离散性:语言由一个个可区分的音、字、词等基本单位组成,小改动可能改变意思。
11. Token 与编码
计算机不能直接理解文字,需要先切分(tokenize),再把 Token 编成数字 ID。
- Token:模型处理文本的基本单位,可能是一个字、一个词、一个子词或标点。
- Tokenizer:把文本切成 Token,并在 Token 与 ID 之间转换的工具。
- 词表(Vocabulary):模型认识的 Token 与 ID 对照表。
易错点:一个 Token 不一定等于一个汉字,也不一定等于一个英文单词;不同模型的切分结果可能不同。
12. 语言模型(Language Model, LM)
学习语言序列的概率规律,用来预测未来或缺失的 Token。
形象例子:“床前明月___”中,“光”的概率通常很高。语言模型本质像概率版文字接龙。
13. 语言模型发展阶段
- 统计语言模型:常用 n-gram 和马尔可夫假设,根据有限邻近词预测。
- 神经语言模型:利用神经网络和词向量,能捕捉更长关系。
- 预训练语言模型:先在大规模无标注文本上学习通用表示,再适配任务。
- 大语言模型(LLM):参数、数据和算力规模很大,具备较强通用能力。
考点顺序:**N-gram → 神经网络/RNN → Transformer 与预训练模型 → 大语言模型。**
14. 大语言模型的优势与局限
优势:语言理解、生成、问答、总结和迁移能力强。
局限:可能出现事实错误、偏见和不安全回答;规模大也不表示所有任务都超过人类。
易错词:“完全不会”“所有任务”“唯一架构”“必然正确”通常值得警惕。
15. GPT、BERT、T5
- GPT:通常是仅解码器/因果解码器架构,擅长根据上文生成下文。
- BERT:编码器架构,双向理解上下文,常用于理解类任务。
- T5:编码器—解码器架构,适合翻译、摘要等序列到序列任务。
注意:“更适合”不等于“只能做”。
四、注意力与主流架构(P55—P67)
16. 自注意力(Self-Attention)
处理一个 Token 时,让它参考同一序列中的其他 Token,并根据相关程度分配不同权重。
形象例子:“小明把苹果给小华,因为他饿了。”理解“他”时,要把注意力手电筒照向更相关的人名。
17. 自注意力与交叉注意力
- 自注意力:Q、K、V 来自同一个序列,完成序列内部的信息交流。
- 交叉注意力:Q 来自一个序列,K、V 来自另一个序列,例如翻译时输出端查询输入句子。
18. Query、Key、Value
- Query(查询):我想找什么?
- Key(键):我有什么标签可供匹配?
- Value(值):匹配后真正取走的信息。
图书馆例子:问题是 Query,书脊标签是 Key,书中内容是 Value。
基本流程:
"Attention(Q,K,V) = softmax(QKᵀ / √d_k)V"
1. Q 与 K 点积,得到相关分数。
2. 除以 `√d_k`,避免分数过大。
3. softmax 把分数变成和为 1 的权重。
4. 用权重对 V 加权求和。
19. 编码器、解码器与三种架构
- 编码器:把输入转成上下文表示,像图书管理员整理和提炼资料。
- 因果解码器:只能看当前位置之前的信息,逐 Token 生成,GPT 是代表。
- 编码器—解码器:编码器理解输入,解码器据此生成输出,T5 是代表。
考点:BERT 偏编码器;GPT 偏因果解码器;T5 偏编码器—解码器。
五、训练与预训练(P68—P94)
20. 大模型训练三阶段
`预训练 → 指令微调 → 人类对齐`
Day 1 重点是预训练;后两阶段在 Day 2 详细学习。
21. 训练与推理
- 训练:用数据调整模型参数,消耗时间和算力,像学生长期学习。
- 推理:参数基本固定,用已学知识回答新问题,像参加考试。
22. 参数、超参数、权重、检查点
- 参数/权重:模型从数据中学到的内部数值,像脑中逐渐形成的连接。
- 超参数:训练前由人设置的配置,如批次大小、学习率,像烤箱温度和时间。
- 检查点(Checkpoint):训练过程中保存的模型状态,像游戏存档。
- 显存:GPU 用来放模型、数据和中间结果的高速空间;批次过大可能“爆显存”。
23. 预训练(Pre-training)
在大量文本上先学习通用语言规律和知识,得到较好的初始权重。
形象例子:在做专项竞赛题前,先完成小学、初中、高中的基础学习;预训练不是针对某一个用户问题背答案。
24. 预训练数据处理
`数据采集 → 质量过滤 → 隐私保护 → 去除重复 → 词元化`
- 数据可能来自网页、书籍、代码和公开数据集。
- 质量过滤可用启发式规则或训练分类器。
- 隐私保护要去除姓名、地址、电话等可识别个人信息(PII)。
- 去重防止模型过度记忆重复内容。
- 常见公开语料来源包括 Common Crawl、Wikipedia 等。
形象例子:采菜→挑坏叶→去掉不该公开的标签→合并重复食材→切成适合下锅的小块。
25. 自监督学习(Self-supervised Learning)
不依赖人工逐条标注,而是从数据自身构造监督信号。
形象例子:把原句中的词遮住,原句本身就是标准答案;“题目”和“答案”都来自同一份数据。
26. 自回归与下一个词元预测
根据前面的 Token 预测下一个 Token,具有单向性和逐步累积性。
例子:“一心一___”预测“意”;生成的新 Token 会加入上下文,再预测下一个。
27. 掩码预测(Masked Prediction)
故意遮住输入的一部分,让模型根据左右上下文恢复缺失内容。
例子:“小明今天很 [MASK],因为得到新玩具。”模型结合前后文猜“高兴”。
文本掩码预测处理离散 Token;图像掩码预测通常恢复被遮挡的像素或图像块。
28. 对比学习(Contrastive Learning)
让相似样本的表示靠近,让不相似样本的表示远离。
例子:同一只猫的裁剪图和原图是正样本对;猫图与汽车图是负样本对。像“找同类”游戏。
29. 多任务学习(Multi-task Learning)
让模型共享部分参数,同时学习多个相关任务,利用任务之间的共同知识提高泛化能力。
例子:同一个学生同时学习阅读理解、情感判断和问答,语言基础可以互相帮助。
六、Day 1 高频辨析
1. 监督学习有人工标签;自监督学习的标签来自数据本身。
2. 分类预测离散类别;回归预测连续数值;聚类没有预设标签地分组。
3. 验证集用于选择和调整;测试集用于最终评价。
4. 自回归看前文逐步生成;掩码预测利用被遮盖位置两侧信息。
5. 自注意力在一个序列内部;交叉注意力连接两个序列。
6. 预训练学习通用能力;它不是专门让模型服从具体人类指令。
七、Day 1 自测
1. 预测明天气温属于分类、回归还是聚类?
2. 为什么不能反复用测试集调模型?
3. 说明过拟合和欠拟合的区别。
4. Token 为什么不一定等于一个词?
5. GPT、BERT、T5 分别更接近哪种架构?
6. 在注意力公式中,Q、K、V 各是什么角色?
7. 数据去重为什么重要?
8. 自回归、掩码预测、对比学习各像什么游戏?
9. 文本掩码与图像掩码的操作对象有何不同?
10. 多任务学习为什么可能提升泛化?
参考要点:回归;保持终评公平;训练好新题差/连训练也差;
切分规则不同;因果解码器/编码器/编码器—解码器;
问题/标签/内容;避免重复模式被过度记忆;
接龙/完形填空/找同类;离散 Token/像素或图像块;
共享共性知识。





误传,此贴纯手工制作,仅作者大大使用
版权:@꧁༺神༒曦༻꧂
欢迎各位大佬纠错,点个赞[磕头磕头]


全部评论 1
- 置顶
不喜勿喷
关注回关
努力维护,学习社区19小时前 来自 新疆
0
19小时前 来自 新疆
0
















有帮助,赞一个