AI 模型是如何训练的:监督学习、无监督学习、强化学习、迁移学习等
一份通俗易懂的指南,讲解 AI 和 ML 模型是如何训练的 - 各种学习范式(监督学习、无监督学习、半监督学习、自监督学习、强化学习),基础模型如何被适配(提示工程、RAG、微调、迁移学习),以及评估、过拟合和 AIF-C01 等基础 AI 考试所测试的核心概念。
问十个人"AI 模型是如何训练的?",你会得到十个不同的答案,因为并不存在单一的方法。正确的方法取决于两个问题:你拥有什么数据,以及你是要从头构建一个模型,还是要适配一个已经存在的模型?把这两点弄清楚,那一整套令人眼花缭乱的术语 - 监督学习、无监督学习、强化学习、迁移学习、微调、RAG、RLHF - 就会归入一张简单的地图。
本指南将从头到尾走一遍这张地图。它与具体厂商无关(这些概念在 AWS、Azure、Google Cloud 以及其他任何平台上都是一样的),但它是针对基础 AI 认证撰写的 - AWS AI Practitioner (AIF-C01)、Azure AI Fundamentals、Google Cloud Generative AI Leader 及其同类考试测试的正是这些理念。当某个考试以特定方式侧重某个概念时,会有一条"考试要点"提示。本文篇幅较长;请把它当作一份按章节浏览的参考资料。
组织一切的两个问题
人们常常混淆"训练"的两种不同含义:
- 模型如何从数据中学习 - 即学习范式。这关乎你数据的形态(有标签?无标签?还是一个奖励信号?),它决定了适用哪一类算法。监督学习、无监督学习、半监督学习、自监督学习和强化学习都属于这里。
- 你如何适配一个现有模型 - 即定制阶梯。现代 AI 很少从零开始。你拿一个预训练的基础模型来适配它,从廉价的提示词微调到昂贵的重新训练不等。提示工程、RAG、微调和继续预训练都属于这里。
把这两种含义区分开。第一个是"这是一个什么样的学习问题?"第二个是"给定一个已经存在的模型,我要改动多少?"大多数考试题目实际上是在问某个场景应归入哪个类别。
第 1 部分:学习范式
监督学习
是什么。 模型从带标签的示例中学习 - 输入与正确答案配对。你给它看成千上万封被标记为垃圾邮件或非垃圾邮件的电子邮件,它就学会从邮件到标签的映射。
为什么。 当你拥有带标签的数据和一个明确的预测目标时,这是最直接、最准确的方法。它驱动着生产环境中大多数经典的 ML。
怎么做。 按预测内容分为两个子类型:
- 分类 - 预测一个类别(是否为垃圾邮件、20 种疾病中的哪一种、欺诈还是合法)。
- 回归 - 预测一个连续的数值(房价、明天的需求、预期营收)。
你把带标签的数据划分开,训练模型以最小化对照已知答案的误差,并衡量它对留出示例的预测效果如何。
考试要点。 触发短语是"带标签的数据"。如果某个场景给你的是带有已知正确输出的输入,并要求你预测一个类别或一个数值,那就是监督学习。分类还是回归,取决于答案是一个类别还是一个数字。
无监督学习
是什么。 模型从无标签的数据中学习 - 不提供正确答案。它自行发现结构。
为什么。 现实世界中的大多数数据都没有标签,而打标签成本高昂。当你想发现模式而不是预测一个已知目标时,这就是合适的工具。
怎么做。 主要任务有:
- 聚类 - 将相似的条目分组(客户细分、按主题对文档分组)。
- 降维 - 在保留信号的同时把众多特征压缩成少数几个(用于可视化,或加速下游模型)。
- 异常检测 - 标记出不符合已学到模式的点(欺诈、入侵、缺陷零件)。
考试要点。 触发词是"无标签的数据"加上诸如"细分""分组"或"找出异常"之类的目标。用于客户细分的聚类是你会见到的最常见的无监督学习示例。
半监督学习
是什么。 一种中间地带:少量带标签的数据加上一大批无标签的数据。
为什么。 打标签代价高昂;往往你只负担得起标注其中一小部分。半监督学习用这少量标签来引导对更大规模无标签数据集的学习,取得比仅靠标签所能达到的更好结果。
怎么做。 典型模式:在带标签的子集上训练,用该模型为无标签数据打标签(伪标签),然后在合并后的数据集上重新训练。它降低了标注成本,并能改善泛化能力。
自监督学习
是什么。 模型从原始数据中创造自己的标签,因此无需人工打标签。经典的例子是:隐藏句子中的下一个词,训练模型来预测它。
为什么。 这正是现代基础模型和大语言模型进行预训练的方式。互联网上的原始文本、图像和代码远远超过任何人所能标注的数量,而下一个词元(或被遮蔽词元)的预测把所有这些都转化为训练信号。
怎么做。 模型在海量数据集上被训练去填补或预测其自身输入的部分内容。其结果是一个具有广博通用知识的基座模型 - 表达流畅,但尚未对齐到遵循指令或匹配人类偏好。
考试要点。 你也许不会经常看到"自监督"这个名词,但你必须知道基础模型是一个在海量、大多无标签的数据上预训练出来的大型模型,而正是这种预训练使它能够适配众多下游任务。
强化学习(以及 RLHF)
是什么。 一个智能体通过与环境交互来学习:它采取一个动作,获得奖励或惩罚,并进行调整以最大化长期奖励。这里没有带标签的标准答案 - 只有关于某个动作有多好的反馈。
为什么。 它适用于事先并不知道"正确"行动是什么的序贯决策问题:博弈、机器人、推荐、控制系统。
怎么做。 智能体观察一个状态,选择一个动作,获得一份奖励,转移到一个新状态,然后重复这个过程 - 逐渐学到一个策略(一套战略),随时间推移赢得最多的奖励。
RLHF(基于人类反馈的强化学习) 是最著名的应用。在一个语言模型完成预训练之后,人类对它的输出进行排序;这些排序训练出一个奖励模型;然后强化学习调整该语言模型,使其产生奖励模型评分高的输出。这是现代聊天助手既有帮助又对齐、而不仅仅是表达流畅的一个主要原因。
考试要点。 触发点是"从反馈 / 奖励 / 试错中学习"。一个通过因良好回复而获得奖励来改进的聊天机器人就是强化学习。要知道 RLHF 是 LLM 对齐到人类偏好的方式。
第 2 部分:ML 生命周期
训练是一个循环中的一步,而不是全部。标准的生命周期为:
- 界定问题 - 你在预测什么,以及 ML 是否真的是合适的工具?(有时一条简单的规则胜过一个模型。)
- 收集并准备数据 - 采集、清洗,并在需要时打标签。
- 探索性数据分析 (EDA) - 在建模之前检查分布、相关性和数据质量。
- 特征工程 - 运用领域知识来创建或转换输入变量,使模式更易于学习。
- 训练 - 在训练数据上拟合模型。
- 评估 - 在模型未见过的数据上衡量性能。
- 部署 - 提供模型进行预测(这称为推理)。
- 监控 - 关注漂移和性能退化,并在需要时重新训练。
训练集、验证集和测试集的划分。 你绝不能用模型训练时所用的数据来评判它。把数据划分开:训练集用于拟合模型,验证集用于调整设置和比较候选方案,测试集在其他任何地方都未使用过的数据上给出最终的、诚实的评估。一种常见的划分大致是 80/20,其中训练部分再次划分出验证集。
考试要点。 要知道推理是在新数据上使用一个已训练好的模型(与训练相对),而特征工程意味着运用领域知识从原始数据中创造出更好的输入。
第 3 部分:拟合与泛化
整个游戏的核心是泛化 - 在新数据上表现良好,而不仅仅在训练数据上。
- 过拟合 - 模型记住了训练数据(包括其中的噪声),却在新数据上失败。症状:训练准确率高、生产准确率差;或者随着训练时间加长,准确率先改善后退化。修复办法:更多(且更多样)的训练数据、正则化、提前停止、dropout,或者一个更简单的模型。
- 欠拟合 - 模型过于简单,无法捕捉模式,甚至在训练数据上都表现不佳。修复办法:一个能力更强的模型、更好的特征,或更多的训练。
- 偏差-方差权衡 - 偏差是来自过于简单的模型的误差(欠拟合);方差是来自过于复杂的模型的误差(过拟合)。更高的复杂度降低偏差但抬高方差。艺术在于平衡两者。
考试要点。 "在训练数据上表现出色、在生产环境中表现糟糕"是过拟合的标志;预期答案是更多数据、正则化或提前停止。不要把它和欠拟合(哪里都表现糟糕)混淆。
第 4 部分:如何衡量一个模型
你无法改进你无法衡量的东西,而正确的指标取决于任务。
分类指标。
- 准确率 (Accuracy) - 预测正确的比例。类别均衡时很合适;不均衡时具有误导性。
- 混淆矩阵 - 真正例、假正例、真负例和假负例的完整表格。其他一切都由它推导而来。
- 精确率 (Precision) - 在你标记为正例的条目中,有多少真的是正例。(惩罚假正例。)
- 召回率(敏感度) - 在真正为正例的条目中,你抓到了多少。(惩罚假负例。)
- F1 分数 - 精确率和召回率的调和平均,用一个数字平衡两者。
- AUC(ROC 曲线下面积) - 与阈值无关地衡量模型分离各类别的能力。
回归指标。
- RMSE(均方根误差) 和 MAE(平均绝对误差) - 预测值与真实数值相差多远。
生成式与语言指标。
- BLEU - 对照人工参考译文的翻译质量。
- ROUGE - 摘要质量(与参考摘要的重叠度)。
- BERTScore - 使用嵌入衡量与参考文本的语义相似度。
- 人工评估 - 对于开放式生成输出仍是黄金标准。
考试要点。 业务代价决定指标。当漏报的代价远高于误报时(欺诈、疾病筛查),要优化召回率。准确率是均衡分类的默认选择;想要完整的细分时用混淆矩阵;翻译/摘要用 BLEU/ROUGE。
第 5 部分:超参数与训练动态
超参数是你在训练之前选定的设置(与模型学习到的权重相对)。关键的有:
- 训练轮数 (Epochs) - 模型遍历训练数据的次数。太少会欠拟合;太多会过拟合。
- 学习率 - 模型更新时迈出的步子有多大。太高就永远无法稳定下来;太低就爬行不前。
- 批量大小 (Batch size) - 每次更新使用多少个示例。
超参数调优是对最佳组合的搜索;它通常是自动化的(例如通过 AutoML 工具)。
不要把训练超参数与生成式模型上的推理时设置混淆:
- 温度 (Temperature) - 低温(接近 0)给出确定性的、可重复的输出;高温给出富有创意的、多变的输出。
- top-p / top-k - 限制模型可从中采样的候选词元。
考试要点。 "让模型的答案更一致/更可重复"意味着降低温度。"通过更多训练来提高准确率"指向更多的训练轮数(以过拟合为需要注意的告诫)。
第 6 部分:适配基础模型 - 定制阶梯
你很少从头训练一个大型模型。你拿一个预训练的基础模型来适配它。这些方法,按从最廉价最快速到最昂贵排序,是整份指南中与考试最相关的一个理念。
迁移学习(统领性的理念)
是什么。 重用模型在一个任务上学到的知识来做一个相关的任务。你不是从随机权重开始,而是从一个已经理解语言或图像的模型开始。
为什么。 它大幅削减你所需的数据和算力。这是下面几乎所有内容背后的原理 - 微调就是实现迁移学习的一种具体方式。
考试要点。 "适配一个预训练模型来完成一个新任务,而不是从头构建"就是迁移学习,其好处是更少的数据、更少的时间、更低的成本。
第 1 级:提示工程
是什么。 改变你给模型的指令,而不是模型本身。什么都不重新训练。
怎么做。 技巧有:
- 零样本 (Zero-shot) - 直接问,不给示例。
- 单样本 / 少样本(上下文学习) - 在提示中包含几个已解答的示例,让模型推断出模式。这在零参数更新的情况下适配了行为。
- 思维链 - 对于较难的问题,要求模型逐步推理。
- 提示模板 - 标准化的、可重用的提示结构。
为什么。 最廉价、最快速、无需基础设施。总是先试这个。
考试要点。 少样本学习和上下文学习是同一个理念:提示中的示例,不重新训练。当任务与模型在训练中所见相去甚远时,零样本有出结果不佳的风险。
第 2 级:检索增强生成 (RAG)
是什么。 在查询时从你自己的数据中获取相关事实并将其添加到提示中,从而让模型基于它从未被训练过的最新的、私有的或权威的信息来回答。
怎么做。 把你的文档转换成嵌入(捕捉含义的数字向量),存入向量数据库,检索出与用户问题最接近的片段,并将它们连同问题一起喂给模型。
为什么。 它把答案锚定在你的数据上,并在无需任何重新训练的情况下大幅减少幻觉。当你的知识频繁变化时非常理想 - 你更新文档,而不是模型。
考试要点。 "把模型锚定在公司数据上 / 减少幻觉 / 在不重新训练的情况下保持答案最新"就是 RAG。嵌入是让检索得以运作的数字表示。
第 3 级:微调
是什么。 在你自己的带标签示例上继续训练模型,使它内化一项任务或一种风格。
怎么做。 提供带标签的数据 - 通常是提示与补全的配对。指令微调使用格式化为指令的输入-输出配对;领域适配教授专门的行为(例如处理科学或法律术语)。参数高效微调 (PEFT),例如 LoRA,只更新模型参数的一小部分,在冻结模型大部分的同时削减成本。
为什么。 当提示和 RAG 不够用,而你需要模型可靠地以某种方式行事时。它的成本(数据、算力)高于上面的级别。
考试要点。 微调需要带标签的数据(提示-补全配对)。将它用于一致的任务行为或领域适配;它改变模型,而 RAG 不动模型、在查询时提供上下文。
第 4 级:继续预训练
是什么。 在大量无标签的领域文本上继续对基座模型进行预训练。
为什么。 为了大规模地教会模型某个专门领域(医学、法律、科学)的词汇和概念,或随着数据演变而保持其最新。比微调更昂贵。
考试要点。 继续预训练使用大量无标签的领域文本以掌握词汇和概念;指令微调使用带标签的指令配对以形成任务行为。不同的数据,不同的目标。
一行总结的成本阶梯
提示工程(最廉价,不重新训练)-> RAG(在查询时添加你的数据)-> 微调(在带标签的示例上重新训练)-> 继续预训练(在无标签的领域文本上重新训练)-> 从头完整预训练(罕见,最昂贵)。只爬到问题所要求的高度即可。
第 7 部分:让模型更小更快
一旦一个模型能工作,你往往需要它更便宜或更低延迟:
- 知识蒸馏 - 训练一个小的"学生"模型来模仿一个大的"教师"模型,以一小部分的体积保留大部分的质量。
- 量化 - 以更低的数值精度存储权重(例如用 8 位而非 32 位),以缩小并加速模型。
- 剪枝 - 移除贡献甚微的权重或结构。
第 8 部分:架构简述
上面的范式是模型学习的方式;架构则是模型由什么构建而成。你应当认识这些名称:
- 神经网络 / 深度学习 - 学习层次化特征的分层网络;现代 AI 的基础。
- CNN - 专为图像而设。
- RNN - 为序列而建(在很大程度上已被 transformer 取代)。
- Transformer - 现代 LLM 背后的架构;即生成式预训练 transformer(generative pre-trained transformer)中的"GPT",以及 BERT 之类的模型。
- GAN - 两个网络相互竞争以生成逼真的合成数据。
- 扩散模型 - 通过学习逆转一个加噪过程来生成图像。
对于一场基础考试,你不需要去实现这些,但你应当知道,例如 transformer 驱动 LLM,而 GAN 生成合成数据。
30 秒决策指南
- 带标签的数据,预测一个类别或数值 -> 监督学习(分类或回归)
- 无标签的数据,找出分组或异常 -> 无监督学习(聚类、异常检测)
- 少量标签加上大量无标签数据 -> 半监督学习
- 模型从原始数据中创造自己的标签(基础模型预训练的方式)-> 自监督学习
- 智能体从奖励 / 反馈中学习 -> 强化学习;将 LLM 对齐到人类偏好 -> RLHF
- 为一个相关任务重用一个预训练模型 -> 迁移学习
- 适配一个基础模型,先从最廉价的开始 -> 提示工程,然后 RAG,然后微调,然后继续预训练
- 把答案锚定在你自己的最新数据上,不重新训练 -> RAG
- 在训练数据上表现出色、在生产环境中表现糟糕 -> 过拟合(更多数据、正则化、提前停止)
- 漏掉一个正例代价高昂(欺诈)-> 优化召回率
- 让生成式输出更一致 -> 降低温度
相关认证
这些学习方法的基础知识是每一场基础 AI 考试的核心 - 本指南出现在它们各自主页的"相关学习指南"下:
- AWS Certified AI Practitioner (AIF-C01) - 本指南所针对调优的考试;领域 1-3 大量依赖这些概念。
- AWS Certified Machine Learning Engineer Associate (MLA-C01) - 在生命周期、训练和评估方面更深入。
- Microsoft Azure AI Fundamentals (AI-900 / AI-901) - 测试相同的学习范式和 ML 基础知识。
- Google Cloud Generative AI Leader - 基础模型、提示和适配。
- NVIDIA-Certified Associate: Generative AI and LLMs (NCA-GENL) - LLM 训练与适配。
- IBM watsonx Generative AI Engineer Associate - 生成式 AI 基础。
- Claude Certified Architect - Foundations (CCA-F) - 基础模型概念。
如何学习这部分内容
对于一场基础考试,不要去死记算法 - 要练习分类判断。读每一个场景,问那两个组织性的问题:我拥有什么数据(带标签、无标签、奖励),以及我是在构建还是在适配?这会在几秒钟内把你导向正确的范式或定制阶梯的正确一级。打开 30 秒决策指南来做练习题,当你做错一道时,回到这里对应的章节,直到那条边界变得清晰。区分能通过和不能通过的人的那些概念,正是边缘模糊的那些:监督学习与无监督学习、微调与 RAG、过拟合与欠拟合,以及定制阶梯的成本次序。
来源:AWS Certified AI Practitioner (AIF-C01) 考试指南及题目领域,以及标准的机器学习参考资料,截至 2026 年 9 月。