
10.1 预训练从大量数据学习通用表示预训练先用较大规模数据学习语言统计结构和可迁移表示再服务于具体任务。自监督学习的监督信号可以从原始数据构造例如遮住一个词要求恢复或者用前面的Token预测下一个Token因此不需要每条样本都由人工写标签。“无人工逐条标注”不意味着数据没有成本也不意味着数据天然可靠。采集、去重、过滤、授权、隐私保护和质量控制仍然十分重要。训练目标中的规律与现实事实之间也可能存在差异。10.2 BERT与掩码语言建模BERT通过掩码语言建模学习利用左右上下文的表示并在原始预训练方案中包含下一句预测任务。它可以在下游任务上微调应用于分类、问答和其他理解类任务。[S3]对初学者而言关键区别不是记住所有预训练细节而是理解有些模型擅长为完整输入生成表示有些模型擅长根据已有前缀逐步生成文本。选择时应看任务、训练目标和已验证能力而不是只看参数量。10.3 自回归语言建模给定序列x1到xT其联合概率可分解为各位置条件概率的乘积P(x1…xT)∏P(xtx1…x(t-1))。训练时让模型给真实下一个Token更高概率通常以各位置负对数概率之和或平均作为损失。例如前缀“电梯需要”后模型可能给“维修”“保养”“检查”等不同续写分配概率。它不是先在内部确定一篇完整文章再把文章打印出来而是在已有上下文约束下逐步生成。10.4 基础模型、指令微调和偏好优化基础模型主要学习续写分布监督指令微调SFT使用指令与回答示例让模型更习惯按要求作答。偏好优化进一步利用好坏回答的比较信号调整输出倾向。RLHF和DPO属于不同的对齐方法不能简单视为同一个算法。对齐目标通常包含有用性、风格和安全等维度但不能保证事实永远正确。模型可能变得更愿意遵循格式也可能在某些任务上出现新的偏差。因此每个训练阶段之后都需要独立评价。10.5 参数量、训练量和模型能力“4B”通常表示约40亿参数不是40亿条可逐条查找的知识。参数是网络中的数字知识和能力以分布式方式体现在这些参数以及计算过程中。更大的模型可能更强但训练数据、目标、架构、推理配置和任务匹配同样重要。参数量也不等于上下文长度。一个模型可以参数较少但支持较长输入也可以参数较大但运行时窗口较小。长上下文能否有效利用还要通过长文问答、跨段证据等任务检验。10.6 大模型为什么会出现幻觉语言建模鼓励生成符合上下文的Token不直接保证每个句子都有现实证据。问题信息不足、训练知识过时、检索失败或提示词诱导都可能导致模型生成貌似合理但不真实的内容。降低随机性可以减少部分波动却不能把错误知识变成正确知识。让模型“认真检查”也不能代替外部证据。工程上应采用可靠数据源、引用校验、结构约束、拒答与人工复核等组合措施。10.7 模型会不会从聊天里自动学习多数常见推理系统不会因为一段对话就自动更新模型权重。当前消息可能影响后续上下文应用可能把摘要写入数据库服务方也可能有另行约定的数据使用流程但这些都不是同一件事。“放入文件夹”“加入知识库”“加入当前上下文”“微调权重”是四个不同动作。要判断系统是否真正使用某份资料需要检查读取、解析、索引和检索链路而不是只看文件是否存在。10.8 本章检查点如果希望助手知道今天更新的报修制度优先维护可检索的权威资料而不是期待它自动记住硬盘上的文件。若希望它稳定采用特定输出风格再考虑指令示例或微调。