ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

2.4 后训练技术:SFT与RLHF从原理到实战

2.4 后训练技术:SFT与RLHF从原理到实战

后训练技术:SFT与RLHF从原理到实战

指令遵循、对齐人类偏好,读懂大模型如何「听话」。本节基于《AI工程》第2章「Post-Training」— Supervised Finetuning、Preference Finetuning。

一、什么是后训练?

Chip Huyen 在《AI工程》第2章将后训练(Post-Training)列为理解基础模型的核心环节。后训练是指在预训练之后,通过额外数据对模型进行优化,使其更符合任务需求人类偏好。主要包括:

  • SFT(Supervised Finetuning):监督微调,提升指令遵循
  • RLHF/DPO(Preference Finetuning):偏好微调,减少幻觉与有害输出

书中强调,后训练是连接「通用预训练模型」与「可用的应用模型」的关键桥梁。


二、监督微调(SFT)

2.1 原理

《AI工程》描述:在(指令, 期望输出)对上训练,让模型学会按要求生成。SFT 是提升指令遵循能力的最直接方式。

返回列表