AgentAlgorithms 第 01 篇:后训练算法全景与概念分层 从数据、目标、参数、优化器与交互方式五个维度,建立 SFT、LoRA、DPO、PPO、GRPO、RLHF 与 RLVR 的后训练算法地图。 2026/07/13
AgentAlgorithms 第 02 篇:SFT 原理 从监督信号、Teacher Forcing、Response Masking、Token 级交叉熵到训练流水线,系统拆解 SFT 如何把示范数据变成模型行为。 2026/07/14
AgentAlgorithms 第 03 篇:LoRA 原理 从低秩更新假设、矩阵分解、缩放初始化到目标层注入与 Adapter 生命周期,解释 LoRA 如何降低可训练参数而保持完整前向计算。 2026/07/15
AgentAlgorithms 第 04 篇:QLoRA 原理 从 4-bit 量化底座、NF4、Double Quantization 到 Paged Optimizer,完整解释 QLoRA 的精度、梯度、显存和训练稳定性边界。 2026/07/17
AgentAlgorithms 第 05 篇:知识蒸馏原理——从 Soft Target 到大语言模型的过程蒸馏 从 Teacher/Student、Soft Target、Logit Distillation 到推理过程蒸馏,梳理大语言模型知识蒸馏的目标、数据、损失与工程流程。 2026/07/18
AgentAlgorithms 第 06 篇:RLHF 完整流程——从人类偏好到 KL 约束的 PPO 策略优化 从 SFT、偏好数据、Reward Model 到 PPO 与 KL 约束,沿数据流、模型角色和梯度边界拆解经典 RLHF 训练闭环。 2026/07/19
AgentAlgorithms 第 07 篇:Reward Model——从偏好比较到可优化的标量奖励 从偏好样本、Bradley–Terry 损失、Scalar Head 到训练评估与 Reward Hacking,完整理解 Reward Model 如何把比较反馈变成标量信号。 2026/07/20
AgentAlgorithms 第 08 篇:PPO——从策略梯度、裁剪目标到 LLM 在线后训练 从 Token 级 MDP、Actor/Critic/Reference/Reward 四类模型到 GAE、Clip Objective 与在线 Rollout,系统拆解 LLM 场景下的 PPO。 2026/07/21