AgentAlgorithms 第 09 篇:DPO——从 KL 正则化 RLHF 到一个二元分类损失 从 KL 正则化奖励最大化、隐式奖励到 Chosen/Rejected 对数概率差,推导 DPO 如何把偏好对齐改写为离线二元分类损失。 2026/07/23
AgentAlgorithms 第 10 篇:DPO 变体横向比较——IPO、KTO、ORPO 与 SimPO 以 DPO 为基线,对比 IPO、KTO、ORPO 与 SimPO 的数据形态、Reference 依赖、损失函数、长度归一化与适用边界。 2026/07/24
AgentAlgorithms 第 11 篇:ORM、PRM 与 Verifier——从结果监督、过程监督到可验证反馈 统一比较 ORM、PRM、Reward Model 与 Verifier,解释结果监督、过程监督、执行验证以及 Agent 轨迹评价如何进入训练和推理。 2026/07/25
AgentAlgorithms 第 12 篇:RLVR——基于可验证奖励的强化学习 从可验证任务形式化、奖励来源、Verifier 训练环境到 PPO/GRPO/RLOO 和 Agent 场景,系统拆解 RLVR 的在线训练闭环。 2026/07/26
AgentAlgorithms 第 13 篇:GRPO——组内相对优势策略优化 从组采样、相对优势估计、PPO 目标到奖励接入和 Agent 轨迹扩展,系统解释 GRPO 如何在不训练独立 Critic 的情况下优化策略。 2026/07/27
AgentAlgorithms 第 14 篇:Agent 轨迹 SFT 从单轮答案监督转向多步 Agent 轨迹监督,梳理状态、动作、工具反馈、轨迹筛选、损失掩码和长轨迹训练的完整方法。 2026/07/29
AgentAlgorithms 第 15 篇:工具调用训练 从工具选择、参数生成、结果理解到失败恢复,拆解 Tool Calling 训练的任务分解、数据构造、辅助损失、多步调用与安全边界。 2026/07/30
AgentAlgorithms 第 16 篇:在线多轮 Agent 强化学习 从环境初始化、观察—决策—工具执行闭环到长时程信用分配、在线策略优化、探索课程与大规模训练工程,系统梳理多轮 Agent RL。 2026/07/31