JUPITER'S LAB · RESEARCH TRACK

Agent 算法

从 SFT、LoRA、QLoRA 到 DPO、PPO、GRPO 与在线多轮 Agent 强化学习,系统梳理 Agent 模型训练算法。

公开文章
16
阅读顺序
按发布时间 · 早→晚
上一级
Agent 技术

Agent 算法

从 SFT、LoRA、QLoRA 到 DPO、PPO、GRPO 与在线多轮 Agent 强化学习,系统梳理 Agent 模型训练算法。

16 篇