JUPITER'S LAB · RESEARCH TRACK
Agent 算法
从 SFT、LoRA、QLoRA 到 DPO、PPO、GRPO 与在线多轮 Agent 强化学习,系统梳理 Agent 模型训练算法。
- 公开文章
- 16
- 阅读顺序
- 按发布时间 · 早→晚
- 上一级
- Agent 技术
Agent 算法
从 SFT、LoRA、QLoRA 到 DPO、PPO、GRPO 与在线多轮 Agent 强化学习,系统梳理 Agent 模型训练算法。
JUPITER'S LAB · RESEARCH TRACK
从 SFT、LoRA、QLoRA 到 DPO、PPO、GRPO 与在线多轮 Agent 强化学习,系统梳理 Agent 模型训练算法。
从 SFT、LoRA、QLoRA 到 DPO、PPO、GRPO 与在线多轮 Agent 强化学习,系统梳理 Agent 模型训练算法。