全站搜索

按 Esc 关闭 · Cmd/Ctrl + K 打开

模型选择依据

角色与权重更新来自论文案例记录;“为什么选它”只有在论文或代码明确给出时才会写入,未知不会被推断成事实。

论文模型角色与选择依据状态
模型角色权重更新选择依据
Qwen2.5-3B-Instructactor未记录:需回到论文/代码核验
Qwen2.5-7B-Instructactor未记录:需回到论文/代码核验
Qwen3-1.7Bactor未记录:需回到论文/代码核验
GLM-5.2analyzer未记录:需回到论文/代码核验

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

2026-07-16 · 已核验

论文新手教学

第一次读 SEED?从这里开始

先用无 GPU 路径理解机制,再做缩小规模的方法验证;只有模型、数据、环境、超参数和 8×A800 80GB 训练条件都对齐时,才进入严格复现。

建议先完成“理解机制”。如果没有多卡训练资源,方法验证仍然有价值,但结果必须标成 mechanism smoke test,不能与论文主表分数直接比较。

训练结构Stage 1 hindsight-skill SFT + Stage 2 自进化 OPD/GRPO论文 §3 ↗
无需 GPU

理解机制

建议从这里开始

能用自己的话解释 SEED 解决了什么监督缺口、两阶段如何连接,以及它为什么不等于外部记忆。

  1. 先读问题,不先读公式

    长程智能体通常只在整条轨迹结束后得到稀疏奖励;这个奖励无法指出中间哪次观察、动作或工具调用值得强化。

    完成标志:你能区分 trajectory-level outcome 与 token-level learning signal。

    摘要与引言 ↗
  2. 画出 Stage 1

    普通策略先采集完整轨迹,外部分析器把成功经验或失败规避规则写成自然语言 hindsight skill,再用这些轨迹—skill 对进行 SFT。

    完成标志:你的图包含轨迹、外部分析器、skill 标注和 SFT checkpoint。

    论文 §3.2 ↗
  3. 画出 Stage 2

    最新冻结策略同时负责 rollout 与轨迹分析;同一批已采样动作在普通上下文和 skill 增强上下文中重新打分,概率差形成 OPD 信号,并与 GRPO 联合优化。

    完成标志:你能指出 actor、analyzer、旧策略、可训练策略和 OPD loss 的关系。

    论文 §3.3 ↗
  4. 确认推理边界

    hindsight skill、分析器和 skill prompt 都是训练期工具;部署时只运行已经内化这些行为变化的策略。

    完成标志:你不会把 SEED 描述成“推理时检索 skill bank”。

    官方代码 Overview ↗
缩小规模

方法验证

验证“轨迹 → hindsight skill → token 级 OPD → 策略更新”的代码和数据链是否成立,不追求论文主表分数。

  1. 只选一个环境

    新手优先从 ALFWorld 开始:官方仓库给出直接安装命令,论文也提供了详细训练动态。固定 split、reward、最大交互步数与评估指标。

    完成标志:实验清单中只有一个环境,并写明评估协议。

    官方安装说明 ↗
  2. 先跑通环境与普通策略

    安装 veRL 与 ALFWorld,固定仓库 commit、Python/CUDA/依赖版本;先保存一条普通 rollout,确认 observation、action、reward 和 terminal outcome 完整。

    完成标志:一条轨迹可重复执行并产生结构完整的记录。

    官方代码 Installation ↗
  3. 验证 Stage 1 数据链

    用少量任务生成轨迹与 hindsight skill,检查成功轨迹是否提炼可复用流程、失败轨迹是否产生规避规则;缩小数据规模后只能验证机制。

    完成标志:能追溯一条 SFT 样本从原始轨迹到 skill target。

    Stage 1 脚本 ↗
  4. 对照 GRPO 检查 Stage 2

    至少同时记录普通 GRPO 与 SEED 的环境回报、OPD loss、episode length 和有效 token mask。先确认 OPD 分支产生非零、稳定的训练信号,再讨论性能。

    完成标志:你能展示同一批 sampled actions 在普通与 skill 上下文中的分数差。

    论文 §3.3 与训练脚本 ↗
打开方法复现工作台
论文规模

严格复现

对齐论文版本、三种 backbone、数据规模、全部基线、超参数和 8×A800 80GB 计算条件,复核主表、训练动态与泛化结论。

  1. 冻结论文与代码版本

    记录 arXiv v1、代码 commit、每个 Qwen checkpoint revision、tokenizer、chat template、CUDA 与依赖锁定文件。

    完成标志:他人能从 manifest 重建同一软件与模型版本。

    论文 v1 与官方代码 ↗
  2. 对齐数据与 rollout 数量

    每个 benchmark 的 SFT 使用 180 个任务、每任务 8 条 rollout;RL 数据分别为 ALFWorld 2,400、WebShop 2,400、Search 19,200。

    完成标志:数据 manifest 的 split、样本数和预处理产物与论文表 3 一致。

    论文 Table 3 ↗
  3. 锁定训练超参数与资源

    使用 150 次策略更新、rollout group 8、学习率 1e-6、OPD 系数 0.01、KL 系数 0.01,并记录论文的 batch、prompt/response 长度和各环境最大交互步数。

    完成标志:配置 diff 对照论文 Table 5 没有未解释差异。

    论文 Table 5 ↗
  4. 同时复核分数与训练轨迹

    先复现 Vanilla/GRPO,再运行 SEED;除了最终分数,还比较训练曲线、episode length、样本效率、unseen split 和消融结果。

    完成标志:报告区分官方论文结果、你的独立运行结果和无法对齐的条件。

    论文 §4.2–4.6 ↗
打开严格复现工作台

论文信息

进化对象
执行策略、工具调用、工作流演化
基准测试
ALFWorld、WebShop、Search-based QA
类别
自进化智能体、工具调用、网页智能体
模型关系
4 个

从这篇论文开始研究

选择研究模式后,论文和原始模型会进入工作台上下文。

复现状态

代码可用
权重不可用
配置部分可用
环境已报告

尚未补充结构化复现记录。

模型角色拓扑

这里只展示数据明确记录的角色与模型关系,不推断未记录的 workflow 边。

  1. artifactCompleted on-policy trajectoryanalyze after completion
  2. moduleHindsight-skill analyzerextract reusable guidance
  3. artifactNatural-language hindsight skillre-score sampled tokens
  4. moduleOn-policy distillation + GRPOjoint dense OPD + outcome RL
  5. moduleUpdated shared policy

流程节点与边来自论文记录;未记录的关系不会被补写。

模型角色

Qwen2.5-3B-Instruct

执行者 · 更新了权重

Qwen2.5-7B-Instruct

执行者 · 更新了权重

Qwen3-1.7B

执行者 · 更新了权重

GLM-5.2

分析器 · 未更新权重