Agent做了十几步,奖励到底算给谁? 今日论文分享|AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning Agent 连续做了十几步,最后只拿到一次“成功 / 失败”,这份奖励到底该算给哪一步? 清华团队提出 AgentOPSD:让同一个模型充当训练时自教师,把 token 概率差汇总成 turn 级贝叶斯证据,再递归追踪每一步让“最终成功的信念”改变了多少。 在 Qwen2.5-7B 的 ALFWorld 实验中,平均成功率从 GRPO 的 81.2% 提升到 89.1%;任务每增加一轮,性能损失仅 0.54 个百分点,GRPO 则是 2.91。 视频用真实公式、论文图表和消融实验讲清方法,也保留了额外 teacher forward、验证范围和完整代码尚未发布这些局限。 #今日论文分享 #AI论文 #强化学习 #AIAgent #大模型 #清华大学 #AgentOPSD

已完成

任务ID: 1872

30秒速读

核心摘要

90
秒读完
AgentOPSD
传统GRPO方法将整段优势值广播给轨迹所有token,关键动作与普通动作获得的训练信号几乎无差异
AgentOPSD让同一共享参数模型分饰学生与自教师,汇总token概率差为贝叶斯证据,递归按每一步对成功信念的改变量分配信用
多组实验显示其性能全面优于GRPO,长链任务每增加一轮性能仅损失0.54个百分点,远优于其他基线

可执行建议

  • 有长链Agent训练需求的开发者可跟进官方后续开放的完整训练代码进行复现测试
  • 相关领域研究者可参考其递归信念更新思路,探索适配更多场景的信用分配方案

高价值评论洞察

  • 当前评论区暂未出现针对AgentOPSD技术细节、实验结论、落地可行性的深度讨论内容,有效技术类反馈空白
  • 仅有的留言为粉丝向表态,说明该硬核AI技术科普账号已积累一批精准垂直受众,但受众的技术讨论互动意愿尚未被激活

用户关注点

  • 潜在受众高度关注该算法完整开源代码的上线时间、不同大模型基座下的实测表现
  • 长链Agent训练从业者关心该算法对接现有主流强化学习框架的改造成本

可复用选题/回应建议

  • 后续跟进清华团队的代码发布动态,第一时间产出可落地的复现实操教程,匹配开发者需求
  • 补充拆解AgentOPSD和现有GRPO训练链路的兼容改造方案,降低技术受众的理解门槛

代表性评论

  1. 评论内容为“刘博我是你粉丝啊!”,属于无实质信息的粉丝向表态,价值是侧面印证账号已沉淀垂直领域核心粉丝,后续可主动引导粉丝针对技术点留言提问提升互动率

基本信息

2026/8/8 17:56:38

标签与备注

标签

AgentOPSDAI论文分享强化学习AIAgent大模型清华大学智能体训练

备注

暂无备注

转录文本

如果一个智能体连续操作十几步,最后只得到一次成功或失败,这个奖励到底该算给哪一步?常见的GRPO,不把同一个整段优势值广播给轨迹中的每一个token,结果是真正扭转局面的关键动作和只是照常执行的普通动作,收到的训练信号几乎一样。清华团队新提出的AgentTops想解决的正是长链智能体里的信用分配问题。不仅看最后是否成功,还要追踪每一步究竟让成功变得更可能,还是更不可能。它的关键视角很有意思,把每一轮动作看成关于最终成功的一条贝叶斯证据。理想情况下,我们想比较成功轨迹和失败轨迹里这个动作分别有多大概率,但这个分布无法直接获得。于是,作者让同一个模型扮演两种角色:普通学生只看当前状态,训练时的自教师还会额外看到一条检索到的技能提示,两者参数完全共享,不需要再训练一个critic。具体来说,对动作中的每个token计算自教师和学生的对数概率差。Δ等于带技能条件的log概率,减去普通条件的log概率,再把这一轮所有token的差距相加得到τₖ,它等价于这整个动作在自教师和学生下的似然比。如果τₖ为正,说明训练时的成功经验更支持这个动作。如果为负,它更像是在把轨迹推离成功,但只看这个分数还不够。同样一个正证据,在局面摇摆时可能非常关键,在已经胜券在握时,却可能只是重复确认。AgentTops先用同组采样的成功率初始化b₀,再用cₖ=γ×cₖ₋₁+eₖ递归累积证据。随后经过归一化和sigmoid,得到当前成功信念bₖ,真正分给这一轮的信用是Δbₖ,也就是它让成功信念改变了多少。旧证据会按γ衰减,所以长链里近期的新信息更有作用。接着,作者把Δbₖ和整段优势值的符号对齐:成功轨迹奖励提高成功信念的动作,失败轨迹则强调降低成功信念的动作。这个τ分数会在单条轨迹内标准化,再被裁剪成一个有界权重去缩放原来的GRPO优势,重点是它没有额外的蒸馏损失,也不会让局部信号推翻整段奖励的方向,只是把同一份信用更精确地分给不同轮次。实验覆盖OffWorld、WebShop等七个搜索问答数据集,模型是Qwen2.5的3B与7B,7B模型在OffWorld的平均成功率达到89.1%,而普通GRPO是81.2%。更值得看的是长链鲁棒性任务,每增加一轮,AgentTops只损失0.54个成功率百分点,GRPO损失2.91,RLSD损失3.59。它在全部八个汇总比较中都超过GRPO,并在其中六项超过强基线SDA²。但并非每一个单独指标都第一,消融实验也比较清楚完整:基线方法是89.1%,把τ级证据改成逐token更新,降到85.9%;只使用本轮原始eₖ不做递归信念更新,降到82.8%;只看重要性的绝对值,不区分它把成功概率推高还是拉低,只剩80.5%;去掉由组成功率提供的初始先验,则是78.9%。换句话说,提升并不止来自多算一次概率,而来自一套有方向、有历史状态的信用分配。好的好的,当然这篇论文还有几个边界:训练仍然多出一次自教师前向,技能提示只在训练阶段可用,也依赖检索质量。实验目前集中在三类环境,Qwen2.5 3B和7B,并采用二值终局奖励。官方仓库已经开放,但截至现在,完整训练代码和脚本仍标注为即将发布。所以,它更像一个证据充分、值得复现的新方向,而不是已经覆盖所有Agent场景的标准答案。最后,用一句话记住它:长链强化学习的关键,不是孤立判断每一步有多好,而是衡量这一步让最终成功的信念改变了多少。

任务状态

当前状态 已完成
重试次数0
创建时间2026/8/9 07:50:55
更新时间2026/8/9 07:54:35
完成时间2026/8/9 07:54:35

技术信息

任务IDtask_1786233055338566881_luiEmOua
字幕文件已生成
重新分析

想分析自己的视频?

注册可获赠体验积分,具体额度和各功能单价以价格页为准。

免费注册
返回任务列表
Agent做了十几步,奖励到底算给谁? 今日论文分享|AgentOPSD: Recu - AI视频分析案例