AllenAI:自反思元强化搜索框架

AllenAI:自反思元强化搜索框架 标题Meta-Reinforcement Learning with Self-Reflection for Agentic Search来源arXiv, 2603.11327v1摘要本文介绍了MR-Search一种用于具有自我反思的代理搜索的上下文元强化学习RL公式。MR-Search不是在单个独立剧集内以稀疏奖励优化策略而是训练一个以过去剧集为条件并跨剧集调整其搜索策略的策略。MR-Search学习学习具有自我反思的搜索策略允许搜索代理在测试时改进上下文探索。具体来说MR-Search通过在每个剧集后生成明确的自我反思并利用它们作为附加上下文来指导后续尝试来执行跨剧集探索从而在测试时促进更有效的探索。我们进一步引入了一种多回合RL算法该算法可以估计回合级别的密集相对优势从而实现每一集的细粒度信用分配。各种基准的实证结果证明了MR-Search相对于基于基线的RL的优势显示出强大的泛化能力并且在八个基准上相对提高了9.2%到19.3%。我们的代码和数据可在https://github.com/tengxiao1/MR-Search获得。️文章简介研究问题如何在缺乏环境实时反馈且奖励稀疏的开放域智能体搜索任务中通过跨轮次学习实现更有效的探索与信用分配主要贡献论文提出了MR-Search框架利用上下文元强化学习与显式自反思机制使智能体能跨回合积累知识并优化搜索策略在多个基准测试中显著优于现有方法。重点思路构建上下文元强化学习范式将搜索过程建模为由多个内部回合组成的元回合使策略能基于历史轨迹和反思结果进行条件生成打破传统单回合独立优化的局限。引入显式的跨回合自反思机制在每个搜索回合结束后生成反思文本将其作为额外上下文输入后续回合引导智能体修正错误并针对性地补充信息检索。基于标准答案的后验判定设计无评论家的多轮次强化学习算法利用留一法估计轮次级别的相对优势实现对自反思步骤的细粒度信用分配避免了对辅助价值模型的依赖。采用分组采样策略计算无偏优势估计并通过折扣累积将未来回报反向传播至早期回合有效解决了长程依赖下的奖励稀疏与分配模糊问题。分析总结实验结果显示MR-Search在八个问答基准测试中相比基于结果奖励的基线方法取得了9.2%至19.3%的相对性能提升证明了过程监督的有效性。训练动态分析表明该方法能收敛至更高的奖励值且随着测试时反思轮次的增加性能呈现显著上升趋势展现了优异的测试时扩展能力。消融实验证实移除折扣因子会导致模型陷入局部最优而提出的多轮次优化算法在泛化性和鲁棒性上均优于PPO及MT-GRPO等主流算法。案例研究显示智能体能够利用前序回合的反思信息主动重新检索关键证据成功修正初始错误答案实现了从盲目探索到知情搜索的转变。个人观点论文本质上就是将基于标准答案的最终稀疏结果奖励拆解、反推并分配为回合级甚至步骤级的稠密奖励。附录