CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Se

CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Se 一、研究背景与问题智能体式搜索是指让LLM通过迭代推理、生成搜索查询、观察检索结果来回答复杂问题的过程。现有方法如Search-R1虽然通过强化学习RL训练推理智能体但将检索系统视为固定工具不对其进行优化。核心问题作者通过Oracle检索实验发现固定检索系统是性能瓶颈——将包含正确答案的文档强制排到最前面能使7B智能体的F1提升14.7%3B智能体提升26.8%。这证明即使推理能力再强检索质量也严重制约了系统上限。二、核心方法COSEARCH框架作者提出COSEARCH实现推理智能体与检索排序器的联合RL训练。系统架构如下主智能体Main Agent以ReAct风格循环运行生成思考reason和搜索查询最终给出答案。检索系统拆分为两阶段固定稠密检索器Dense Retriever从知识库中召回Top-50候选文档。可训练生成式排序器Generative Ranker对候选文档进行重排序选出Top-5供主智能体观察。两者通过组相对策略优化GRPO同时训练奖励基于最终答案的正确性。三、关键技术挑战与解决方案1. 语义分组策略解决GRPO输入不一致问题挑战GRPO要求同一组内多个响应来自完全相同的输入提示。主智能体的输入都是同一用户查询自然满足但排序器的输入包含子查询不同轨迹产生的子查询各不相同无法直接分组。解决方案利用不同轨迹中大量子查询在语义上等价仅措辞不同。对同一用户查询下的所有子查询按令牌级F1相似性进行贪心聚类阈值δ0.8。丢弃成员数少于3的小组确保优势估计稳定。无需额外采样直接复用主智能体已生成的轨迹。2. 复合奖励设计解决信用分配问题挑战仅用最终答案正确性作为奖励无法准确评估每个检索步骤的贡献仅用相关性标签又无法监督那些不直接包含答案但对推理有用的中间文档。解决方案设计复合奖励 rrank​相关性奖励 rrel基于伪相关性标签文档是否含标准答案计算 Hit1、Hit3、Hit5 的平均值提供即时排序质量信号。轨迹级别奖励 rmain​基于最终答案的令牌级F1分数提供长程效用信号。根据候选集中是否存在相关文档以及当前排序质量动态组合两者公式6避免噪声传播。四、实验设置与结果数据集与基线7个QA基准单跳PopQA, NQ, TriviaQA和多跳HotpotQA, 2Wiki, Musique, Bamboogle。基线与变体Direct Inference、CoT、RAG、Search-o1、Search-R1、ZeroSearch以及内部变体Retrieval Only无排序器和Fixed Ranker排序器冻结。主要结果COSEARCH7B主智能体7B排序器平均F1达到0.568相比Search-R1相对提升6.6%相比Retrieval Only提升4.0%相比Fixed Ranker提升2.7%。3B主智能体7B排序器平均F1达0.471相比Search-R1相对提升10.0%验证了较弱推理能力下检索优化的更大收益。缩小了与Oracle上限约26%–27%的检索差距。消融实验关键发现移除语义分组策略导致最大性能下降-3.3%证实其对稳定训练至关重要。移除相关性奖励 rrel 下降2.8%移除轨迹奖励 rmain​ 下降1.4%两者互补。共享主智能体和排序器的骨干网络会因梯度冲突导致性能下降-1.6%。排序器规模缩至3B会导致训练发散说明较小模型难以处理50个候选的排列输出。动态分析COSEARCH的排序质量Hit5在训练中从低于Fixed Ranker逐步超越并与下游F1正相关。COSEARCH和Oracle所需搜索轮次更少平均1.67轮 vs. Fixed Ranker的2.62轮表明高质量检索减少了迭代次数。排序器的组大小在训练中单调增长反映子查询趋于一致。五、核心贡献总结识别瓶颈通过Oracle检索实验量化证明了检索系统是智能体式搜索的主要性能瓶颈。提出框架首次实现推理智能体与检索排序器的联合RL训练使检索系统能够自适应地服务于推理需求。技术创新语义分组策略解决GRPO在排序器训练中的输入不一致问题。复合奖励设计兼顾即时排序精度和长程答案正确性。实验验证在多个基准上取得一致领先性能且各项设计决策均有消融支持。开放源码提供代码以促进后续研究。六、研究定位与展望与现有工作的区别区别于仅训练推理智能体Search-R1或仅通过监督学习训练检索器Agentic-RCOSEARCH实现了端到端RL联合优化且奖励完全基于规则无需昂贵的LLM标注。未来方向作者指出联合训练推理与检索是未来搜索智能体的关键要素可进一步探索更复杂的检索信号、更高效的训练策略以及在其他工具增强场景下的推广。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示项目地址在这里如下所示摘要智能体式搜索——即训练智能体通过迭代推理、发出查询并综合检索到的信息来回答复杂问题的任务——通过强化学习RL已取得显著进展。然而现有方法如 Search-RI将检索系统视为一个固定工具仅优化推理智能体而检索组件保持不变。一项初步实验表明在七个问答基准测试上使用Oracle检索与固定检索系统之间的差距高达 26.8% 的相对 F1 提升这表明检索系统是扩展智能体式搜索性能的关键瓶颈。受此发现启发我们提出了 COSEARCH一个通过组相对策略优化GRPO联合训练多步推理智能体和生成式文档排序模型的框架。为了实现对排序器其输入随推理轨迹变化进行有效的 GRPO 训练我们引入了一种语义分组策略该策略根据令牌级别的相似性对子查询进行聚类无需额外展开即可形成有效的优化组。我们进一步设计了一个复合奖励结合了排序质量信号和轨迹级别的结果反馈为排序器提供即时的和长程的学习信号。在七个单跳和多跳问答基准上的实验表明该方法相对于强基线方法取得了持续改进消融研究验证了每个设计选择的有效性。我们的结果表明推理智能体和检索系统的联合训练不仅可行而且性能强大这指出了未来搜索智能体的一个关键要素。1 引言大型语言模型LLM已展现出强大的推理能力但当问题需要超出其参数化训练数据的知识时它们面临根本性挑战。检索增强生成RAGLewis et al.2020Zamani et al.2022通过允许模型通过检索访问外部知识来解决此限制。虽然早期方法依赖于单轮检索后生成答案但最近的工作表明多步智能体式搜索——即模型迭代推理、生成搜索查询并整合检索信息——在知识密集型任务上产生了显著更强的性能Trivedi et al.2023Khattab et al.2021Shi et al.2024b。在这些智能体式搜索系统中一个智能体迭代地与检索系统交互智能体推理需要什么信息发出搜索查询观察检索到的文档并重复此过程直到收集到足够证据以产生最终答案。通过强化学习RL训练此类智能体其中奖励基于最终答案的正确性已被证明能有效教会它们何时以及搜索什么Jin et al.2025Li et al.2025bZeng et al.2026。尽管取得了这些进展但这些系统的一个共同假设是检索模型或搜索引擎保持不变。这意味着智能体将检索模型视为一个工具并学习使用它而该工具并不适应。表 1Oracle 检索差距F1 分数。性能为单跳PopQA NQ TQA和多跳HotpotQA 2Wiki Musique Bamboogle基准测试的平均值。我们认为这个假设引入了一个显著的瓶颈。通过对 RL 训练的搜索智能体的分析我们观察到大多数错误并非源于推理过程而是源于检索组件智能体发出的查询看起来很合理但检索系统未能返回相关文档迫使智能体要么用重新表述的查询重试要么从嘈杂信息中得出错误结论。为了量化这一差距我们进行了一项 Oracle 检索实验在每个检索步骤我们将所有匹配标准答案的文档提升到最前面的位置对于没有检索文档匹配标准答案的子查询则保持排序不变详见附录 F。如表 1 所示这个简单的干预措施在七个 QA 基准上对于 7B 参数智能体平均 F1 持续提升了 14.7%对于 3B 智能体则提升了 26.8%表明无论智能体的推理能力如何检索瓶颈普遍存在。这些发现引出了以下问题我们能否将检索系统与多轮推理智能体联合优化使它们学会相互补充以提供准确的回答在本工作中我们提出了 COSEARCH一个强化学习RL框架用于联合训练用于智能体式搜索任务的主推理智能体和生成式排序器。主智能体以标准的 ReAct 风格循环Yao et al.2023b运行生成思考和搜索查询。生成式排序器接收主智能体的子查询以及来自固定第一阶段稠密检索器的候选文档并选择和重排序一个子集供主智能体观察检索器和排序器共同构成检索系统。主智能体和排序器使用组相对策略优化GRPODeepSeek-AI et al.2025同时训练奖励来源于最终答案的正确性。将 GRPO 应用于排序器引入了两个关键技术挑战。首先GRPO 需要根据来自相同输入提示的多个响应组成的组来计算优势。虽然这对于主智能体来说很自然——从同一用户查询中采样多个轨迹——但排序器在不同轨迹中接收不同的子查询阻碍了直接分组。我们通过一种语义分组策略解决了这个问题该策略根据令牌级别的 F1 相似性对子查询进行聚类无需额外展开即可形成有效的 GRPO 组。其次排序器对最终答案的影响是间接的如果推理失败好的检索仍可能产生错误答案反之亦然。我们设计了一个复合奖励结合了基于排序质量指标Hitk的相关性奖励和反映最终答案正确性的轨迹级别奖励为排序精度提供即时反馈并为下游效用提供长程信号。两个奖励组件均使用基于规则的指标计算无需昂贵的 LLM 标注。遵循先前工作Jin et al.2025我们在涵盖单跳PopQA NQ TriviaQA和多跳HotpotQA 2WikiMultiHopQA Musique Bamboogle设置的七个 QA 基准上评估 COSEARCH。使用 Qwen2.5-7B-Instruct 作为主智能体和排序智能体的骨干网络我们的方法持续优于强基线包括 Search-R1Jin et al.2025和固定排序器变体。我们还展示了 3B 主智能体搭配 7B 排序器的有效性。我们的主要贡献如下我们确定了检索质量是 RL 训练的智能体式搜索系统中的关键瓶颈Oracle 检索实验显示对于7B 推理智能体的相对 F1 增益为 14.7%对于 3B 智能体为 26.8%证明了固定检索系统带来的显著且普遍存在的性能上限。我们提出了 COSEARCH一个通过 RL 联合训练推理智能体和生成式文档排序器的框架。为实现这一点我们引入了一种语义分组策略用于在输入随轨迹变化的情况下将 GRPO 应用于排序器以及一个复合奖励结合了排序质量与轨迹级别的答案正确性。在七个 QA 基准上的实验表明相对于强基线取得了一致改进使用 7B 智能体相比 Search-R1 实现了 6.6% 的相对 F1 提升使用 3B 智能体则提升了 10.8%。我们的结果表明检索系统和推理智能体的联合训练不仅可行而且性能强大很可能是未来搜索智能体的一个关键要素。2 相关工作智能体式搜索与深度研究。检索增强生成Lewis et al.2020Guu et al.2020Borgeaud et al.2022Karpukhin et al.2020a使 LLM 能够访问外部知识但单轮检索在需要多步证据收集的复杂问题上常常失败。这推动了将推理与检索交错进行的智能体式搜索系统的发展Yao et al.2023aTrivedi et al.2023Asai et al.2024近期的深度研究智能体OpenAI2025Google2025Nakano et al.2021将大型推理模型与网络搜索结合以处理复杂查询。RLVR 的出现进一步使得能够直接根据答案正确性训练搜索智能体Jin et al.2025Li et al.2025aSong et al.2025Li et al.2025bSun et al.2025bGuan et al.2025Zeng et al.2026。为 LLM 训练检索器。另一条工作线为下游 LLM 生成调整检索。先前的方法通过语言模型监督训练检索器Guu et al.2020Shi et al.2024aSachan et al.2021Salemi Zamani2024而最近的工作表明 LLM 可以作为有效的列表式排序器Sun et al.2023Pradeep et al.2023。最相关的是 Agentic-RLiu et al.2026它通过 LLM 标注的标签和迭代对比学习为智能体式搜索训练稠密检索器。相比之下COSEARCH 使用一个生成式排序器在同步联合框架中通过 RL 进行端到端训练仅需轻量级的基于规则的奖励。用于工具增强型 LLM 的 RL。RLVROpenAI2024DeepSeek-AI et al.2025Lambert et al.2025Kaufmann et al.2025已成为优化 LLM 的关键范式其中无价值函数的方法如 GRPOShao et al.2024和 RLOOAhmadian et al.2024为 PPOSchulman et al.2017提供了更简单的替代方案。将 RLVR 应用于工具增强设置引起了越来越多的兴趣Li et al.2025cFeng et al.2025aDong et al.2025bWang et al.2025Feng et al.2025bXue et al.2025Dong et al.2025a但这些工作侧重于训练推理智能体以更有效地使用工具。相比之下我们的工作将 GRPO 应用于训练工具本身特别是排序器。3 方法我们提出 COSEARCH一个通过强化学习RL联合优化多步推理主智能体和生成式文档排序器的框架见图 1。我们首先形式化框架§3.1描述主智能体优化§3.2然后详述我们的两个核心技术贡献用于将 GRPO 应用于排序器的语义分组策略§3.3和复合奖励设计§3.4。3.1 问题表述我们将智能体式搜索形式化为一个包含推理主智能体和检索系统的系统。给定一个初始用户查询 q0​主智能体 πθmain​​ 通过一系列推理和检索步骤与检索系统交互产生一个轨迹3.2 主智能体优化3.3 排序器优化每个剩余的组 gm​ 包含在相同 q0​ 下具有语义等价输入的排序器调用形成一个有效的 GRPO 组。优势在每个组内使用标准组归一化计算。此策略不产生额外采样成本我们复用已为主智能体生成的轨迹而不是为排序器执行单独的展开。我们在附录 C 中提供了详细算法和图示。3.4 排序器奖励设计排序器旨在通过在每个搜索步骤提供有用的文档帮助主智能体解决多步推理任务。然而奖励设计并非易事。基于最终答案正确性的轨迹级别奖励无法准确地将信用分配给各个搜索步骤因为每一步的贡献都与后续检索决策以及主智能体的推理混合在一起使得信号嘈杂且不稳定。基于相关性的奖励在我们的设置中也有一个重要限制。由于伪相关性标签是通过将文档与标准答案匹配构建的它们无法监督那些检索到的文档对于分解或推理有用但未直接提及最终答案的中间检索步骤。为解决这两个问题我们使用一个结合了轨迹级别监督和相关性监督的复合奖励。总之复合奖励 rank​ 在相关文档存在但排序不佳时优先考虑排序精度在排序已经很强时添加轨迹级别的信用在候选集中没有相关文档时回退到仅使用答案正确性信号。4 实验4.1 实验设置数据集。我们在涵盖单跳和多跳设置的七个 QA 基准上进行评估PopQAMallen et al.2022、Natural QuestionsNQKwiatkowski et al.2019、TriviaQATQAJoshi et al.2017、HotpotQAYang et al.2018、2WikiMultiHopQA2WikiHo et al.2020、MusiqueTrivedi et al.2022和 BambooglePress et al.2023。我们使用 Search-R1Jin et al.2025中的测试分割以进行一致比较。性能通过令牌级 F1 分数衡量。基线。我们比较了 Direct Inference、CoTWei et al.2023、RAGLewis et al.2020、Search-o1Li et al.2025a、Search-R1Jin et al.2025、ZeroSearchSun et al.2025a以及两个内部变体1Retrieval Only移除排序器并直接使用稠密检索器的前 K 个文档2Fixed Ranker使用在基于相关性的 IR 数据集上微调但在 RL 训练期间冻结的排序器。表 2在七个 QA 基准上的主要结果令牌级 F1。结果按主智能体骨干网络分组。COSEARCH 排序器在两种设置中均使用 Qwen2.5-7B-Instruct。每个规模块内的最佳结果以粗体显示。Oracle灰色将包含答案的文档提升至排名第一作为排序的上限。4.2 主要结果表 4.2 展示了所有七个基准的完整结果。我们观察到联合训练持续优于所有基线。COSEARCH 使用 7B 智能体实现了 0.568 的平均 F1相比 Search-R1 相对提升了 6.6%相比 Retrieval Only 提升了 4.0%相比 Fixed Ranker 提升了 2.7%。这种改进在所有七个基准上均保持一致表明联合训练排序器提供了稳健且普遍的益处。在非 RL 基线中RAG 相比直接推理提升了 22.5%0.365 vs. 0.298Search-R1 进一步超越了 RAG 46.0%0.533 vs. 0.365证实了迭代推理的价值然而 COSEARCH 通过优化检索系统本身进一步提升了性能。较弱的智能体从检索改进中受益更多。使用 3B 主智能体搭配 7B 排序器COSEARCH 相比 Retrieval Only 实现了 7.0% 的相对增益相比Fixed Ranker 实现了 2.4% 的相对增益。与 Oracle 上限相比COSEARCH 为 7B 智能体缩小了约 27% 的检索差距为 3B 智能体缩小了约 26%证实了端到端 RL 优化有意义地缩小了性能天花板。表 3消融研究。主智能体使用 Qwen2.5-7B-Instruct。每行改变完整模型的一个组件。平均值分别在单跳和多跳组内计算。4.3 消融研究表 4.3 报告了消融结果。在奖励设计方面移除轨迹级别奖励 rmainrmain​ 使平均 F1 相对下降了 1.4%而移除排序质量奖励 rrelrrel​ 则导致了更大的下降2.8%证实了两个组件提供了互补的监督rrelrrel​ 提供了关于检索精度的直接信号而 rmain​ 捕获了检索到的文档是否真正有助于最终答案的正确性。将 Hitk 替换为 nDCGk 使性能相对下降了 2.1%用 LLM-as-judge 替代复合奖励导致了 1.8% 的下降——两者均证实了我们的复合设计有效且计算轻量。移除语义分组和过滤策略——将所有共享相同初始查询 q0q0​ 的排序器调用视为一组而不论子查询相似性如何——导致了最大的单组件性能下降相对下降了 3.3%0.568→0.549。这证实了将语义异构的子查询混合到一个 GRPO 组中会产生噪声优势估计阻碍排序器学习并且 §3.3 中描述的过滤步骤对于稳定训练至关重要。在架构选择中共享骨干网络导致 F1 下降了 1.6%原因是排序和推理梯度存在冲突。交叉编码器排序器下降了 2.9%其点式评分不适合直接 RL 优化。将排序器缩小到 3B 导致训练完全发散——较小的模型无法在 50 个候选项上可靠地生成有效的排列输出见附录 A.2。4.4 分析图 2 在 100 个训练步骤中从三个维度比较了所有四个系统。面板 (a) 和 (b) 揭示了排序质量Hit5与下游 F1 之间存在清晰的正相关关系COSEARCH 的排序器起始低于 Fixed Ranker但在训练过程中稳步超越。面板 (c) 显示 COSEARCH 和 Oracle 需要更少的搜索轮次表明更高质量的文档减少了额外检索轮次的需求。图 3 追踪了排序器的训练动态。在面板 (a) 和 (c) 中过滤前的奖励最终收敛于过滤后的奖励表明分布差距逐渐被弥合。面板 (b) 显示过滤前的相关性奖励稳步上升从 ∼0.35 到 ∼0.50表明排序能力有了真正的提高。面板 (d) 显示组大小单调增加图 2100 步内的训练和评估动态。(a) 每 20 步的验证 F17 个数据集的平均值。(b) 每个训练步骤的排序质量Hit5y 轴断开以显示 Oracle 1.01.0 在上方。(c) 每个轨迹的平均搜索轮数。图 3100 步内的排序器训练动态。过滤前所有语义组的统计信息过滤后通过 §3.3 中描述的最小大小过滤的组的统计信息。(a) 主智能体奖励。(b) 相关性奖励Hit5。(c) 复合奖励。(d) 平均语义组大小。过滤后的组大小约为过滤前的两倍反映了随着策略收敛子查询变得越来越一致。表 4排序文档数量 K 对平均 F1 的影响。排序器从 N50 个第一阶段候选中选择前 K 个。K5粗体是表 4.2 中使用的默认值。括号中的百分比表示与每种方法 K5 相比的相对变化。表 4.4 考察了 K 如何影响性能。当 K 从 5 减少到 1 时COSEARCH 仅下降了 5.3%与 Oracle−2.2%相当远小于 Retrieval Only−8.8%和 Fixed Ranker−7.2%。值得注意的是COSEARCH 在 K3 时0.561已经超过了 Fixed Ranker 在 K10 时0.559的性能并且将 K 从 5 增加到 10 对所有方法的回报都在递减0.5% 到 1.6%。结论在这项工作中我们确定了检索质量是智能体式搜索系统的一个重要瓶颈Oracle 检索差距高达 26.8% 的相对 F1。受此发现启发我们提出了 COSEARCH一个通过 RL 联合训练推理智能体和生成式文档排序器的框架。我们的语义分组策略使得无需额外展开即可对排序器进行高效的 GRPO 训练而我们的复合奖励提供了即时的排序质量信号和长程的轨迹级别信号。在七个 QA 基准上的实验证明了一致的改进使用 7B 智能体相比 Search-R1 实现了 6.6% 的相对 F1 提升使用 3B 智能体则实现了 10.0% 的提升。我们的结果表明推理和检索的联合训练不仅可行而且性能强大这指出了未来搜索智能体的一个关键要素。