Agent开始“自我进化”:会出题、会反思,还会自己长出新技能

Agent开始“自我进化”:会出题、会反思,还会自己长出新技能 当 Agent 自己会出题、自己会答题、还能把答错的经验沉淀成下一次的技能包——一个永远在长大的 Agent到底能走多远十几篇论文反复啃读从存技能到训技能再到零数据自训我们终于摸清了自进化 Agent 这条赛道的脉络。本文将带你深入 Agent 的经验大脑——从把经验写进文件到把经验训进权重再到完全无人工数据的自我循环一步步拆解研究路径。一个完全自主、越用越强的 Agent有可能实现吗本文聚合了现有的前沿探索工作向大家展现这一方向上的最新成果。话不多说现就开启学习之旅吧——本次文章覆盖自进化 Agent 的三大技术路线、代表工作详解、横向对比、关键洞察等话题。01 自进化 Agent 介绍1.1 什么是自进化 Agent自进化 AgentSelf-Evolving Agent指的是一类能够在与环境/用户交互过程中自动积累经验、提炼能力、并在后续任务中复用与提升的智能体。简单来讲让 Agent 自己越用越聪明而不是每次都靠人工去喂数据、调提示词、改模型。它的核心诉求可以拆成三件事能存把交互过程中沉淀下来的有价值的东西成功模式、失败教训、可迁移技能存下来能用在新任务中能把之前存下来的东西检索/调用/内化进自己的决策能进化经验本身是动态的能更新、能合并、能淘汰避免越攒越乱。1.2 为什么这件事现在被重视起来了回到大模型本身的几个老大难问题静态知识训练完成那一刻起模型对世界的认知就被冻结了上下文有限再长的上下文窗口也总有边界多轮交互终究断片重复犯错今天教会它的事明天还会再犯一遍训练贵每次想让模型变强一点要么 SFT 要么 RL都得重新跑一遍。而自进化 Agent 想要的正是绕开这些限制让经验本身成为模型能力的延伸或更新通道。这件事在学术上不算新概念早期的强化学习经验回放就是雏形但在大模型时代被重新点燃本质是因为LLM 本身具备总结归纳的能力自己能给自己写笔记了Agent 形态的产品越来越多长程交互场景终于有了真实需求高质量人工标注数据越来越贵社区开始探索少人工 / 无人工路线。1.3 三大技术路线一览我们把目前调研到的工作按是否更新模型权重和是否依赖人工数据两个维度划成了三类路线是否更新模型权重是否依赖人工数据代表工作第一类经验/Skill 存储型❌ 不更新❌ 依赖AutoSkill、EvoSkill、MemSkill、CoEvoSkills、SE-Agent、Hermes第二类RL 训练型✅ 更新❌ 依赖EvolveR、SAGE、SkillRL、SKILL0、SkillOS、AgentEvolver第三类0 数据自学型✅ 更新✅ 不依赖Agent0、Tool-R0、Absolute Zero简单一句话来理解三类工作的差异第一类像是给 Agent 配了一本工作笔记模型本身不动只在需要时翻阅第二类则是直接把工作笔记上的经验通过 RL 写进模型的权重里让 Agent 真正长本事第三类更激进——干脆连老师都不要了让 Agent 之间互相出题互相考试自己跟自己打。下面分别展开。02 第一类经验/Skill 存储型不更新模型权重特征不训练、跨会话保留上下文、文件式存储核心是把经验沉淀为可检索/可复用的技能Skill。类比来看这类工作就像是给 Agent 配了一个外挂大脑本体base LLM保持冻结所有的成长都发生在外挂里。2.1 AutoSkillarXiv: 2603.01145TLDR基础款动态增删改查 Skill 来防止 Skill 库爆棚。整体设计是一个非常经典的双环结构左环——在线服务用 Skill查询重写把用户原始问题改写成更适合检索的形式混合技能检索语义相似度Embedding 词汇相关性BM25双管齐下技能注入生成把检索到的技能渲染为外部记忆上下文注入到提示词里右环——技能进化循环更新 Skill技能提取从用户交互信号中抽取可重用的技能候选候选技能管理判断该 Add新增/ Merge合并/ Discard丢弃版本化合并语义并集更新保留技能身份并更新版本号评估数据集是 WildChat-1M但没有具体性能指标——论文里只看了抽出来的 skill 数量。这其实是这一类工作最大的痛点评估缺位。2.2 EvoSkillarXiv: 2603.02766TLDR让多个 Agent 分工协作——一个执行、一个反思、一个落地——把失败变成新 Skill并用 Pareto 前沿机制保证 Skill 库永远精而不滥。EvoSkill 来自 Sentient 和弗吉尼亚理工的合作工作主张是把传统 Agent “失败即重试” 的笨办法改造成 “失败即学习” 的进化闭环。它的最大特点是把 Skill 当作一等公民来升级而不是只在 prompt / code 层面做文字游戏。三 Agent 分工Executor Agent执行者拿当前 Skill 库去跑任务把失败案例完整记录下来——失败原因、轨迹、最终错误结果一起留档。这是后面所有进化的原材料。Proposer Agent反思者扮演诊断医生的角色。它读完 Executor 的失败记录后会先做根因分析为什么失败是缺技能还是技能用错了再基于过往的反馈历史决定新建一条 Skill还是修改已有 Skill——例如在金融文档 QA 任务里它会自动总结出 “data extraction validation”数据抽取校验这样的可复用技能。SkillBuilder Agent落地者把 Proposer 的自然语言提案变成结构化的 Skill 文件夹含元信息、操作步骤、辅助脚本并在小样本验证集上跑一轮单元化校验。核心机制——Pareto Frontier 精英池新生成的 Skill 不是无脑入库而是要跟已有 Skill 在多维指标上比较只有在至少一个维度上严格优于现有 Skill 的才会进入精英池否则丢弃或合并。这套机制保证了 Skill 库随着规模增长依然保持精而不滥——这也是它跟 AutoSkill 那种全量保留 版本化做法最大的不同。评估亮点OfficeQA 主任务基于美国财政部公告89K 页扫描财务文档的复杂数值推理任务。基线准确率 60.6% → 进化后 67.9%7.3pp主要靠两条自学到的 Skill 撑场Data extraction validation—— 解决了之前表格解析时常见的单元格错位问题Quantitative analysis with checkpoints—— 在金融数值计算环节强制加入校验点。跨任务迁移在 SealQA 上学到的search persistence protocol搜索坚持协议直接挪到 BrowseComp 任务上无需重新训练就带来 5.3pp 的提升——这点跟后面 CoEvoSkills 的transfer 不如自己 self-evo结论形成有趣对比说明只要 Skill 抽象得足够通用是可以跨任务迁移的但前提是抽象层级要选对。PS虽然叫训练集但训练集只用来总结不更新任何模型。评论在第一类工作里EvoSkill 是工程化程度的中间档——比 AutoSkill 多了精英池筛选机制但比 Hermes 那种带 GEPA 反向进化的还差一截。它的真正价值在于把失败明确写进了进化闭环这也成了后续很多工作包括 SkillRL 的 failure trajectory distillation的直接灵感来源。2.3 MemSkillarXiv: 2602.02474TLDR之前两个工作针对用户指令MemSkill 只针对操作 Memory 的 Skill 做自进化。这个工作有意思的地方在于它把组件拆得很细Retriever基于 Qwen0.6B Emb 的相似度计算ControllerMLP 结构接受 RL 训练注意这是这一类里少见的有训练环节Executor Designer Base LLM全部冻住它有两个并行的更新 LoopController 更新Retriever 抽取 Memory 对话 → Controller 选 Skill → Executor 更新 Memory 库 → 用下游 F1 / Success Rate 作为 reward 训练 ControllerSkill 库更新训练中遇到的 Hard Case 交给 Designer 更新 Skill 库亮点——Transfer Evaluation在 LLaMA 上训练所得 Controller Skill 迁移到 Qwen 上仍然有效在 LoCoMo 上训练所得 Controller Skill 迁移到 LongMemEval 上仍然有效。由于 Base LLM 不动仍归为无训练类。但 MemSkill 给前面两篇工作AutoSkill / Hermes Agent 没有性能评估提供了一条参考思路在训练集上构建 Skill在测试集/其他数据集的测试集上评估。当然这种做法下喂给 Agent 的样本顺序就变得很重要。2.4 CoEvoSkillsarXiv: 2604.01687v2TLDR给每条新总结的 Skill 配一个考官Verifier生成的 Skill 必须先通过考试才能进库通不过就带反馈打回让 Generator 重写——这是把软件工程的单元测试理念搬到了 Skill 进化里。CoEvoSkills 想解决的是前面几篇工作的一个老大难问题Skill 总结出来到底靠不靠谱 AutoSkill / EvoSkill 都是生成完了直接入库质量基本靠 LLM 自觉。CoEvoSkills 的回答是不能靠自觉得有验证闭环。核心组件——Generator Verifier 双子星Skill Generator从执行轨迹里提炼候选 Skill。除了写出 Skill 本身描述 步骤还要同步生成对应的单元测试输入样例、期望输出、验证逻辑。Skill Surrogate Verifier在一个隔离的 sandbox 环境里跑 Generator 写的 Skill 与单元测试返回结构化验证反馈不是简单的 pass/fail而是带失败原因和建议修改方向的自然语言反馈。Co-Evolution Iteration共进化迭代Skill 与 Test 同时进化——这跟传统软件开发里先写测试再写代码的 TDD 有点像。如果 Skill 多次都过不了 Test可能是 Test 本身写得不合理反过来如果 Test 太宽松导致烂 Skill 也进库了下游评估时就会暴露出来。两者互相牵制逐步收敛到高质量 Skill 高严谨度 Test的稳态。两阶段验证Surrogate 验证廉价内置的 Verifier 直接给反馈跑得快、能快速迭代Oracle 验证昂贵但权威通过 Surrogate 的 Skill 还要在真实 LLM Agent论文中用了 Claude Code / CodeX 等上跑端到端任务只有真的解决了任务才算进化成功。如果 Oracle 测试失败整条 Skill 直接打回。亮点结论——Self-evo 优于 Cross-model Transfer论文做了一组很有意思的对照实验把强模型Opus 4.6self-evo 出来的 Skill 直接 transfer 到弱模型Haiku 4.5、Qwen3-Coder、DeepSeek V3、Mistral Large 3上跟让弱模型自己 self-evo 比较——结果是self-evo强模型自己用自己的 SkillOpus 4.6 从 30.6% → 71.1%40.5GPT-5.2 从 29.6% → 69.8%40.2cross-model transfer把 Opus 4.6 的 Skill 给到弱模型提升从 35.4 到 44.1 不等但绝对值都明显低于让模型自己 self-evo如 Mistral Large 3 才到 43.1%。这个观察的含义是Skill 跟模型本身的风格是耦合的——强模型生成的 Skill 在强模型自己上效果最好强迁到弱模型上弱模型未必能完整地读懂并执行那些精巧的步骤。这点对工程界的启示很大与其花大钱让 GPT-5 / Claude 4.6 给你的产品蒸馏 Skill不如让产品自己用的小模型来 self-evo——前者贵且效果未必更好。PS虽然有信号但实际上不涉及训练仅仅是驳回 Generator 创建的 Skill。评论CoEvoSkills 的测试驱动 Skill 进化思路在第一类里独树一帜本质上是把 Verifier 当成 “便宜的 reward model” 用——这跟第二类工作里训练 Curator 的逻辑已经很接近了只差最后一步把 Verifier 也训起来。2.5 SE-AgentarXiv: 2508.02085TLDR与其反复自我反思在同一条轨迹上小修小补不如一次跑出多条轨迹让它们之间互相借鉴、互相打磨——SE-Agent 把 Agent 自进化从单线程深度修补切到了多线程横向融合。SE-Agent 来自 OPPO 的 OpenSearch-AGI 团队和复旦大学等机构被收录于 NeurIPS 2025。它瞄准的是前面所有 self-refine / ReAct 类工作的共同短板——单轨迹反思的视野太窄。当一条轨迹整体走偏的时候例如一开始就选错了策略无论怎么 reflection 都救不回来只有跳出当前轨迹从多条不同策略的轨迹里学习才能突破局部最优。完整五阶段流程多策略轨迹生成Multi-Strategy Generation用不同的性格采样 N 条轨迹。论文里给了 5 种典型策略——P-greedy贪心快出、P-tests-first先写测试、P-linter-aware关注代码风格、P-defensive防御式编程、P-minimal最小可行。同一道题每种策略得到的轨迹完全不同犯的错也不同。反思修订Revision对每条轨迹独立做一遍传统 self-refine——找到执行偏差点针对性修正。这一步是纵向的深耕单条轨迹。质量过滤Quality-based Filtering用一个综合评分函数Reward(t,T) α·TaskCompletion(t) β·ReasoningQuality(t) γ·Efficiency(t)给每条轨迹打分把候选数从 10 条砍到 5 条。这避免了下一步重组时被低质量轨迹污染。跨轨迹重组Recombination⭐核心创新这一步是 SE-Agent 区别于所有 self-refine 工作的关键。它对剩下的 5 条高分轨迹做两类操作Crossover交叉把轨迹 A 在步骤 5 的精确定位嫁接到轨迹 B 的全面测试覆盖上合成出一条原本任何单条策略都达不到的混合轨迹Transfer迁移把防御式策略里学到的 try-except 异常处理迁移到贪心策略里缺失异常处理的位置Restructure重构识别多条轨迹共有的全局模式如所有轨迹都漏掉了 type-safe 比较统一抽象后做一次系统级重写。最终方案选取Final Solution Selection从 10 个候选5 原始 5 重组中选最高分的作为输出。整个流程可以迭代多轮论文里给的 N4 时已经收敛每一轮的结果会再喂给下一轮做新的多策略生成。关键观察——横向 vs 纵向它定义了三种轨迹层操作与单条轨迹的 self-refine 形成对照修订纵向找出错误步骤并纠正——这是传统 self-refine 在做的事重组横向跨轨迹借用成功的子片段——这是 SE-Agent 的真正创新精炼横纵融合在重组后的轨迹上再做一轮纵向打磨。跟其他工作的关键区别是总结的方向不同其他第一类工作几乎全是纵向总结基于单条历史轨迹/对话SE-Agent 是横向总结基于多次采样的多条轨迹。这个横向 vs 纵向的概念会贯穿全文——它是后面我们讨论研究空白时的一个重要锚点。评估主战场是 SWE-Bench VerifiedGitHub 真实代码修复任务。SE-Agent 让多个底层 LLM 都拿到了显著提升最高一档实现了 55% 相对改善——在这个领域属于很扎实的提升。跟 Claude Code 等工业级 Coding Agent 也做了对比验证了轨迹级进化是一个与底层模型选择正交的优化维度。评论SE-Agent 是第一类里思路最野的——它没有 Skill 库这种长期记忆机制但用一次性多采样 跨轨迹融合的办法做到了类似的效果。某种意义上它跟第二类的 SAGESequential Rollout是镜像关系SE-Agent 是横向采SAGE 是横向用前者不训模型后者用 RL 让模型学会自己横向沉淀。2.6 第一类总结还是要训练数据的写到这里其实第一类工作有几个统一的特征值得提一下核心点 1. 看似不训练其实仍要训练数据不管是人为交互提供反馈还是训练集提供反馈本质都是训练数据没有真的做到零数据。核心点 2. 核心是存下经验/Skill这一类工作的灵魂在于把交互的副产物沉淀下来做成可检索的资产。核心点 3. 总结这一步被严重低估几乎所有工作都默契地把 Skill 总结这一步交给了冻结的 base 或独立的 LLM——按理说这是整条 pipeline 最关键的环节但针对总结去优化的工作几乎没有。这是一个值得深挖的空白。核心点 4. 横向 vs 纵向总结纵向总结其他工作根据历史对话/单条轨迹总结横向总结SE-Agent根据多次采样的多条轨迹总结。二者都是存 skill的不同侧面。03 第二类基于 RL 的训练型自进化这是重点特征通过 RL 训练直接更新模型权重让模型从根本上变强。这一类是当前学术界与工业界的主流方向本报告的重点也在这里。3.1 EvolveRarXiv: 2510.16079TLDR算是这一类的基础型分两阶段。离线阶段Agent 跑完一批任务后对所有轨迹做提炼把具体的交互步骤抽象成更通用的策略原则存入原则库策略原则可以视作一种 Skill。在线阶段Agent 在新任务里实时检索这些原则指导自己的行动同时又产生新轨迹反哺下一轮蒸馏训练。Reward 设计最终结果 格式 reward 评估Natural Questions、HotpotQA、TriviaQA、PopQAPS看起来很像RL by talking但是仍然要靠标注数据集 Ground Truth 去训练的。也就是 talking 的数据只用来蒸馏经验/skill不用来当训练标签。3.2 SAGEarXiv: 2512.17102TLDR提出 Sequential Rollout —— RL rollout 时序列化地跑一系列相似任务后序任务训练时就可以使用前序生成的 skill。这个思路很巧妙每次 rollout 不是跑一个任务而是让 Agent 依次跑一串相似的任务。跑早期任务时积累下来的技能在同一个 rollout 里的后续任务里就能直接用。这意味着在训练过程中模型就被迫学会生成技能和复用技能不只是会完成任务。除了任务完成的结果奖励SAGE 还设计了 Skill-integrated Reward——额外的信号专门激励技能的生成和调用。评估数据集是 AppWorldAPP 交互数据集。3.3 SkillRLarXiv: 2602.08234⭐来到本文重点关注的四篇工作之一。核心主张用强模型o3蒸馏 Skill再通过 RL 训练弱模型学会使用并递归进化技能库。统一三角色梳理角色配置训练题目来源官方数据集训练集ALFWorld7,500 条 SFT、WebShop2,400 条 SFT、7 个搜索 QA 数据集出题者无独立出题者直接使用数据集解题者Qwen2.5-7B-Instruct ✅ 训练 Cold-start SFT → GRPO RLSkill 总结者OpenAI o3 ❌ 不训练Skill 总结机制成功轨迹 → 提取关键决策点与可迁移模式失败轨迹 → 合成失败教训失败点 错误推理 应对策略压缩比10–20×总体流程解题者交互 → 轨迹交给总结者总结 skill → 下一轮训练时使用。主要实验结果基准SkillRLGRPO 基线提升ALFWorld89.9%77.6%12.3%WebShop SR72.7%66.1%6.6%Search-QA avg47.1%~38.5%8.6%Skill 库增长55 → 100 条通用 12→20任务专属 43→80。核心设计哲学强模型提炼知识弱模型通过 RL 学会使用知识。评论我们倾向于把这种归类于蒸馏而非真正的进化。3.4 SKILL0arXiv: 2604.02268⭐核心主张将 Skill 从推理时的外挂上下文内化到模型参数实现零样本执行每步 0.5K tokens。角色配置训练题目来源直接继承 SkillRL 的 SkillBankALFWorld WebShop Search-QA 官方训练集出题者无解题者Qwen2.5-VL-3B/7B-Instruct ✅ 训练 三阶段渐进课程Skill 总结者继承 SkillRL 的 o3❌ 不训练三阶段渐进课程阶段Skill 数量目标Stage 16 条学会调用Stage 23 条减少依赖Stage 30 条完全内化核心设计哲学从使用技能到内化技能的范式转变 —— 消除推理时的检索成本、Token 开销和噪声把知识真正固化进模型权重。SKILL0 不关心 Skill 从哪里来只关心如何内化。它本质上是 SkillRL 的下游消费者。3.5 SkillOSarXiv: 2605.06614⭐⭐这是四篇里我们认为最有启发性的一篇。核心主张训练一个专门的 Curator通过 RL 学会如何增 改 删 SkillRepo而不是直接学如何使用 Skill。角色配置训练题目来源AgenticALFWorld、WebShop 官方训练集 推理DeepMath-103k 随机采样 33,000 条两步预处理Gemini-2.5-Pro 标注属性标签 → 按相似度分组group_size8出题者Gemini-2.5-Pro ❌ 不训练 仅离线标注每个任务的技能相关属性解题者Executor ❌ 冻结不训练 训练时用 Qwen3-8B测试时用 Qwen3-8B 32B Gemini-2.5-Pro / Gemini-3.1-Flash-LiteReActAgentic 任务 CoT推理任务Skill 总结者Qwen3-8B Curator ✅ GRPO RL 训练核心设计哲学“学会如何管理技能而不是学会如何使用技能” —— Executor 冻结只训练 Curator通过长周期间接奖励信号学习 Skill 的增删改策略。这篇工作给出了两个对后续研究极其重要的结论结论 1训练过的小模型总结者 冻结的大模型总结者在 SkillOS 的实验里RL 训练过的 Qwen3-8B 作为 Curator效果超过直接用冻结的 Gemini-2.5-Pro 作为 Curator。这说明如何管理 skill本身是一项可被训练的能力而且小模型经过专门训练后能压过大模型直接使用。结论 2不动解题者性能也能涨在 ALFWorld 上仅训练 Curator、解题者完全冻结的情况下整体性能仍能取得长足进步。这意味着换 Curator是一条比换 Executor更轻量的优化路径。3.6 AgentEvolverarXiv: 2511.10395⭐核心主张完全自主的三环自演化框架 —— 自出题、自解题、自总结经验全链路无需人工标注。角色配置训练题目来源环境探索生成Self-Questioning 全自动出题者LLM 自身与解题者同一模型 ✅解题者Qwen2.5-7B/14B-Instruct ✅ 训练Experience 总结者Experience Manager ❌ 不训练 论文中没明说是什么模型扒代码发现是调 Qwen-MAX API本质上是阿里 Reme 记忆管理机制Self-Questioning 四步流程探索高温 LLM 广度优先N_b 步 深度优先探索环境合成从探索轨迹蒸馏 用户偏好约束 → 生成任务 g 与参考解筛选词法去重 语义相似度 可行性验证混合可选特点出题与解题使用同一个 Qwen2.5-7B/14BRL 训练后形成出题质量与解题能力的双重提升。3.7 第二类总结第二类工作走得比第一类更远——把经验从外挂变成了权重。但仔细看仍能拎出几条共性核心点 1. 仍然依赖训练集反馈除 AgentEvolver 外 核心点 2. 核心是 RL rollout 时继承/更新之前的 skill核心点 3. 不算严格意义的RL by talking —— 因为反馈仍来自任务结果或人工标签而不是交互对话本身04 第三类0 数据自学型特征完全不要人工标注的数据靠 Agent 之间互相出题/解题闭环。这一类的精神更激进连数据集都不要Agent 自己出题自己考自己。4.1 Agent0arXiv: 2511.16043TLDR学习工具使用一个 Agent 负责出题一个 Agent 负责解题。组件Curriculum Agent (RL)负责出题reward 答题 Agent 的不确定性 工具使用频率Executor Agent (RL)负责解题reward 解题成功率流程出题 Agent 先 RL 训练答题 Agent 冻住作为 reward model出题 Agent 冻住给答题 Agent 出题做 RL 训练。PS在解题成功率 reward 上有一个比较大的问题——题目的答案是 Curriculum Agent 自己多采样投票选出来的 sliver answer。评估集数学类为主GSM8K、AIME 等。4.2 Tool-R0arXiv: 2602.21320TLDR类似 Agent0但做的是 general tool 而不是纯数学。Reward 设计Generator Agent格式 reward 合法性 reward不能有幻觉 tool 难度 reward不能太难太简单Solver Agent格式 reward 准确性 rewardPS答案仍然是 Generator Agent 自己生成的 sliver answer。评估集ToolAlpaca、SealTool、NexusRaven。4.3 Absolute ZeroarXiv: 2505.03335TLDR单个模型同时扮演出题人和解题人用代码执行器作为唯一的验证来源完全不碰任何外部数据。组件出题 Agentreward 1 − 答题 Agent 成功率但成功率为 0 时 reward 也为 0避免出太难的题答题 Agentreward 解题成功率出题流程题目为 [输入, 代码, 输出] 三元组随机删除一个让答题 Agent 猜测以代码执行器为最终判断标准。这是一个非常聪明的设计——它把判分这件事完全外包给了一个绝对客观的执行环境。评估集代码HumanEval、MBPP、LCB数学AIME24、AIME25、AMC、MATH-500、Minerva、Olympiad4.4 第三类总结真·不需要训练数据通用流程出题 Agent 训练 → 出题构造数据集 → 解题 Agent 训练 → 出题 Agent 训练 …核心点 1. 全靠出题的 Agent 自己核心点 2. 准确率判断大多靠对照出题 Agent 自己给出的答案——这是个隐患sliver answer 的可靠性需要打问号核心点 3. 最好要有自动化的判断标准——比如 Absolute Zero 用的代码执行器核心点 4. 出题难度很重要——太难学不懂太简单学不到这个 reward shaping 是核心难点核心点 5. 评估很混乱——只有数学类的 benchmark 勉强出现了多次其余几乎完全没有重叠可比性差05 横向对比四篇代表工作的三角色视角第二类里 SkillRL → SKILL0 → SkillOS → AgentEvolver 这四篇我们想专门拎出来横向对比因为它们最能反映长程 Agent 自进化的范式演进。5.1 核心对比表论文训练题目来源出题者解题者训练Skill/Experience 总结者训练SkillRL官方数据集训练集—Qwen2.5-7B ✅ 训练OpenAI o3 ❌SKILL0官方数据集训练集—Qwen2.5-VL-3B/7B ✅ 训练OpenAI o3继承❌SkillOS官方数据集训练集Gemini-2.5-Pro仅离线分组❌Executor 冻结 ❌Qwen3-8B Curator ✅AgentEvolver完全自动生成LLM 自身与解题者同一模型Qwen2.5-7B/14B ✅Qwen-MAX API ❌5.2 一行式速记SkillRL [训练集❌] [解题者 ✅] [总结者 ❌] SKILL0 [训练集❌] [解题者 ✅] [总结者 ❌] SkillOS [训练集❌] [解题者 ❌] [总结者 ✅] ← 唯一训练总结者的工作 AgentEvolver [出题者✅] [解题者 ✅] [总结者 ❌]5.3 强模型依赖程度方法依赖的强模型用途SkillRLOpenAI o3Skill 总结核心SKILL0OpenAI o3继承Skill 总结核心SkillOSGemini-2.5-Pro辅助 Qwen3-32BJudge标注分组 质量评估AgentEvolverQwen-MAXExperience 提取 总结可以看到总结这一步几乎所有人都默契地外包给了大模型 / 闭源 API这跟我们前面在第一类总结里观察到的现象高度吻合。5.4 数据依赖程度高依赖外部数据 ←─────────────────────────────────────────→ 完全自主 │ │ SkillRL SKILL0 SkillOS AgentEvolver 官方数据集 复用 SkillRL 官方分组 完全自生成5.5 范式演进脉络SkillRL (2602.08234) 强模型提炼知识 → 弱模型 RL 学会使用 → 递归演化技能库 ↓ SKILL0 (2604.02268) 同样的技能库 → 渐进撤回 → 内化进参数 → 零样本执行无检索开销 ↓ SkillOS (2605.06614) 冻结执行者 → 训练 Curator → 学会如何管理技能增/改/删 ↓ AgentEvolver (2511.10395) 全链路自主 → 自出题 自解题 自总结 → 步骤级信用分配06 关键洞察被忽视的总结者6.1 总结者是被严重低估的关键模块把一三两类 四篇代表工作的是否训练总结者列在一起工作Skill 总结者是否训练AutoSkill❌EvoSkill❌Claude Code w/ Opus 4.5MemSkill❌CoEvoSkills❌Claude CodeSE-Agent❌EvolveR❌Qwen2.5SAGE✅序列 rollout 中带 reward 总结SkillRL❌OpenAI o3SKILL0❌继承SkillOS✅唯一专门训练AgentEvolver❌Qwen-MAX API可以看到针对总结者本身做训练的工作屈指可数——SAGE 算半个在 RL 过程中有 skill rewardSkillOS 才是真正完整地把 Curator 当成主训练对象。而 SkillOS 给出的实验结论——训练后的 8B Curator 优于冻结的 Gemini-2.5-Pro Curator——恰好印证了这件事的价值。6.2 自主性 × 总结质量的二维空间把四篇代表性工作放到两个维度上看总结者训练 ▲ SkillOS │ │ │ ─────────┼──────────► 题目自动生成 │ SkillRL/ │ AgentEvolver SKILL0 │右上方那个空白象限——既自动生成题目、又训练总结者——目前没有一篇工作覆盖。这是当前最显眼的研究空白。6.3 横向 vs 纵向总结的融合空间第一类工作里的 SE-Agent 是横向多次采样总结其他都是纵向历史对话总结。这两者在第二类工作里基本没有融合——SkillRL/SKILL0/SkillOS 仍以纵向为主。横向 纵向的融合会不会带来更稳健的 Skill 库是一个开放问题。07 写在最后这一年多自进化 Agent 的研究节奏其实非常快从存技能到训技能、从依赖人工数据到零数据自训几乎每个月都能看到新工作冒出来。但仔细啃完之后会发现还有大片研究空白没人去碰——尤其是总结者本身的训练和完全自主 训总结者这条交叉路径。回过头看这条赛道的本质问题其实只有一个如何让 Agent 在没有人工干预的情况下把交互的副产物转化为下一次更强的能力无论是把经验存进文件、训进权重还是让 Agent 之间互相出题所有路径都在回答这一个问题的不同侧面。附录 A论文索引简称arXiv类别AutoSkill2603.01145第一类EvoSkill2603.02766第一类MemSkill2602.02474第一类CoEvoSkills2604.01687v2第一类SE-Agent2508.02085第一类EvolveR2510.16079第二类SAGE2512.17102第二类SkillRL2602.08234第二类SKILL02604.02268第二类SkillOS2605.06614第二类AgentEvolver2511.10395第二类Agent02511.16043第三类Tool-R02602.21320第三类Absolute Zero2505.03335第三类附录 B评估数据集索引数据集使用工作类型WildChat-1MAutoSkill用户对话OfficeQAEvoSkill办公图表LoCoMo / LongMemEvalMemSkill长程对话记忆SkillBenchCoEvoSkills技能ALFWorldSkillRL SKILL0 SkillOS具身/AgenticWebShopSkillRL SKILL0 SkillOS网页购物Search-QASkillRL / SKILL0检索问答AppWorldSAGEAPP 交互NQ HotpotQA TriviaQA / PopQAEvolveR检索问答DeepMath-103kSkillOS数学推理GSM8K / AIMEAgent0数学ToolAlpaca SealTool NexusRavenTool-R0工具使用HumanEval MBPP LCBAbsolute Zero代码腾讯PCG大数据平台部⭐️⭐️ 新一代全链路数据AI助手——Dola ⭐️⭐️Dola是一款基于Agentic AI能力开发的全链路数据助手用户只需要引入个人的数据表就能得到一枚专属的AI分析师它不仅能够完成日常的取数、跑数等基础任务还能自主规划并执行复杂场景的数据分析例如异动归因、画像对比分析、股票基金回测、房价预测等。Dola可以自行编写SQL、纠正SQL错误、执行查询、使用Python进行数据处理与可视化并最终生成一份完整的分析报告。全程无需编写一行代码只需通过自然语言对话你就能拥有一个全自动工作的“数据小黑工”。这里以1个股票回测的例子看看dola的效果可以看到dola在接收到“金叉买入法回测”这个问题之后首先能自己生成一个计划包括了需要进行的数据准备、策略实现、回测实现和结果分析等详细内容。在按照自己的计划执行完毕后dola最终产出回测结果完成可视化并进行深入分析总结产出一份完整的回测报告。同时还可以将分析的报告做成一个美观的可视化插画/静态网页/看板大大增加了报告的可读性上图左为Dola生成的插画报告右为静态网页。仅做样例展示参考不构成分析建议这里只是以股票回测这样一个比较复杂的案例场景展开大家应该可以想象到在工作场景中Dola对于日常数据分析工作的提效程度是显而易见的。这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容