SkillEvolver:让 Agent 学会“自己写技能”的元技能框架

SkillEvolver:让 Agent 学会“自己写技能”的元技能框架 一、一句话概述SkillEvolver 的核心想法很直接与其让人手写 Agent skill或者让模型一次性“凭记忆”生成 skill不如给 Agent 一个meta-skill让它在少量训练任务试错中自动探索、编写、部署、审计并迭代出一个可复用的领域 skill。这篇论文把 skill learning 从“写一段提示词”推进到“部署后看真实使用效果再修 skill 文档和代码”的在线学习流程。学习对象不是模型权重而是可以被 Claude Code、Codex 等 CLI-agent 直接加载的 skill artifact。二、研究背景与动机现在的 Agent skill 大多是静态资产要么由人类专家整理要么由模型根据预训练知识一次性生成。问题在于真实工作流往往很长尾某个 Excel 模板怎么填、某个项目 schema 怎么遵守、某个脆弱工具接口怎么调用这些知识很难完全靠模型参数记住。已有的自动化 skill 方法也有明显限制。Self-Gen 这类方法通常是“看任务说明一次性生成 skill”缺少真实反馈Trace2Skill、SkillRL 等方法虽然能从大量轨迹或跨任务经验中蒸馏技能但往往需要预先收集很多轨迹、搭建离线流水线成本更高。SkillEvolver瞄准的是一个更贴近部署的场景一个新任务来了只有少量训练变体可探索能不能在不微调模型的情况下把这些试错经验压缩成一个可移植的 skill三、核心方法详解SkillEvolver 不是一个新 Agent 框架而是一个meta-skill。它被普通 CLI-agent 加载之后不直接解决目标任务而是指导这个 Agent 去生成另一个领域专用 skill。图1 SkillEvolver meta-skill 部署结构图1SkillEvolver 的部署结构。左侧是被 CLI-agent 加载的 meta-skill中间是 SkillEvolver Agent 负责生成和优化领域 skill右侧是新的 Domain-Skill Agent 在验证任务中加载最终 skill。这个设计里有两个角色SkillEvolver Agent负责理解任务、设计探索策略、分析轨迹、修改 skill。Domain-Skill Agent像未来真实用户一样只拿到候选 skill 和任务然后实际执行。论文最关键的判断是skill 的质量不能只看作者 Agent 自己怎么想而要看另一个 fresh agent 真的加载它之后会怎么用。很多失败只会在“部署交接”时暴露例如 skill 写得看似完整但调用入口不明显导致使用者根本没有触发它或者文档里保留了训练样例里的常量验证集一换文件名就失败。图2 SkillEvolver 迭代循环图2SkillEvolver 的一次迭代。流程包括策略多样化探索、成功/失败轨迹对比、局部 patch skill、独立审计最后把通过审计的候选 skill 进入下一轮。具体来看一轮 SkillEvolver loop 包含四个关键步骤。1. 策略多样化探索每轮开始前SkillEvolver Agent 不只是调高采样温度而是显式写出 K 个不同高层策略。论文实验中 K4。策略差异可以体现在库选择、算法路线、参数推断方式、任务说明解释等维度。这样做的目的是避免四次 rollout 只是措辞不同、底层方案其实一样。2. 部署候选 skill 给 fresh agent 使用在第一轮还没有领域 skill 时系统会使用一个最小 skill 来分发策略。后续轮次中已有的候选 skill 会作为真实依赖交给 Domain-Skill Agent让它在训练任务上执行。也就是说SkillEvolver 不是在作者视角里自我反思而是在观察“别人用我写的 skill 会踩什么坑”。3. 成功/失败轨迹对比并局部更新系统比较高奖励和低奖励轨迹成功轨迹知道了什么、失败轨迹漏掉了什么在二值任务里就是 pass/fail 对比在 KernelBench 这类连续奖励任务里则比较 top 和 bottom 轨迹。得到的差异会被写成 skill 文档或辅助脚本的局部 patch而不是改模型参数。4. 独立 Auditor 审计候选 skill 生成后会交给一个干净上下文的 Auditor。Auditor 只看到候选 skill、任务说明、训练数据和带标签轨迹看不到验证集也看不到 SkillEvolver Agent 的私有推理。它检查 self-contained、是否硬编码训练常量、是否抽象出参数轴、主入口是否明显、是否存在 silent-bypass 等问题。这个 Auditor 很重要因为它把“会不会过拟合训练实例”和“会不会在真实部署时根本没被用上”放在同一个门控里。四、数据集与任务设置论文主要在两个 benchmark 上评估。SkillsBench原始包含 87 个任务论文使用其中 83 个有完整 no-skill 与 human-curated baseline 的任务覆盖 15 专业领域包括 Web development、data science、DevOps、chemistry、quantum computing、finance、document processing、security、scheduling 等。评价指标是 avg5即每个任务跑 5 次成功比例作为该任务分数。KernelBench论文选取 3 个 GPU kernel optimization 任务deepnarrowmlp、shufflenet、gru。这里不看 pass rate而看 correctness-weighted speedup错误 kernel 得 0正确 kernel 按相对 PyTorch 的加速比计分硬件为 NVIDIA H100。对比条件包括 No skill、Human-curated skill、Self-Gen、SkillCreator-SkillsBench、SkillEvolver R1 以及 SkillEvolver R2。R1 是没有第二轮 refinement 的消融版本R2 是完整的“部署后再观察再修正”版本。五、实验与评估先看主结果。图3 SkillEvolver 主实验结果图3主实验表。SkillEvolver R2 在 SkillsBench 83 个任务上达到56.9% avg5高于 No skill 的29.9%和 human-curated skill 的43.6%。最显眼的结果是SkillEvolver R2 的总体 avg5 为56.87%比 no-skill 高27.0 个百分点比人工 curated skill 高13.3 个百分点。R1 已经达到48.2%说明单轮探索和蒸馏已经有价值但第二轮 refinement 又带来约8.7 个百分点把领先人工 skill 的幅度从 4.6 扩大到 13.3。这说明论文的核心设计不是“让模型写一个更长的 skill”这么简单。真正贡献来自部署闭环先把候选 skill 交给 fresh agent 用再从使用失败中修正 skill。在 KernelBench 上SkillEvolver 也有正向迁移。R2 将三项任务的平均 speedup 从1.16提升到1.51。其中gru从1.326提升到2.226说明生成的 skill 不只是适用于二值 workflow也能捕捉到一些 GPU kernel 优化的程序性经验。再看成本和效率。图4 SkillEvolver 成本与效率图4成本与效率表。SkillEvolver R2 每任务成本为$3.92只比 R1 多8%但带来明显精度增益部署到验证侧时还减少 token、turn 和耗时。SkillEvolver R2 的每任务 authoring 成本约$3.92而 SkillCreator-SkillsBench 为$6.97。更有意思的是evolved skill 在验证侧让下游 agent 更省token 降低19.4%turn 降低15.3%wall-clock 降低23.8%。这代表 skill 不只是“增加一段上下文”而是在压缩任务执行路径。相反SkillCreator-SkillsBench 在验证侧 token 和 turn 反而增加说明一个自动写出来的 skill 如果没有部署反馈可能只是把额外文字塞给 agent并没有真正减少工作量。六、案例与可解释性分析论文把 SkillsBench 任务按 skill utility taxonomy 分成不同类别A 表示 no-skill 已经能做B1/B2/B3 表示 curated skill 分别有帮助、无明显影响、反而伤害C1/C2 表示 curated skill 强/弱解锁任务D 表示 no-skill 和 curated skill 都解决不了。图5 SkillEvolver 分类别表现图5按 skill utility 类别拆解。SkillEvolver 的最大收益集中在 curated skill 失效或伤害表现的区域例如 B3、C1 和 D。这个拆解很关键SkillEvolver 不是在所有任务上均匀提升而是在“人工 skill 不够好”的区域提升最明显。比如 D 类从 0 基线提升到0.40C1 类达到0.78B3 类也能在 curated skill 反而伤害表现时找回收益。附录中的任务级热图进一步说明了这种不均匀性。图6 SkillEvolver 任务级 Pass5 热图图683 个任务的 Pass5 热图。四列分别对应 No-Skill、Human Curated、SkillEvolver R1 和 SkillEvolver R2可以看到 R2 在大量低基线任务中打开了新的可解空间。论文还给出了一些代表性 case。正向案例包括✅manufacturing-fjsp-optimizationv1 skill 有子任务 recipe但没有把“一次性主操作”提升到最醒目的入口v2 通过 refinement 把 primary action hoist 到 skill 顶部任务从 0.2 提升到 1.0。✅paper-anonymizerv1 的 prose 方法对但辅助发现脚本没有打包进scripts/导致 agent 无法执行策略v2 保留 helper实现端到端完成。✅virtualhome-agent-planningv1 主体代码正确但 description 没有触发 Claude Code 的 skill 调用v2 改写 description显式命名任务和异常陷阱skill 调用率提升到 5/5。这些例子都指向同一件事Agent skill 的失败不一定是“知识错了”也可能是入口不明显、脚本没有暴露、训练常量没有抽象、或者文档结构让使用者绕过了关键步骤。SkillEvolver 的优势正是在这些部署层 failure mode 上有反馈闭环。七、总结SkillEvolver 的主要贡献可以概括为三点⭐把 skill learning 形式化为 artifact-level adaptation学习目标是 skill 文档、脚本和参考资料而不是模型权重。⭐提出部署驱动的 refinement loop候选 skill 必须被 fresh Domain-Skill Agent 实际使用失败轨迹再反过来修 skill。⭐引入独立 Auditor同时检查过拟合、硬编码、抽象不足、主入口缺失、silent-bypass 等内容级和部署级风险。从结果看SkillEvolver 在 83 个 SkillsBench 任务上超过 human-curated baseline并且在小规模 KernelBench probe 上也带来加速收益。更重要的是它展示了一种很实用的方向未来 Agent 的“经验”未必只能藏在模型参数里也可以沉淀成可检查、可版本化、可迁移的技能资产。八、不足与未来方向8.1 当前不足单一主模型配置主实验主要基于 Claude Opus 4.6 Claude Code。论文提到 GPT Codex spot test 能端到端运行但没有做大规模跨模型 sweep因此“agent-agnostic”更多是接口设计属性而非充分实验结论。迭代深度没有系统刻画论文只比较 R1 和 R2。第二轮贡献很大但 R3 或更深是否继续提升、是否会过拟合、成本曲线如何都还没有展开。benchmark 覆盖仍有限SkillsBench 是 83 个二值 workflow 任务KernelBench 只测了 3 个连续奖励任务。对于更复杂的多模态、长时程 web、企业软件环境结论还需要验证。单任务 skill 生命周期尚未解决SkillEvolver 每次面向一个新任务生成一个 skill但没有处理 skill library 的组织、去重、继承、版本管理以及跨任务迁移。8.2 未来研究方向更丰富的过程信号除了 pass/fail、token、turn、耗时还可以把 step-level verifier、intermediate grounding、关键路径延迟等信号纳入 contrastive update。跨任务 skill library如果多个任务生成了相似 skill如何合并、抽象父 skill、保留任务特化版本是自然的下一步。多 Agent / 多模型审计Auditor 当前是一个独立 fresh session未来可以研究多审计器投票、不同模型交叉审计降低单一模型盲点。从 skill 到软件工程资产既然 skill 包含 prose、scripts、references 和 examples它可以像代码一样被测试、lint、版本控制和持续集成。SkillEvolver 实际上把 Agent 经验管理推向了工程化。 延伸思考这篇论文最值得关注的地方不只是“自动写 skill 的效果更好”而是它把 Agent 能力增长从黑盒参数更新转成了白盒 artifact 演化。一个好的 skill 可以被人读、被审计、被 patch、被移植也可以在失败后精确定位责任。这可能会成为长尾企业工作流里比微调更轻、更快、更可控的一类适应方式。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】