大模型自我迭代学习的核心动机源于当前训练范式的根本性局限。传统上LLM依赖人类标注或更强外部模型的监督进行训练随着任务复杂度提升这种依赖正面临三重瓶颈一是成本与人力不可持续高质量标注数据获取日益昂贵二是性能天花板逼近Llama-3已训练于15万亿token量级的语料单纯依靠更多真实数据来显著提升性能可能已触及上限三是静态部署的困境——模型部署后权重冻结无法从与用户的持续交互中永久吸收新知识。自我迭代学习试图打破这一僵局其核心假设是模型可以通过自身生成的经验进行自主学习和演化如同AlphaZero通过自我对弈超越人类监督的局限LLM也应当能够通过自我生成的训练信号实现能力的持续跃升。这一范式转变标志着从人类教模型到模型自学的理念革新。现有方法可归入一个统一的四阶段迭代框架经验获取 → 经验精炼 → 模型更新 → 效果评估。围绕这一框架不同研究各有侧重。2.1 基于反思与重试的强化学习路径Reflect, Retry, Reward (R3) 方法是这一路径的典型代表。其核心逻辑简洁而有效模型在任务失败后生成自我反思若反思能帮助第二次尝试成功则仅对反思部分的token进行奖励通过GRPO算法。这使得模型学会如何更好地反思而非记忆特定任务的答案。实验表明该范式在数学方程任务上实现了高达34.7%的性能提升在函数调用任务上提升18.1%。2.2 基于任务空间探索的自课程学习路径Exploratory Iteration (ExIt) 则从任务空间的视角切入。其核心洞见是自我迭代中的每一个中间解都可以视为一个新任务——当模型对某个中间状态继续迭代时该状态与初始指令共同构成一个有待优化的新任务实例。ExIt采用优先采样的自课程机制选择最具学习潜力的历史状态进行训练并通过ε-greedy等探索策略维持任务多样性。其显著优势在于即使在训练时仅涉及单步迭代模型在推理时也能执行超出训练深度的多步自我改进。2.3 递归式算法发现路径Self-Developing 框架则将自我迭代推向了更高阶的元层面。该框架使LLM自主生成、应用和学习模型改进算法本身特别是模型融合策略。在GSM8k数学推理任务上其发现的算法将种子模型性能提升了6%并展现出良好的跨模型迁移能力在域外模型上提升7.4%。这标志着模型不仅能用已有方法改进自己甚至能发明新的改进方法。2.4 自编辑与自适应学习路径MIT团队提出的SEAL (Self-Adapting LLMs) 框架别出心裁。它让模型像学生做学习笔记一样将输入信息改写为合成数据再通过强化学习自测每个笔记版本对下游任务的提升效果最终将最优笔记通过权重更新永久内化。SEAL在问答任务上实现了近15%的准确率提升某些技能学习任务上成功率提升超过50%。3.1 典型实验配置不同研究采用了差异化的实验设置但共享一些关键设计原则基础模型从Qwen2系列1.5B-7B、Llama3.18B等中小规模模型起步旨在验证自我迭代能否让小模型以小博大——R3实验显示经训练的1.5B-7B模型可超越同系列10倍大小的未训练模型。验证器Verifier 大多数方法依赖可验证任务数学、函数调用、代码执行中的自动二元反馈成功/失败无需人工标注或ground-truth答案。这是无需教师模型的关键技术前提。训练算法GRPOGroup Relative Policy Optimization被广泛采用因其无需学习独立的价值函数更适合自生成数据的场景。3.2 评估维度自我迭代学习的评估需从三个层面展开任务完成度在GSM8k、APIGen、Countdown等基准上的准确率提升。迭代深度泛化模型能否执行超出训练时见过的迭代步数。ExIt特别验证了这一点证明模型可推广到训练中仅偶有出现的更长迭代序列。跨任务迁移在一个任务域训练的能力能否迁移到新任务。Self-Developing和SAMULE均验证了跨域/跨模型的迁移效果。4.1 性能提升数据R3方法数学方程任务提升34.7%函数调用任务提升18.1%。ExIt方法在MLE-bench机器学习工程任务中同时训练多任务而非单任务是模型从不收敛到收敛的关键——训练任务多样性直接影响学习可行性。Self-DevelopingGSM8k上超越人工设计方法4.3%种子模型绝对提升6%。SEAL问答准确率提升近15%技能学习成功率提升50%。ReflectEvoLlama-3从52.4%提升至71.2%Mistral从44.4%提升至71.1%无需从强模型蒸馏或精细人工标注。4.2 关键发现总结各研究可提取以下规律性结论训练多样性 训练深度ExIt发现相比增加单任务的迭代深度增加训练任务的空间多样性对学习效果影响更大。反思能力可被端到端优化R3证明即使没有高质量反思样例只要将反思有用性作为强化学习目标模型就能自发学会更有效的反思策略。小模型通过自我迭代可跨越规模鸿沟多个研究证实经自我迭代训练的小模型1.5B-7B性能可超越未训练的大模型70B级别。五、挑战与展望自我迭代学习仍面临若干亟待解决的难题灾难性遗忘模型持续适应新知识时旧任务性能可能退化。这是SEAL等方法的已知局限。生成数据质量退化若缺乏外部验证模型可能陷入自我消费的恶性循环。评估体系的缺失静态基准难以衡量模型的持续学习能力需要更动态的评估范式。未来的关键方向包括多模态扩展、多智能体协作学习、以及更高效的在线更新机制。参考文献Jiang, M., Lupu, A., Bachrach, Y. (2025). Bootstrapping Task Spaces for Self-Improvement. arXiv preprintBensal, S., Jamil, U., Bryant, C., et al. (2025). Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning. arXiv preprintDeng, S., Wang, K., Yang, T., Singh, H., Tian, Y. (2025). Self-Improvement in Multimodal Large Language Models: A Survey. Findings of EMNLP 2025Tao, Z., Lin, T. E., Chen, X., et al. (2024). A Survey on Self-Evolution of Large Language Models. arXiv preprintLi, J., Dong, X., Liu, Y., et al. (2025). ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection. Findings of ACL 2025Ishibashi, Y., Yano, T., Oyamada, M. (2025). Can Large Language Models Invent Algorithms to Improve Themselves? NAACL 2025Pari, J., Zweiger, A., et al. (2025). SEAL: Self-Adapting LLMs. NeurIPS 2025 (报道版本)Ge, Y., Romeo, S., Cai, J., Sunkara, M., Zhang, Y. (2025). SAMULE: Self-Learning Agents Enhanced by Multi-level Reflection. EMNLP 2025
【智能体系统AgentOS】核心22:RSI
大模型自我迭代学习的核心动机源于当前训练范式的根本性局限。传统上LLM依赖人类标注或更强外部模型的监督进行训练随着任务复杂度提升这种依赖正面临三重瓶颈一是成本与人力不可持续高质量标注数据获取日益昂贵二是性能天花板逼近Llama-3已训练于15万亿token量级的语料单纯依靠更多真实数据来显著提升性能可能已触及上限三是静态部署的困境——模型部署后权重冻结无法从与用户的持续交互中永久吸收新知识。自我迭代学习试图打破这一僵局其核心假设是模型可以通过自身生成的经验进行自主学习和演化如同AlphaZero通过自我对弈超越人类监督的局限LLM也应当能够通过自我生成的训练信号实现能力的持续跃升。这一范式转变标志着从人类教模型到模型自学的理念革新。现有方法可归入一个统一的四阶段迭代框架经验获取 → 经验精炼 → 模型更新 → 效果评估。围绕这一框架不同研究各有侧重。2.1 基于反思与重试的强化学习路径Reflect, Retry, Reward (R3) 方法是这一路径的典型代表。其核心逻辑简洁而有效模型在任务失败后生成自我反思若反思能帮助第二次尝试成功则仅对反思部分的token进行奖励通过GRPO算法。这使得模型学会如何更好地反思而非记忆特定任务的答案。实验表明该范式在数学方程任务上实现了高达34.7%的性能提升在函数调用任务上提升18.1%。2.2 基于任务空间探索的自课程学习路径Exploratory Iteration (ExIt) 则从任务空间的视角切入。其核心洞见是自我迭代中的每一个中间解都可以视为一个新任务——当模型对某个中间状态继续迭代时该状态与初始指令共同构成一个有待优化的新任务实例。ExIt采用优先采样的自课程机制选择最具学习潜力的历史状态进行训练并通过ε-greedy等探索策略维持任务多样性。其显著优势在于即使在训练时仅涉及单步迭代模型在推理时也能执行超出训练深度的多步自我改进。2.3 递归式算法发现路径Self-Developing 框架则将自我迭代推向了更高阶的元层面。该框架使LLM自主生成、应用和学习模型改进算法本身特别是模型融合策略。在GSM8k数学推理任务上其发现的算法将种子模型性能提升了6%并展现出良好的跨模型迁移能力在域外模型上提升7.4%。这标志着模型不仅能用已有方法改进自己甚至能发明新的改进方法。2.4 自编辑与自适应学习路径MIT团队提出的SEAL (Self-Adapting LLMs) 框架别出心裁。它让模型像学生做学习笔记一样将输入信息改写为合成数据再通过强化学习自测每个笔记版本对下游任务的提升效果最终将最优笔记通过权重更新永久内化。SEAL在问答任务上实现了近15%的准确率提升某些技能学习任务上成功率提升超过50%。3.1 典型实验配置不同研究采用了差异化的实验设置但共享一些关键设计原则基础模型从Qwen2系列1.5B-7B、Llama3.18B等中小规模模型起步旨在验证自我迭代能否让小模型以小博大——R3实验显示经训练的1.5B-7B模型可超越同系列10倍大小的未训练模型。验证器Verifier 大多数方法依赖可验证任务数学、函数调用、代码执行中的自动二元反馈成功/失败无需人工标注或ground-truth答案。这是无需教师模型的关键技术前提。训练算法GRPOGroup Relative Policy Optimization被广泛采用因其无需学习独立的价值函数更适合自生成数据的场景。3.2 评估维度自我迭代学习的评估需从三个层面展开任务完成度在GSM8k、APIGen、Countdown等基准上的准确率提升。迭代深度泛化模型能否执行超出训练时见过的迭代步数。ExIt特别验证了这一点证明模型可推广到训练中仅偶有出现的更长迭代序列。跨任务迁移在一个任务域训练的能力能否迁移到新任务。Self-Developing和SAMULE均验证了跨域/跨模型的迁移效果。4.1 性能提升数据R3方法数学方程任务提升34.7%函数调用任务提升18.1%。ExIt方法在MLE-bench机器学习工程任务中同时训练多任务而非单任务是模型从不收敛到收敛的关键——训练任务多样性直接影响学习可行性。Self-DevelopingGSM8k上超越人工设计方法4.3%种子模型绝对提升6%。SEAL问答准确率提升近15%技能学习成功率提升50%。ReflectEvoLlama-3从52.4%提升至71.2%Mistral从44.4%提升至71.1%无需从强模型蒸馏或精细人工标注。4.2 关键发现总结各研究可提取以下规律性结论训练多样性 训练深度ExIt发现相比增加单任务的迭代深度增加训练任务的空间多样性对学习效果影响更大。反思能力可被端到端优化R3证明即使没有高质量反思样例只要将反思有用性作为强化学习目标模型就能自发学会更有效的反思策略。小模型通过自我迭代可跨越规模鸿沟多个研究证实经自我迭代训练的小模型1.5B-7B性能可超越未训练的大模型70B级别。五、挑战与展望自我迭代学习仍面临若干亟待解决的难题灾难性遗忘模型持续适应新知识时旧任务性能可能退化。这是SEAL等方法的已知局限。生成数据质量退化若缺乏外部验证模型可能陷入自我消费的恶性循环。评估体系的缺失静态基准难以衡量模型的持续学习能力需要更动态的评估范式。未来的关键方向包括多模态扩展、多智能体协作学习、以及更高效的在线更新机制。参考文献Jiang, M., Lupu, A., Bachrach, Y. (2025). Bootstrapping Task Spaces for Self-Improvement. arXiv preprintBensal, S., Jamil, U., Bryant, C., et al. (2025). Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning. arXiv preprintDeng, S., Wang, K., Yang, T., Singh, H., Tian, Y. (2025). Self-Improvement in Multimodal Large Language Models: A Survey. Findings of EMNLP 2025Tao, Z., Lin, T. E., Chen, X., et al. (2024). A Survey on Self-Evolution of Large Language Models. arXiv preprintLi, J., Dong, X., Liu, Y., et al. (2025). ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection. Findings of ACL 2025Ishibashi, Y., Yano, T., Oyamada, M. (2025). Can Large Language Models Invent Algorithms to Improve Themselves? NAACL 2025Pari, J., Zweiger, A., et al. (2025). SEAL: Self-Adapting LLMs. NeurIPS 2025 (报道版本)Ge, Y., Romeo, S., Cai, J., Sunkara, M., Zhang, Y. (2025). SAMULE: Self-Learning Agents Enhanced by Multi-level Reflection. EMNLP 2025