为什么让AI同时学多门课,反而会让它“偏科“越来越严重?

为什么让AI同时学多门课,反而会让它“偏科“越来越严重? 这项由上海人工智能实验室主导的研究发表于2026年7月论文以预印本形式发布在arXiv平台编号为arXiv:2607.16850v1感兴趣的读者可以通过该编号检索完整论文。一、一个让AI研究者头疼的老问题假设你是一位私人教练同时带着五个学员一个想练长跑耐力一个想练举重爆发力一个想练瑜伽柔韧性一个想练拳击速度一个想练游泳协调性。如果你给所有人制定完全相同的训练计划结果会怎样举重运动员可能练得风生水起但瑜伽学员会因为太多力量训练而受伤长跑学员可能进步飞速但游泳学员几乎没有水感训练。每个人的需求完全不同却被同一套方案对待最终的结果往往是强者越强、弱者越弱。现代大型语言模型也就是像ChatGPT、DeepSeek这类AI系统的训练面对的正是这样一个难题。这些AI不是只学一件事它们需要同时学会数学推理、物理解题、写代码、回答科学问题、理解指令……每一类任务对AI来说难度和特性都截然不同。上海AI实验室的研究团队发现现有的AI训练方法在处理这种多科目同时学习时存在一个根本性的隐患——它们让AI越来越偏科而且这个偏科的趋势会随着训练不断自我强化。这个研究的核心贡献是找到了这种偏科现象背后的真正元凶并提出了一套名为组熵控制策略优化Group Entropy-Controlled Policy Optimization简称GEPO的解决方案。在十三个不同类型的测试项目上这套方法的综合表现超过了目前主流的所有同类方法。二、熵AI的一个重要体温计在正式讲解这个研究之前需要先理解一个关键概念——熵。这个词听起来很物理学但其实可以用一个非常直观的比喻来理解。把AI回答一道题的过程想象成一个人在面对路口做选择。当这个人对路非常熟悉他几乎不需要考虑直接走上最常走的那条——这就是低熵状态也就是AI非常确定自己要给出什么答案它的选择空间很窄几乎每次都走同一条路。相反当这个人对路完全陌生每个路口都可能选左也可能选右每次走出的路线都不一样——这就是高熵状态AI非常不确定它的答案每次都可能大相径庭。在AI的强化学习训练中熵是衡量AI探索程度的晴雨表。高熵意味着AI还在积极探索各种可能的答案路径这对于难题来说是健康的低熵意味着AI已经倾向于集中在某几个固定的回答上对于已经基本掌握的简单题来说这是好事但如果来得太早就意味着AI过早地锁定了一种思路放弃了探索其他可能更好的解题方法。研究团队通过实验观察到了一个非常有趣的现象在同样一个正在训练的AI模型下不同类型的题目会触发截然不同的熵水平。具体来说物理题的平均熵值约为0.49数学题约为0.60而指令遵循类任务比如请用正式语气改写这段话的熵值高达0.78。这就好比同一个学生做选择题时思路很清晰低熵做作文时思绪万千、下笔困难高熵——这是完全正常的因为题目本身的性质就不同。三、现有方法的盲点用同一把尺子量不同的事现在的主流AI训练算法在处理熵的问题上大致分为两个层次的方法但两者都有根本性的局限。第一类是全局熵控制就是把整个模型当作一个整体计算出一个平均熵值然后统一调整。这就像用全班同学的平均身高来决定食堂餐桌的高度——平均值掩盖了个体差异高个子要弯腰矮个子够不着。当AI同时学习物理和指令遵循时一个任务的熵已经很低了另一个还很高取平均之后得到一个中间值对谁都不合适。第二类是词元级熵控制粒度更细细化到AI生成每一个字词时的不确定性。这虽然比全局方法更精细但仍然没有解决根本问题它只看到了单个字词的不确定性却没有把不同任务类型之间的差异考虑进去。在这两类方法之外还有一个更严重的问题几乎被所有人忽视了。现有最流行的AI训练算法之一叫做GRPO组相对策略优化它的核心做法是让AI对同一道题生成多个不同的答案然后根据这些答案的好坏打分再把分数标准化——也就是把每道题的分数转换成相对排名高于平均分的答案得到正向激励低于平均分的答案得到负向惩罚。这个标准化操作本来是为了让不同题目的激励信号可以相互比较。但研究团队发现这个假设在不同题目的熵差异很大时根本不成立。四、偏科的恶性循环是怎么形成的为了说清楚这个问题需要从GRPO的激励机制说起。当AI在某道题上得分的标准差很小也就是所有答案质量差不多标准化之后每个答案的激励信号都很弱AI不会得到太强烈的你做对了或你做错了的信号。而当某道题上所有答案质量差异很大比如大多数都错、偶尔一个对正确答案得到的激励信号就会非常强烈错误答案受到的惩罚则很分散、很轻微。研究团队推导出了一个精确的数学关系假设某道题上AI答对的概率是p那么正确答案得到的激励强度是√((1-p)/p)错误答案受到的惩罚强度是√(p/(1-p))。当p很小比如p0.16也就是只有16%的答案是对的正确答案的激励强度会爆炸性地增大而错误答案的惩罚则非常微弱。这就造成了一种极度扭曲的训练信号。而这种扭曲恰恰在高熵任务如指令遵循上最为严重因为高熵任务往往对应着更低的正确率。研究团队在真实训练数据上验证了这一点物理题低熵的优势分布接近对称数学题中等熵呈现轻微的右偏斜而指令遵循任务高熵的偏斜值高达2.32、峰度高达4.84分布极度扭曲——绝大多数答案都只得到很小的负面信号而极少数正确答案却得到了极端强烈的正向信号。更糟糕的是不同任务之间的标准化分数根本不处于同一参考系下。研究团队用两个命题严格证明了这一点首先当AI的熵越低它的选择分布与均匀分布也就是随机乱选的偏差越大这意味着低熵任务的分数分布被策略本身严重扭曲其次这种扭曲直接导致标准化之后的激励信号在低熵任务上系统性地偏离了真实的奖励排名而在高熵任务上则偏差较小。这两个效应叠加在一起创造出了一个令人担忧的循环低熵任务AI已经学得比较好的任务产生了最强烈、最一致的训练梯度进一步加强了AI在这些任务上的能力而高熵任务AI还需要更多探索的任务产生了弱小、嘈杂的训练信号学习效率越来越低。随着低熵任务越做越好它的熵进一步降低与高熵任务的差距越来越大高熵任务受到的有效训练越来越少。偏科的剪刀就这样越张越大。五、GEPO的解法给每道题定制一把专属体温计面对这个问题上海AI实验室的团队提出的方案核心思路是不再用一把全局的尺子量所有任务而是给每一组题目单独量一次体温然后根据这个体温做出针对性的调整。具体来说GEPO的第一步是计算组熵。在GRPO的训练过程中AI本来就需要对同一道题生成多个答案通常是16个GEPO利用这些已有的答案直接计算这一组答案的平均熵值把它称为该题目的组熵。这个计算完全免费不需要额外生成任何答案因为答案已经在那里了。为了让不同长度的答案之间可以公平比较还会把总熵值除以平均答案长度得到每个词的熵。得到组熵之后GEPO做的第二步是根据体温施加定制化的干预。具体规则如下对于组熵很低的题目AI已经非常确定说明快要固化了如果这道题里出现了答对的答案就把给这个答案的正向激励适当削弱一点避免AI在已经学得够好的方向上继续过度强化防止它过早地锁死思路。对于组熵很高的题目AI还在大量探索说明这类任务还没学好如果出现了答错的答案就把给这个答案的负向惩罚适当减轻一点避免AI还没来得及探索出好的解题路径就因为大量的惩罚信号而放弃了探索。这个干预是不对称的也就是说减轻低熵任务的正向激励和减轻高熵任务的负向惩罚用的是不同的力度。研究团队发现低熵任务对干预更敏感如果在低熵任务上过于激进地惩罚错误答案会导致AI为了降低每个词的不确定性而快速缩短回答长度——这是一种病态行为叫做长度崩塌表现为AI开始给出越来越简短甚至空洞的回答。因此对低熵任务的干预要温柔对高熵任务的干预可以更大胆。在实验中对低熵任务的正向激励缩减系数设为0.5对高熵任务的负向惩罚缩减系数设为0.2。第三步是自适应阈值。怎么判断一道题的组熵是低还是高这个标准不能固定死因为不同的基础模型、不同的训练阶段熵的绝对数值差异很大。GEPO的解决方案是每一轮训练时计算当前这一批题目的平均熵值和标准差然后把均值减去0.2个标准差定义为低熵阈值把均值加上0.3个标准差定义为高熵阈值。组熵低于低熵阈值的题目就触发低熵干预高于高熵阈值的题目就触发高熵干预介于两者之间的题目则完全保持原样不做任何调整。为了防止这个阈值因为某一批数据的偶然波动而剧烈跳动GEPO还用了指数移动平均的方式把阈值平滑化——简单理解就是新计算出的阈值只占10%的权重历史积累的阈值占90%的权重平滑系数γ0.01这样阈值会随着训练进展缓慢稳定地变化不会因为某一批特别难或特别简单的题目而急剧波动。六、实验结果在十三个考场上的成绩单研究团队用两个不同的基础模型来测试GEPO的效果分别是Intern-S1-mini一个轻量级多模态推理模型和Qwen3.5-9B一个纯文本推理模型。测试覆盖了十三个不同的基准测试包括数学竞赛AIME2025、IMO-Bench、数学视觉理解MathVista、物理推理Physics、CMPhysBench、指令遵循IFBench、代码生成LiveCodeBench、综合知识MMLU-Pro、GPQA、多模态理解MMMU-Pro、科学推理SFE、MicroVQA和图表理解ChartQAPro。对比的基准方法包括原始的GRPO算法、AEPO一种基于熵的改进方法、Clip-Cov和KL-Cov两种基于概率协方差的覆盖率感知方法。在Intern-S1-mini上GEPO在十三个测试中的七个上取得了最好成绩综合平均分达到54.2而GRPO、Clip-Cov、KL-Cov分别是51.5、51.5、51.8。AEPO在数学上表现不错但在物理和指令遵循上表现欠佳综合同样是51.8。尤其值得关注的是GEPO在数学竞赛类题目上的表现AIME25从74.6提升到82.0IMO-Bench从42.3提升到52.8GPQA从65.1提升到69.2——这些都是极具挑战性的题目提升幅度相当显著。在Qwen3.5-9B上GEPO的综合平均分达到71.2高于GRPO的70.7、Clip-Cov的70.9和KL-Cov的69.9。AEPO在这个模型上表现大幅倒退综合仅67.1甚至不如原始的GRPO这说明AEPO的固定熵控制策略对不同模型的适应性很差——当模型的熵特性发生变化时AEPO的表现会出现明显下滑。GEPO的自适应阈值机制则无需任何调整就能自动适配新模型。训练过程的稳定性差异同样引人注目。在Qwen3.5-9B的训练过程中原始GRPO在训练到约170步时发生了灾难性崩溃AIME25的准确率从约85%骤降至约40%同时GPQA、MMMU-Pro、MathVista也同步大幅下滑。这是失控的熵增长导致的没有任务感知的熵调节模型的输出熵可以无限制地增长最终产生混乱无意义的输出。AEPO虽然避免了完全崩溃但表现出持续的震荡始终无法稳定收敛。KL-Cov在同一模型上于100步后也发生了训练崩溃推测原因是它使用了固定的熵阈值无法适应不同任务的需求。GEPO则全程平稳上升从未出现任何崩塌迹象。通过观察不同任务的熵随训练步数的演变可以更清楚地看到GEPO和AEPO的本质区别。AEPO会把所有任务的熵强行拉向相似的水平抹平了不同任务之间本来应该存在的差异——这就像那位私人教练给所有学员制定了完全相同的训练量不管你是举重还是瑜伽。GEPO则恰恰相反它保留了不同任务之间的熵差异需要更多探索的任务维持在较高的熵水平而已经基本掌握的任务则自然降低到较低的熵水平形成了一个健康的、因任务而异的学习节奏。七、拆开来看每个零件都不可缺少研究团队还通过消融实验也就是逐一去掉某个功能看看成绩有什么变化验证了GEPO各个组成部分的贡献。去掉高熵控制即不再减轻高熵任务的负向惩罚时综合成绩从54.2下降到51.3下降幅度最大。这说明高熵控制是GEPO最关键的组件——如果不保护高熵任务的探索空间AI会在高熵任务上因为大量惩罚信号而过早放弃探索物理和AIME25这类需要深度推理的任务受损最严重。去掉低熵控制即不再减弱低熵任务的正向激励时综合成绩下降到52.6。低熵控制的主要作用是防止AI在已经学好的方向上过度强化保持探索多样性主要对IMO-Bench和指令遵循任务的贡献更为突出。去掉不对称设计把两个缩减系数设置为相同值时综合成绩下降到53.0。这说明区分对待两种熵状态、用不同力度进行干预确实比一刀切的对称处理更有效。这个发现呼应了之前关于低熵任务对激进干预更敏感的分析温柔对待低熵任务、大胆对待高熵任务是符合各自特性的设计。归根结底这个研究讲述的是一个关于因材施教的故事。AI在同时学习多种不同性质的任务时不同任务处于完全不同的学习阶段和探索状态如果用统一的方式对待它们强的会越来越强、弱的会越来越弱最终形成一种高效率但高度偏科的AI。GEPO的方案是给每一组题目独立测量探索体温然后针对性地调整训练信号——已经学得很扎实的任务稍微踩一踩油门别让它抢占太多资源还需要大量探索的任务少用点刹车给它更多空间去寻找正确路径。这种调整既不需要提前告诉AI哪些题是哪类任务也不需要额外生成任何答案成本几乎为零。这对普通用户而言意味着什么这项研究直接影响的是AI大模型的后训练质量。一个通过GEPO训练的AI在回答你的数学问题和写作需求时能做到更均衡不会因为数学题比较好训练而把大量精力都投入数学忽视了你的写作或代码需求。更重要的是训练过程更稳定意味着研究机构和企业在训练AI时的失败风险降低了最终产出的模型质量更可靠。有意深入了解技术细节的读者可以通过arXiv编号2607.16850检索完整论文作者来自上海人工智能实验室论文包含完整的数学推导和实验细节。QAQ1GRPO训练中为什么不同任务的激励信号会产生系统性的不平衡AGRPO通过对同一道题的多个答案进行标准化处理来构建激励信号但这种标准化隐含着一个前提不同题目的激励信号在同一参考框架下可以相互比较。然而当不同任务的熵差异很大时标准化后的分数分布本身就受到策略分布的扭曲低熵任务产生的激励信号更强烈、更一致高熵任务产生的信号更弱小、更嘈杂导致训练资源被低熵任务系统性地抢占。Q2GEPO的自适应熵阈值和固定阈值相比有什么优势A固定阈值在不同基础模型或训练阶段之间无法适应因为不同模型的熵绝对数值差异很大同一个固定阈值对某个模型可能合适对另一个模型可能完全失效。GEPO的阈值基于当前批次的熵均值和标准差动态计算并通过指数移动平均平滑能自动跟随训练进展和模型特性调整无需针对每个模型单独调参。Q3GEPO需要额外的计算开销或额外的数据标注吗AGEPO不需要任何额外的计算开销也不需要任何任务类型的标注信息。组熵的计算完全基于GRPO训练过程中已有的答案样本属于零成本的顺手操作。整个方法作为GRPO的轻量扩展可以直接集成到现有的基于分组的策略优化框架中不改变采样流程不增加模型参数。