文章目录前言残差连接Transformer的祖传地基出了问题注意力残差给每层装上智能筛选器工程化落地Block AttnRes的分块秘籍实战代码手把手教你替换残差连接使用示例如何替换标准Transformer的残差25%效率提升意味着什么不是终结而是开始写在最后高中生都能改架构你还在怕什么目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。前言马斯克点赞、17岁高中生一作这届AI论文有点东西说出来你可能不信这周AI圈最炸裂的新闻不是GPT-5.1也不是Claude 4.6的百万上下文而是一篇看似冷门的架构论文——连马斯克都在X上转发点赞评论区一堆硅谷大佬喊着深度学习2.0来了。更离谱的是这篇论文的第一作者是个17岁的高中生。没错就是那种你还在背四级单词的年纪人家已经在给Transformer这栋住了快十年的老房子动地基了。3月16日月之暗面Moonshot AI的Kimi团队悄悄把《Attention Residuals》丢上了arXiv论文编号2603.15031。 没 flashy 的 demo 视频也没炒作的发布会纯粹就是一行行公式和冷冰冰的 benchmark 数据。但明眼人一看就懂这东西要是普及了以后训大模型的电费账单能直接打七五折。残差连接Transformer的祖传地基出了问题要理解这次突破有多狠得先回到2017年。那时候Transformer刚出来靠着Attention is All You Need这句口号干翻了RNN。但很多人忘了让Transformer能叠到几百层而不崩的其实是残差连接Residual Connection这个老功臣。简单说残差连接就是个复制粘贴机制。每一层算完后直接把输出加到原来的输入上公式写成 h h f(h)。这玩意就像玩传话游戏时每个人不光听上家的话手里还攥着最原始的那张纸条。这样就算传到第100个人信息也不会彻底失真。但问题是这个纸条传法太死板了。传统残差连接对待前面所有层都一视同仁就像公司开会时把所有人意见不分轻重全写进纪要结果文档越堆越厚关键声音反而被稀释了。Kimi团队在论文里管这叫PreNorm稀释——模型越深每层贡献的信号就越被淹没最后变成一堆数字噪声。更扎心的是这种全员平票的累加方式让隐藏状态像吹气球一样膨胀内存占用跟层数成正比O(Ld)。你想堆个100层的深网络显存先给你表演一个OOM报错。注意力残差给每层装上智能筛选器Kimi团队的解法特别优雅甚至带着点哲学味——既然注意力机制能在序列维度时间上让token互相看来看去那为什么不能在同一维度深度上让层与层之间也搞个对视呢这就是Attention Residuals注意力残差的核心把深度方向当成另一个序列维度用softmax注意力替代固定的加法累加。想象一下以前每层都是闭着眼睛把前面所有层的输出囫囵吞枣。现在呢每层都有个智能筛选器能回头看前面所有层然后打个分“第5层的语义特征对我有用给0.8权重第20层的语法分析对我这步没啥用给0.01权重。” 这样信息不是堆成山而是按需检索清爽多了。技术上他们给每层配了一个可学习的伪查询向量pseudo-query然后用这个向量去跟前面所有层的输出做注意力计算。公式看起来就是标准的 softmax(QK^T)V只不过Q是当前层的查询K和V是前面所有层的历史输出。这招最骚的地方在于它是个即插即用的替换件。你不用改Transformer的其他部分—— attention heads 照旧FFN层不动MoE路由也留着——直接把残差连接那块换掉就行。就像给老房子换了个智能门锁不用推倒重建。工程化落地Block AttnRes的分块秘籍但理论和落地之间差着十万八千里。如果每层都要 attend 前面所有层那内存复杂度还是O(Ld)而且层数越多越慢训个48B参数的模型能卡到你怀疑人生。Kimi团队的工程解法很接地气分块Block-wise。他们把所有层分成8个大块block块内还是传统的残差连接保证并行度块间才用注意力残差做聚合。这样一来内存直接降到O(Nd)其中N是块数远小于层数L。他们还搞了个两阶段推理的 trick第一阶段并行计算块间注意力第二阶段在块内逐层做在线softmax合并。这种流水线设计让GPU的利用率拉满通信开销被压缩到极低。说白了就是大事开小会大事开大会。块内是小组讨论快块间是跨组汇报省资源。最终在Kimi Linear 48B模型总参数48B激活3B训了1.4T tokens上验证训练效率直接提升25%——达到同样的loss水平只需要原来75%的算力或者说同样的算力能训出更好的模型。推理延迟只增加了不到2%基本可以忽略不计。这就像给车换了个更高效的引擎油耗降了25%但车速几乎没变。实战代码手把手教你替换残差连接光说不练假把式。虽然Kimi已经开源了完整实现GitHub: MoonshotAI/Attention-Residuals这里给大家抽出一个最简化的PyTorch版本展示核心逻辑importtorchimporttorch.nnasnnimporttorch.nn.functionalasFfromtypingimportList,TupleclassAttentionResidualBlock(nn.Module): 注意力残差的核心实现用深度方向的attention替代固定残差 适合插入到标准Transformer的层间 def__init__(self,dim:int,num_layers_in_block:int8):super().__init__()self.dimdim# 可学习的伪查询向量每层一个self.pseudo_queriesnn.Parameter(torch.randn(num_layers_in_block,dim)*0.01)# 输出投影self.out_projnn.Linear(dim,dim)defforward(self,current_layer_output:torch.Tensor,# [batch, seq, dim]historical_outputs:List[torch.Tensor],# 前面所有层的输出列表layer_idx:int)-torch.Tensor: Args: current_layer_output: 当前层的原始输出 historical_outputs: 前面各层缓存的输出 layer_idx: 当前层在block内的索引 ifnothistorical_outputs:# 第一层直接返回和标准残差一样returncurrent_layer_output# 堆叠历史输出: [num_layers, batch, seq, dim]past_statestorch.stack(historical_outputs,dim0)# 当前层的查询向量qself.pseudo_queries[layer_idx]# [dim]# 计算attention score: 查询与历史输出的相似度# 简化版直接点积实际论文会用更复杂的映射scorestorch.einsum(d,lbsd-lbs,q,past_states)# [layers, batch, seq]weightsF.softmax(scores,dim0)# 在深度维度做softmax# 加权聚合历史信息aggregatedtorch.einsum(lbs,lbsd-bsd,weights,past_states)# 残差连接当前输出 聚合的历史信息# 实际论文还会有更复杂的gating机制这里做简化展示returncurrent_layer_outputself.out_proj(aggregated)使用示例如何替换标准Transformer的残差classImprovedTransformerLayer(nn.Module):def__init__(self,dim:int,num_heads:int,block_size:int8):super().__init__()self.attnnn.MultiheadAttention(dim,num_heads)self.ffnnn.Sequential(nn.Linear(dim,4*dim),nn.GELU(),nn.Linear(4*dim,dim))self.attn_resAttentionResidualBlock(dim,block_size)self.norm1nn.LayerNorm(dim)self.norm2nn.LayerNorm(dim)defforward(self,x,history,layer_idx):# 标准Attentionxself.norm1(x)attn_out,_self.attn(x,x,x)# 关键替换这里不用简单的 x x attn_out# 而是用Attention Residual聚合历史xself.attn_res(attn_out,history,layer_idx)# FFN部分同理ffn_outself.ffn(self.norm2(x))xself.attn_res(ffn_out,history[x],layer_idx)returnx注意实际生产环境中你需要配合在线softmax合并算法Online Softmax Merging来做两阶段计算不然显存还是顶不住。完整实现建议直接参考Kimi官方GitHub。25%效率提升意味着什么可能你觉得25%看起来不多但算算账就知道这数字有多恐怖。现在训一个70B参数的稠密模型大概需要几千万美元的算力。如果用Attention Residuals同样的预算能训出等效于90B参数模型的效果或者说训原来那个70B模型能省下25%的电费和时间。更关键的是这招解决了模型越深越难训的魔咒。以前堆层数就像叠罗汉叠高了必然摇晃现在每层都能智能筛选前面层的信息百层网络的信息传递反而更清晰。Kimi Linear 48B在GPQA-Diamond科学推理基准上直接涨了7.5分HumanEval代码生成涨了3.1分这些可都是实打实的能力提升。OpenAI前研究副总裁Jerry Tworek看完论文直接说Deep Learning 2.0 is coming。虽然有点夸张但想想也是——从2015年ResNet到现在残差连接十年没变过现在终于被撼动了。不是终结而是开始当然这论文也不是万能药。Attention Residuals需要从零开始训练你没法直接给已有的LLM打个补丁就生效。而且它对超参数很敏感那个辅助loss的系数要是调不好专家容易 collapse虽然这里不是MoE但类似的梯度问题依然存在。另外ByteDance和华中科大在同一天还发了另一篇论文《Mixture-of-Depths Attention》MoDA解决的是同一个问题但路数完全不同。南京大学也有相关理论分析跟进。这说明改造残差连接已经成了2026年开年的技术共识各家都在抢这个山头。站在应用层面如果你现在用Kimi K2.5其实已经在享受Attention Residuals的红利了——这个架构已经实装在Kimi Linear模型里。而对于其他开源模型Hugging Face上已经有第三方复现kyegomez/attn_res虽然没官方优化得那么极致但跑个demo完全够用。写在最后高中生都能改架构你还在怕什么每次看到这样的论文我都有种恍惚感。17岁的陈广宇从黑客松起步进Kimi团队然后一作发顶会级工作——这种履历放在五年前根本不敢想。但开源社区和AI工具的普惠让技术门槛真的在降低。Attention Residuals的故事告诉我们哪怕是被数十万人引用、奉为圭臬的标准设计也可能藏着显而易见的效率黑洞。只需要换个角度——把深度当时间把累加当attention——就能撬動25%的性能提升。下次当你看着自己的训练任务因为OOM报错而崩溃或者看着电费账单发愁时不妨想想是不是该给模型换个更聪明的记忆方式了毕竟连马斯克都点赞的东西大概率错不了。目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。
Transformer架构突破|3.21新论文发布,大模型训练效率提升25%实战
文章目录前言残差连接Transformer的祖传地基出了问题注意力残差给每层装上智能筛选器工程化落地Block AttnRes的分块秘籍实战代码手把手教你替换残差连接使用示例如何替换标准Transformer的残差25%效率提升意味着什么不是终结而是开始写在最后高中生都能改架构你还在怕什么目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。前言马斯克点赞、17岁高中生一作这届AI论文有点东西说出来你可能不信这周AI圈最炸裂的新闻不是GPT-5.1也不是Claude 4.6的百万上下文而是一篇看似冷门的架构论文——连马斯克都在X上转发点赞评论区一堆硅谷大佬喊着深度学习2.0来了。更离谱的是这篇论文的第一作者是个17岁的高中生。没错就是那种你还在背四级单词的年纪人家已经在给Transformer这栋住了快十年的老房子动地基了。3月16日月之暗面Moonshot AI的Kimi团队悄悄把《Attention Residuals》丢上了arXiv论文编号2603.15031。 没 flashy 的 demo 视频也没炒作的发布会纯粹就是一行行公式和冷冰冰的 benchmark 数据。但明眼人一看就懂这东西要是普及了以后训大模型的电费账单能直接打七五折。残差连接Transformer的祖传地基出了问题要理解这次突破有多狠得先回到2017年。那时候Transformer刚出来靠着Attention is All You Need这句口号干翻了RNN。但很多人忘了让Transformer能叠到几百层而不崩的其实是残差连接Residual Connection这个老功臣。简单说残差连接就是个复制粘贴机制。每一层算完后直接把输出加到原来的输入上公式写成 h h f(h)。这玩意就像玩传话游戏时每个人不光听上家的话手里还攥着最原始的那张纸条。这样就算传到第100个人信息也不会彻底失真。但问题是这个纸条传法太死板了。传统残差连接对待前面所有层都一视同仁就像公司开会时把所有人意见不分轻重全写进纪要结果文档越堆越厚关键声音反而被稀释了。Kimi团队在论文里管这叫PreNorm稀释——模型越深每层贡献的信号就越被淹没最后变成一堆数字噪声。更扎心的是这种全员平票的累加方式让隐藏状态像吹气球一样膨胀内存占用跟层数成正比O(Ld)。你想堆个100层的深网络显存先给你表演一个OOM报错。注意力残差给每层装上智能筛选器Kimi团队的解法特别优雅甚至带着点哲学味——既然注意力机制能在序列维度时间上让token互相看来看去那为什么不能在同一维度深度上让层与层之间也搞个对视呢这就是Attention Residuals注意力残差的核心把深度方向当成另一个序列维度用softmax注意力替代固定的加法累加。想象一下以前每层都是闭着眼睛把前面所有层的输出囫囵吞枣。现在呢每层都有个智能筛选器能回头看前面所有层然后打个分“第5层的语义特征对我有用给0.8权重第20层的语法分析对我这步没啥用给0.01权重。” 这样信息不是堆成山而是按需检索清爽多了。技术上他们给每层配了一个可学习的伪查询向量pseudo-query然后用这个向量去跟前面所有层的输出做注意力计算。公式看起来就是标准的 softmax(QK^T)V只不过Q是当前层的查询K和V是前面所有层的历史输出。这招最骚的地方在于它是个即插即用的替换件。你不用改Transformer的其他部分—— attention heads 照旧FFN层不动MoE路由也留着——直接把残差连接那块换掉就行。就像给老房子换了个智能门锁不用推倒重建。工程化落地Block AttnRes的分块秘籍但理论和落地之间差着十万八千里。如果每层都要 attend 前面所有层那内存复杂度还是O(Ld)而且层数越多越慢训个48B参数的模型能卡到你怀疑人生。Kimi团队的工程解法很接地气分块Block-wise。他们把所有层分成8个大块block块内还是传统的残差连接保证并行度块间才用注意力残差做聚合。这样一来内存直接降到O(Nd)其中N是块数远小于层数L。他们还搞了个两阶段推理的 trick第一阶段并行计算块间注意力第二阶段在块内逐层做在线softmax合并。这种流水线设计让GPU的利用率拉满通信开销被压缩到极低。说白了就是大事开小会大事开大会。块内是小组讨论快块间是跨组汇报省资源。最终在Kimi Linear 48B模型总参数48B激活3B训了1.4T tokens上验证训练效率直接提升25%——达到同样的loss水平只需要原来75%的算力或者说同样的算力能训出更好的模型。推理延迟只增加了不到2%基本可以忽略不计。这就像给车换了个更高效的引擎油耗降了25%但车速几乎没变。实战代码手把手教你替换残差连接光说不练假把式。虽然Kimi已经开源了完整实现GitHub: MoonshotAI/Attention-Residuals这里给大家抽出一个最简化的PyTorch版本展示核心逻辑importtorchimporttorch.nnasnnimporttorch.nn.functionalasFfromtypingimportList,TupleclassAttentionResidualBlock(nn.Module): 注意力残差的核心实现用深度方向的attention替代固定残差 适合插入到标准Transformer的层间 def__init__(self,dim:int,num_layers_in_block:int8):super().__init__()self.dimdim# 可学习的伪查询向量每层一个self.pseudo_queriesnn.Parameter(torch.randn(num_layers_in_block,dim)*0.01)# 输出投影self.out_projnn.Linear(dim,dim)defforward(self,current_layer_output:torch.Tensor,# [batch, seq, dim]historical_outputs:List[torch.Tensor],# 前面所有层的输出列表layer_idx:int)-torch.Tensor: Args: current_layer_output: 当前层的原始输出 historical_outputs: 前面各层缓存的输出 layer_idx: 当前层在block内的索引 ifnothistorical_outputs:# 第一层直接返回和标准残差一样returncurrent_layer_output# 堆叠历史输出: [num_layers, batch, seq, dim]past_statestorch.stack(historical_outputs,dim0)# 当前层的查询向量qself.pseudo_queries[layer_idx]# [dim]# 计算attention score: 查询与历史输出的相似度# 简化版直接点积实际论文会用更复杂的映射scorestorch.einsum(d,lbsd-lbs,q,past_states)# [layers, batch, seq]weightsF.softmax(scores,dim0)# 在深度维度做softmax# 加权聚合历史信息aggregatedtorch.einsum(lbs,lbsd-bsd,weights,past_states)# 残差连接当前输出 聚合的历史信息# 实际论文还会有更复杂的gating机制这里做简化展示returncurrent_layer_outputself.out_proj(aggregated)使用示例如何替换标准Transformer的残差classImprovedTransformerLayer(nn.Module):def__init__(self,dim:int,num_heads:int,block_size:int8):super().__init__()self.attnnn.MultiheadAttention(dim,num_heads)self.ffnnn.Sequential(nn.Linear(dim,4*dim),nn.GELU(),nn.Linear(4*dim,dim))self.attn_resAttentionResidualBlock(dim,block_size)self.norm1nn.LayerNorm(dim)self.norm2nn.LayerNorm(dim)defforward(self,x,history,layer_idx):# 标准Attentionxself.norm1(x)attn_out,_self.attn(x,x,x)# 关键替换这里不用简单的 x x attn_out# 而是用Attention Residual聚合历史xself.attn_res(attn_out,history,layer_idx)# FFN部分同理ffn_outself.ffn(self.norm2(x))xself.attn_res(ffn_out,history[x],layer_idx)returnx注意实际生产环境中你需要配合在线softmax合并算法Online Softmax Merging来做两阶段计算不然显存还是顶不住。完整实现建议直接参考Kimi官方GitHub。25%效率提升意味着什么可能你觉得25%看起来不多但算算账就知道这数字有多恐怖。现在训一个70B参数的稠密模型大概需要几千万美元的算力。如果用Attention Residuals同样的预算能训出等效于90B参数模型的效果或者说训原来那个70B模型能省下25%的电费和时间。更关键的是这招解决了模型越深越难训的魔咒。以前堆层数就像叠罗汉叠高了必然摇晃现在每层都能智能筛选前面层的信息百层网络的信息传递反而更清晰。Kimi Linear 48B在GPQA-Diamond科学推理基准上直接涨了7.5分HumanEval代码生成涨了3.1分这些可都是实打实的能力提升。OpenAI前研究副总裁Jerry Tworek看完论文直接说Deep Learning 2.0 is coming。虽然有点夸张但想想也是——从2015年ResNet到现在残差连接十年没变过现在终于被撼动了。不是终结而是开始当然这论文也不是万能药。Attention Residuals需要从零开始训练你没法直接给已有的LLM打个补丁就生效。而且它对超参数很敏感那个辅助loss的系数要是调不好专家容易 collapse虽然这里不是MoE但类似的梯度问题依然存在。另外ByteDance和华中科大在同一天还发了另一篇论文《Mixture-of-Depths Attention》MoDA解决的是同一个问题但路数完全不同。南京大学也有相关理论分析跟进。这说明改造残差连接已经成了2026年开年的技术共识各家都在抢这个山头。站在应用层面如果你现在用Kimi K2.5其实已经在享受Attention Residuals的红利了——这个架构已经实装在Kimi Linear模型里。而对于其他开源模型Hugging Face上已经有第三方复现kyegomez/attn_res虽然没官方优化得那么极致但跑个demo完全够用。写在最后高中生都能改架构你还在怕什么每次看到这样的论文我都有种恍惚感。17岁的陈广宇从黑客松起步进Kimi团队然后一作发顶会级工作——这种履历放在五年前根本不敢想。但开源社区和AI工具的普惠让技术门槛真的在降低。Attention Residuals的故事告诉我们哪怕是被数十万人引用、奉为圭臬的标准设计也可能藏着显而易见的效率黑洞。只需要换个角度——把深度当时间把累加当attention——就能撬動25%的性能提升。下次当你看着自己的训练任务因为OOM报错而崩溃或者看着电费账单发愁时不妨想想是不是该给模型换个更聪明的记忆方式了毕竟连马斯克都点赞的东西大概率错不了。目前国内还是很缺AI人才的希望更多人能真正加入到AI行业共同促进行业进步增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow教程通俗易懂高中生都能看懂还有各种段子风趣幽默从深度学习基础原理到各领域实战应用都有讲解我22年的AI积累全在里面了。注意教程仅限真正想入门AI的朋友否则看看零散的博文就够了。