开篇跳出碎片化知识点读懂LLM迭代的核心逻辑做LLM技术调研和模型落地久了我最大的感触是很多人学大模型都陷入了一个误区沉迷于零散的新技术名词却抓不住架构迭代的主线。今天是GQA明天是MLA后天又是MoE、DSA各类技术迭代层出不穷看得人眼花缭乱最终只会越学越乱。其实苏轼的“八面受敌”读书法放在LLM架构学习上同样适用。海量的模型论文、技术文档如同汪洋大海人的精力有限不可能一次性吃透所有知识点最好的方式就是定向深耕每次聚焦一个核心维度。当下市面上的主流开源大模型Llama、Qwen、GLM、Deepseek看似各有特色、参数设计各不相同但底层骨架高度统一。从2023年Llama奠定现代开源LLM基础架构到2026年GLM5.2、Deepseek系列模型登顶性能榜单这三年的技术迭代从来不是彻底推翻旧架构的颠覆式革新而是一场围绕算力、显存、推理速度、模型能力的精细化效率革命。很多人疑惑为什么新模型推理更强、编码更稳、智能体适配更好核心架构却没有大变答案很简单现代LLM的核心瓶颈早已不是“模型结构不够先进”而是如何在可控的训练和推理成本下最大化模型的语义理解、长文本建模和逻辑推理能力。本文就带着这条核心主线顺着一个token从输入模型到输出结果的完整链路逐层拆解现代LLM的所有核心组件。同时串联各大主流模型的差异化设计讲清楚MHA、GQA、MLA、Sparse Attention、SwiGLU、MoE等所有核心技术的迭代逻辑帮你彻底打通LLM架构的知识体系告别碎片化学习。宏观俯瞰现代LLM的通用骨架与三年迭代脉络想要快速建立全局认知必须从起点开始也就是2023年发布的Llama系列模型。它是现代开源LLM的基石后续几乎所有主流模型的架构设计都是在Llama基础上做的增量优化。Llama采用标准的Decoder-only Transformer架构整套运行逻辑非常清晰。原始文本经过分词、嵌入编码后送入多层Transformer模块通过注意力机制捕捉文本上下文关联借助前馈网络挖掘语义特征最终输出下一个token的概率分布完成文本生成。时隔三年我们拿出最新的GLM5.2、Deepseek-V3.2、Qwen3等顶尖模型对比会发现整套基础流转逻辑完全没变。没有颠覆式的架构重构所有升级都集中在两个核心方向一是优化注意力机制降低KV Cache显存占用、削减长序列计算开销二是引入MoE稀疏架构实现模型容量与推理速度的解耦。具体来看GLM5.2用DSA稀疏注意力MLA多头潜在注意力替换了传统GQA彻底解决了长文本推理的显存和算力双重瓶颈。Deepseek系列则深耕MoE细粒度专家机制让超大参数模型实现了轻量化推理。Qwen系列则在分词器、归一化、MTP多token预测等细节上持续打磨兼顾通用能力和落地性价比。这也是所有LLM迭代的核心共识所有架构优化的终极目标都是缩短有效训练时间、降低推理成本、提升收敛效率。行业内做模型实验的从业者都清楚评判一项技术改进是否有效loss下降的token量级没有参考意义真正的核心指标是时间。只要能在更短的训练、推理时间内拿到更低的loss、更好的效果就是有价值的优化。接下来我们顺着一个token的完整生命周期从输入层到输出层逐层拆解所有核心组件的设计逻辑和迭代细节。第一层输入Tokenizer与Embedding模型认知文本的第一道关口大模型本质上是数学模型无法直接识别文字、符号所有人类语言都必须转化为高维向量才能被模型计算。而这个转化的第一步就是Tokenizer分词第二步是Embedding嵌入编码。这两个基础模块直接决定模型的文本理解精度、训推效率和跨语言能力。主流分词算法BBPE成为LLM标配目前Llama、Qwen、GLM、Deepseek所有主流LLM核心分词算法均为Byte-level BPEBBPE是经典BPE算法的优化变种。传统BPE的核心逻辑很朴素从最小的字符单元出发不断合并文本中高频相邻字符对迭代压缩词表直到达到预设的词表规模。而BBPE直接以UTF-8单字节为最小单元初始词表固定为256个字节这一设计带来了一个核心优势彻底杜绝OOV未登录词问题。无论生僻字、特殊符号、小语种文本都能通过字节拆分实现编码对多语言场景极其友好。两大工程实现SentencePiece与tiktoken的取舍算法之外工程实现直接影响分词速度和效果目前行业主流只用两个工具库分别是Google的SentencePiece和OpenAI的tiktoken二者的适配场景差异非常明确。SentencePiece是全能型工具支持BPE、Unigram等多种分词算法最大特点是不依赖预分词处理直接将空格作为普通字符编码原生适配中文、日文等无空格分词的语言。国内Qwen、GLM等主打多语言能力的模型大多基于SentencePiece训练词表。tiktoken则是极致性能工具专门针对BBPE算法做Rust底层优化推理速度远超SentencePiece。它会先通过正则表达式对文本分块单词、数字、标点分开处理BPE合并操作不会跨块干扰分词精度更高。但它的训练效率偏低因此很多团队都会用Hugging Face Tokenizers训练词表再转换成tiktoken格式用于推理兼顾训练便捷性和推理高性能。Tokenizer优劣的核心评判指标很多人忽略分词器的重要性实则劣质分词器会直接拉低模型效果、提升使用成本。行业内主要用两个指标评判分词器质量。第一个是Fertility代表单个自然词汇平均拆分的token数量。英文优质分词的Fertility普遍在1.0到1.5之间拆分精度极高。而适配较差的分词器中文词汇可能被拆分成4到6个token不仅增加计算量还会割裂文本语义影响模型理解。第二个是Parity跨语言对等性针对多语言场景至关重要。同一语义的多语言平行文本若不同语言的token数量差异过大就代表parity较差。最直观的体验就是同等字数的中文内容token数量远高于英文用户调用API的成本会成倍增加这也是很多国产模型优化分词器的核心方向。完成分词得到token序列后Embedding层会将每个离散token映射为固定维度的高维向量包含基础语义信息这就是token进入模型后的初始状态也是后续所有计算的基础。基础支撑层归一化与残差连接深层模型训练的基石在进入核心的注意力和前馈网络计算前有两个贯穿所有Transformer层的基础组件归一化和残差连接。它们不直接参与语义特征提取却是深层LLM能够稳定训练、不出现梯度消失爆炸的核心保障。现代LLM的训练稳定性迭代基本都集中在这两个组件的细节优化上。从LayerNorm到RMSNorm减法式高效优化早期Transformer全部使用LayerNorm归一化核心作用是将每层输入的激活值约束在均值0、方差1的稳定分布区间避免多层叠加后激活值偏移失控保证每层网络输入分布稳定。LayerNorm的计算逻辑完整且严谨但存在冗余开销。它需要遍历向量两次第一次计算均值第二次计算方差整体计算成本较高。2019年业界提出核心猜想归一化的核心作用是缩放激活值幅度而非均值归零均值抵消的操作对模型性能几乎无增益却浪费了大量算力。基于这个猜想诞生的RMSNorm直接移除了均值计算仅通过均方根值对输入向量做缩放归一化。大幅削减计算量的同时模型精度几乎无损失。目前Llama3、Qwen、GLM、Deepseek等所有主流LLM已全部用RMSNorm替代传统LayerNorm成为行业通用标准。Pre-Norm与Post-Norm位置决定训练稳定性归一化层和残差连接的搭配方式分为Post-Norm和Pre-Norm两种这是决定深层模型训练成败的关键细节。原始Transformer采用Post-Norm设计将归一化层放在注意力、FFN模块的残差连接之后。这种设计的优势是每一层的输出分布都足够稳定下游网络接收的信号干净规整。但致命缺陷集中在反向传播阶段深层网络的梯度需要逐层穿过数十个LayerNorm的雅可比矩阵微小的数值偏差会层层累积极易引发梯度消失或爆炸必须依赖复杂的学习率预热策略才能勉强训练。而现代LLM统一采用的Pre-Norm设计将归一化层前置在注意力和FFN模块之前。这种结构最大的优势是保留了完整的残差恒等映射梯度回传时存在一条无损直通路径无论子网络的参数如何变化梯度都能稳定传递到底层完美解决了深层网络的训练发散问题。Pre-Norm会存在轻微的激活值幅值累积问题但通过模型最后一层的最终归一化和合理的参数初始化完全可以抵消该问题。用微小的激活值波动换取深层模型的训练稳定性是绝对划算的技术取舍这也是如今Pre-Norm全面普及的核心原因。核心计算层注意力机制的三代迭代只为极致降本增效注意力机制是LLM捕捉上下文语义关联的核心也是模型算力和显存消耗的最大模块。近三年LLM的注意力迭代主线极其清晰从单纯追求精度的MHA到平衡显存与精度的GQA再到极致压缩显存的MLA最后搭配DSA稀疏注意力突破长序列算力瓶颈每一次迭代都是精准解决落地痛点。读懂KV CacheLLM推理加速的核心秘密想要理解注意力机制的迭代逻辑首先必须吃透KV Cache这是所有推理优化的基础。LLM的推理分为Prefill预填充和Decode解码两个完全不同的阶段。Prefill阶段是模型首次接收用户完整prompt会一次性并行计算整段序列的Q、K、V矩阵完成全量上下文注意力计算同时将每一层的K、V矩阵缓存到显存中最后输出第一个生成token。这个阶段是典型的矩阵乘法计算算力密集属于计算受限场景。Decode阶段是逐token生成阶段从第二个输出token开始模型每次仅接收一个新token只需计算新token的Q向量与显存中缓存的历史K、V向量做注意力交互即可生成下一个token。如果没有KV Cache每生成一个token都要重新计算全部历史序列的K、V向量计算复杂度会达到恐怖的O(L²)长文本推理完全无法落地。KV Cache的核心逻辑就是用显存空间换取推理速度复用历史计算结果将逐token生成的矩阵计算简化为向量计算大幅降低推理开销。但KV Cache带来了新的瓶颈超长上下文场景下256K、1M的序列长度会让缓存的KV数据量爆炸既占用海量显存还会造成频繁的显存数据搬运GPU显存带宽成为推理新瓶颈。后续所有注意力机制优化基本都是围绕压缩KV Cache、减少数据搬运、降低计算量展开。MHA、GQA、MQAKV Cache的轻量化迭代之路标准多头注意力MHA是早期LLM的标配每个注意力头都拥有独立的K、V投影矩阵。多头设计让模型可以从不同维度捕捉上下文特征但对应的KV Cache体量极大显存占用居高不下。为解决这个问题业界首先提出MQA多查询注意力让所有查询头共享唯一一组K、V头。这种方案极致压缩了KV Cache显存占用降到最低但过度压缩导致模型特征表达能力大幅衰减生成质量明显下降无法商用落地。GQA分组查询注意力则是完美的折中方案也是目前绝大多数主流模型的默认配置。它将查询头分为若干组每组查询头共享一组独立的K、V头。以32头查询、8组GQA为例KV头数量从32个降至8个KV Cache直接缩减4倍显存占用大幅降低同时模型语义表达能力几乎无损耗。Llama3、Qwen系列均采用GQA架构平衡了性能与落地成本。MLA多头潜在注意力Deepseek开创的全新优化路径GQA的优化逻辑是减少KV头数量而Deepseek-V2提出的MLA多头潜在注意力开辟了全新的优化思路不减少注意力头数量而是从数据维度压缩KV Cache。MLA的核心设计是低维潜在空间压缩将原始高维K、V向量压缩为低维隐向量推理时仅缓存这份压缩后的向量需要计算注意力时再解压还原。这种方式可以极致缩减KV Cache的显存占用尤其适配超长序列场景。同时MLA引入解耦RoPE设计彻底解决位置编码与内容编码的冲突问题。模型单独设置一组专属向量承载位置信息并施加旋转编码压缩后的KV向量纯粹保留文本语义内容实现位置信息与内容信息的解耦既保证了长文本位置感知精度又最大化压缩了显存开销。目前GLM5.2、Deepseek全系新模型均采用MLA架构是当下最优的KV缓存优化方案之一。DSA稀疏注意力打破长序列O(L²)算力瓶颈MLA解决了KV Cache的显存占用问题但没有改变注意力O(L²)的计算复杂度。当序列长度达到十万、百万级别时即便显存足够海量的注意力计算也会让推理速度断崖式下跌算力成为新的核心瓶颈。Deepseek-V3.2推出的DSA稀疏注意力正是为解决这一问题而生。传统滑动窗口注意力仅能匹配固定窗口内的上下文会丢失长距离关键语义而DSA实现了细粒度、动态的上下文筛选。它由Lighting Indexer轻量索引器和精准token筛选机制两大核心模块组成。Lighting Indexer采用少量注意力头、FP8低精度计算算力开销极低能够快速为每一个历史token计算相关性得分。完成打分后模型仅筛选出得分最高的Top-K核心token参与正式注意力计算摒弃大量无关冗余token。通过这种动态筛选DSA将注意力计算复杂度从O(L²)降至O(L·K)K为固定的超参远小于序列长度L在几乎不损失长文本理解能力的前提下大幅削减长序列推理算力开销完美适配超长文档解析、长文本Agent任务。配套优化QK-Norm与Flash Attention的工程加持除了注意力架构迭代两项通用工程优化进一步提升了模型稳定性和速度目前已成为所有主流LLM的标配。QK-Norm诞生于超大规模模型训练的稳定性问题超大模型训练时Q、K向量内积极易出现数值爆炸导致softmax输出趋近于独热分布注意力权重失效训练loss出现NaN。QK-Norm通过对Q、K向量做归一化约束稳定注意力分数分布彻底解决了超大模型的训练不稳定问题现在主流模型均改用RMSNorm版本的QK-Norm兼顾稳定性和速度。Flash Attention则是基于GPU硬件特性的IO优化算法数学逻辑与标准注意力完全一致但通过分块读写、在线softmax更新的思路规避了GPU高速SRAM与低速HBM显存之间的频繁数据搬运。它不会生成完整的N×N注意力矩阵所有计算都在片上高速内存中完成大幅降低IO开销实现数倍的推理和训练加速是现代LLM高效运行的底层基础。特征交互层FFN前馈网络的迭代SwiGLU成为绝对主流注意力机制负责捕捉token之间的上下文关联而FFN前馈网络负责对提取的语义特征做非线性变换挖掘深层语义信息是模型表达能力的核心载体同时也是模型参数的主要组成部分。早期GPT系列模型采用传统双线性MLP结构搭配GELU激活函数存在计算量大、非线性表达能力弱的问题。目前所有主流LLM已全面升级为SwiGLU结构完成了精度与速度的双重升级。激活函数迭代Swish替代GELU的性价比革命GELU激活函数依赖误差函数erf计算需要复杂的多项式逼近计算开销极大。而Swish激活函数用轻量化的sigmoid函数替代erf计算成本大幅降低同时模型精度几乎无衰减。对于大规模LLM而言海量的训练和推理迭代中这种微小的单步速度提升会累积成巨大的工程收益因此迅速成为行业标配。结构升级GLU门控机制强化特征交互相比激活函数的替换GLU门控结构的升级对模型能力的提升更为关键。传统双层MLP仅有扩展维度、压缩维度两次线性变换特征交互方式单一非线性能力有限。SwiGLU引入三路投影结构分别为gate门控分支、up升维分支、down降维分支。计算逻辑简洁高效先通过gate分支生成权重系数经过Swish激活后与up分支的特征向量逐元素相乘实现特征的选择性筛选和交互最后通过down分支压缩维度输出。门控机制让模型具备了条件计算能力可以自主筛选有效语义特征、抑制无效噪声大幅提升模型的语义挖掘能力。同时工程上可以通过调整中间层维度精准控制参数量在不增加计算负担的前提下显著提升模型表达上限这也是SwiGLU全面替代传统MLP的核心原因。输出增强与训练优化LM Head与MTP多token预测经过多层注意力和FFN的特征迭代后模型会通过最终归一化层梳理特征再经由输出模块完成token预测同时搭配MTP多token预测技术强化训练效果。LM Head从特征向量到概率分布的最后一步LM Head是模型的输出层本质是一层线性变换负责将Transformer输出的高维语义向量映射为词表维度的logits向量再通过softmax函数转化为每个候选token的生成概率分布。模型最终会基于这份概率分布解码输出文本内容。这里有一个关键的模型设计取舍小模型3B及以下通常会共享Embedding层和LM Head的参数大幅压缩参数量、降低训练成本。而Llama、Qwen、GLM等大参数量模型都会选择参数解耦牺牲少量参数成本换取更强的特征表达能力和生成精度。同时模型的解码策略直接影响生成效果主流解码方式各有适配场景。贪心解码速度最快直接选择概率最高的token适合简单场景束搜索保留多条候选序列输出更规整Top-K、Top-P采样搭配温度系数调节可以平衡生成的随机性和流畅度适配创意写作、对话交互等复杂场景。MTP多token预测用密集监督提升模型认知能力传统自回归LLM的训练模式存在明显短板每个token仅监督预测下一个位置的token训练信号稀疏数据利用率低模型只能关注即时上下文缺乏长程规划能力。MTP多token预测彻底改变了这一模式训练阶段让每个token同时预测未来多个位置的token大幅提升单样本的训练信号密度让模型从同等训练数据中学习更多语义规律。同时强制模型基于当前上下文预判未来语义倒逼模型学习长文本结构特征强化全局规划能力显著提升长文本生成和逻辑推理效果。值得注意的是MTP仅作用于训练阶段推理时可以直接移除对应模块不影响主模型结构。同时该模块还可作为轻量草稿模型用于投机解码加速一次前向传播生成多个候选token再由主模型批量验证无损提升推理速度实现训练、推理双向增益。稀疏架构革命MoE混合专家模型解开容量与速度的死结稠密模型的发展存在无法突破的天花板模型参数量越大单token推理计算量越高速度越慢算力成本呈指数级增长。而MoE混合专家架构的出现彻底解开了模型容量与推理速度的绑定关系成为当前超大模型的主流架构Deepseek、GLM、Llama4均深度落地该技术。MoE核心逻辑稀疏激活大参数、小计算传统稠密模型中每一个token都会完整遍历所有FFN参数参数量直接决定计算量。而MoE架构的核心改造就是将单一的FFN层替换为数十、上百个并行的轻量化FFN也就是所谓的专家模块同时新增路由路由器。模型训练和推理时路由器会根据每个token的语义特征动态筛选出最匹配的少量专家进行计算其余专家全部休眠。这就实现了模型总参数量极大但单token激活参数量极小的效果用极低的推理算力成本享受超大参数模型的能力增益。各大模型的MoE层布局各有差异Deepseek-V3.2采用前层稠密、后层MoE的设计底层网络专注学习通用基础语义上层网络通过稀疏专家分化细分知识贴合人类语言认知规律。Llama4则采用稠密层与MoE层交替排布的方式兼顾特征稳定性和知识多样性两种方案各有优劣。专家粒度迭代从粗放到精细提升知识专精度早期MoE模型仅设置8到16个粗粒度专家每个专家需要承载大量不同类型的语义知识知识混杂严重出现样样都会、样样不精的问题无法精准匹配细分语义场景。后续业界提出细粒度专家优化方案将单个大尺寸专家拆分为大量小尺寸专家保持模型总参数量和总计算量不变大幅提升专家数量。比如将16个大专家拆解为64个小专家同时将单token激活专家数量同比例提升。这种迭代带来的增益极其显著细分后的小专家可以专注学习单一细分领域的知识专精度大幅提升。同时专家组合数量呈爆炸式增长模型可以根据不同token的语义需求灵活组合专属专家精准适配各类复杂语义场景大幅提升模型的泛化能力。共享专家消除参数冗余提升学习效率MoE稀疏激活的模式存在天然短板通用语义知识需要被频繁调用若所有专家都是动态路由多个专家会重复学习同一套通用知识造成严重的参数冗余和算力浪费。共享专家机制完美解决了这个问题模型会固定划分出一部分共享专家所有token无论语义特征如何都会无条件经过共享专家计算专门负责承载语法规则、基础语义、通用常识等共性知识。剩余的路由专家则专注学习细分、小众、专业化的知识无需重复学习基础内容。共享专家细粒度路由专家的组合架构实现了通用知识与专属知识的解耦极大提升了参数利用效率让稀疏模型的知识体系更清晰、更精准是当前MoE模型的标准配置。负载均衡解决路由坍塌让MoE发挥全部实力MoE训练最大的难题就是负载不均衡也就是路由坍塌。训练初期部分专家随机获得更多训练样本参数迭代更优路由器会持续将更多token分配给这些热门专家冷门专家长期闲置、参数停滞最终大量专家失效模型退化为小型稠密模型浪费海量参数资源。为解决这个问题业界形成了一套完整的负载均衡体系。首先是三级辅助损失约束体系分工明确、层层兜底。专家级均衡损失聚焦微观层面约束每个专家接收的token数量避免个别专家垄断算力杜绝路由坍塌。设备级均衡损失聚焦宏观算力在分布式训练场景下均衡不同GPU设备的计算负载避免单设备过载、其余设备闲置提升整体训练效率。通信均衡损失聚焦网络传输约束分布式设备的收发数据量解决All-to-All通信的带宽瓶颈避免网络通信成为训练短板。但辅助损失存在天然矛盾损失权重过大会强行干预自然路由规律违背数据本身的分布特征损害模型精度。权重过小又无法有效均衡负载。为此业界推出了无辅助损失方案通过为每个专家设置动态偏置项实时统计批次负载自动调整专家准入门槛。过载专家提高门槛、减少token分配欠载专家降低门槛、增加样本输入全程不干预专家权重计算在保证负载均衡的同时彻底保留模型原生精度上限。除此之外Token Drop机制作为兜底策略会为每个专家设置最大处理容量超出负载的低适配token会被直接丢弃仅通过残差连接传递特征保证训练过程的稳定性。目前主流模型已通过精细化的无辅助损失均衡策略逐步替代传统Token Drop规避信息丢失和训推不一致的问题。结语看透LLM迭代的本质把握技术发展主线通读完整套LLM架构链路我们可以清晰总结出近三年大模型技术迭代的核心本质没有花哨的颠覆式创新所有优化都围绕效率最大化展开。从Tokenizer的分词精度优化到归一化、残差连接的稳定性打磨从注意力机制层层迭代压缩显存、降低算力到SwiGLU强化特征表达再到MoE稀疏架构解耦容量与速度。Llama奠定了现代LLM的基础骨架Qwen在通用细节上持续精进GLM深耕推理与Agent能力适配Deepseek突破注意力和MoE的工程极限。各大模型的差异化优势本质都是核心架构组件的取舍与优化。
吃透主流LLM模型架构,从Llama到Deepseek,拆解大模型迭代的底层逻辑
开篇跳出碎片化知识点读懂LLM迭代的核心逻辑做LLM技术调研和模型落地久了我最大的感触是很多人学大模型都陷入了一个误区沉迷于零散的新技术名词却抓不住架构迭代的主线。今天是GQA明天是MLA后天又是MoE、DSA各类技术迭代层出不穷看得人眼花缭乱最终只会越学越乱。其实苏轼的“八面受敌”读书法放在LLM架构学习上同样适用。海量的模型论文、技术文档如同汪洋大海人的精力有限不可能一次性吃透所有知识点最好的方式就是定向深耕每次聚焦一个核心维度。当下市面上的主流开源大模型Llama、Qwen、GLM、Deepseek看似各有特色、参数设计各不相同但底层骨架高度统一。从2023年Llama奠定现代开源LLM基础架构到2026年GLM5.2、Deepseek系列模型登顶性能榜单这三年的技术迭代从来不是彻底推翻旧架构的颠覆式革新而是一场围绕算力、显存、推理速度、模型能力的精细化效率革命。很多人疑惑为什么新模型推理更强、编码更稳、智能体适配更好核心架构却没有大变答案很简单现代LLM的核心瓶颈早已不是“模型结构不够先进”而是如何在可控的训练和推理成本下最大化模型的语义理解、长文本建模和逻辑推理能力。本文就带着这条核心主线顺着一个token从输入模型到输出结果的完整链路逐层拆解现代LLM的所有核心组件。同时串联各大主流模型的差异化设计讲清楚MHA、GQA、MLA、Sparse Attention、SwiGLU、MoE等所有核心技术的迭代逻辑帮你彻底打通LLM架构的知识体系告别碎片化学习。宏观俯瞰现代LLM的通用骨架与三年迭代脉络想要快速建立全局认知必须从起点开始也就是2023年发布的Llama系列模型。它是现代开源LLM的基石后续几乎所有主流模型的架构设计都是在Llama基础上做的增量优化。Llama采用标准的Decoder-only Transformer架构整套运行逻辑非常清晰。原始文本经过分词、嵌入编码后送入多层Transformer模块通过注意力机制捕捉文本上下文关联借助前馈网络挖掘语义特征最终输出下一个token的概率分布完成文本生成。时隔三年我们拿出最新的GLM5.2、Deepseek-V3.2、Qwen3等顶尖模型对比会发现整套基础流转逻辑完全没变。没有颠覆式的架构重构所有升级都集中在两个核心方向一是优化注意力机制降低KV Cache显存占用、削减长序列计算开销二是引入MoE稀疏架构实现模型容量与推理速度的解耦。具体来看GLM5.2用DSA稀疏注意力MLA多头潜在注意力替换了传统GQA彻底解决了长文本推理的显存和算力双重瓶颈。Deepseek系列则深耕MoE细粒度专家机制让超大参数模型实现了轻量化推理。Qwen系列则在分词器、归一化、MTP多token预测等细节上持续打磨兼顾通用能力和落地性价比。这也是所有LLM迭代的核心共识所有架构优化的终极目标都是缩短有效训练时间、降低推理成本、提升收敛效率。行业内做模型实验的从业者都清楚评判一项技术改进是否有效loss下降的token量级没有参考意义真正的核心指标是时间。只要能在更短的训练、推理时间内拿到更低的loss、更好的效果就是有价值的优化。接下来我们顺着一个token的完整生命周期从输入层到输出层逐层拆解所有核心组件的设计逻辑和迭代细节。第一层输入Tokenizer与Embedding模型认知文本的第一道关口大模型本质上是数学模型无法直接识别文字、符号所有人类语言都必须转化为高维向量才能被模型计算。而这个转化的第一步就是Tokenizer分词第二步是Embedding嵌入编码。这两个基础模块直接决定模型的文本理解精度、训推效率和跨语言能力。主流分词算法BBPE成为LLM标配目前Llama、Qwen、GLM、Deepseek所有主流LLM核心分词算法均为Byte-level BPEBBPE是经典BPE算法的优化变种。传统BPE的核心逻辑很朴素从最小的字符单元出发不断合并文本中高频相邻字符对迭代压缩词表直到达到预设的词表规模。而BBPE直接以UTF-8单字节为最小单元初始词表固定为256个字节这一设计带来了一个核心优势彻底杜绝OOV未登录词问题。无论生僻字、特殊符号、小语种文本都能通过字节拆分实现编码对多语言场景极其友好。两大工程实现SentencePiece与tiktoken的取舍算法之外工程实现直接影响分词速度和效果目前行业主流只用两个工具库分别是Google的SentencePiece和OpenAI的tiktoken二者的适配场景差异非常明确。SentencePiece是全能型工具支持BPE、Unigram等多种分词算法最大特点是不依赖预分词处理直接将空格作为普通字符编码原生适配中文、日文等无空格分词的语言。国内Qwen、GLM等主打多语言能力的模型大多基于SentencePiece训练词表。tiktoken则是极致性能工具专门针对BBPE算法做Rust底层优化推理速度远超SentencePiece。它会先通过正则表达式对文本分块单词、数字、标点分开处理BPE合并操作不会跨块干扰分词精度更高。但它的训练效率偏低因此很多团队都会用Hugging Face Tokenizers训练词表再转换成tiktoken格式用于推理兼顾训练便捷性和推理高性能。Tokenizer优劣的核心评判指标很多人忽略分词器的重要性实则劣质分词器会直接拉低模型效果、提升使用成本。行业内主要用两个指标评判分词器质量。第一个是Fertility代表单个自然词汇平均拆分的token数量。英文优质分词的Fertility普遍在1.0到1.5之间拆分精度极高。而适配较差的分词器中文词汇可能被拆分成4到6个token不仅增加计算量还会割裂文本语义影响模型理解。第二个是Parity跨语言对等性针对多语言场景至关重要。同一语义的多语言平行文本若不同语言的token数量差异过大就代表parity较差。最直观的体验就是同等字数的中文内容token数量远高于英文用户调用API的成本会成倍增加这也是很多国产模型优化分词器的核心方向。完成分词得到token序列后Embedding层会将每个离散token映射为固定维度的高维向量包含基础语义信息这就是token进入模型后的初始状态也是后续所有计算的基础。基础支撑层归一化与残差连接深层模型训练的基石在进入核心的注意力和前馈网络计算前有两个贯穿所有Transformer层的基础组件归一化和残差连接。它们不直接参与语义特征提取却是深层LLM能够稳定训练、不出现梯度消失爆炸的核心保障。现代LLM的训练稳定性迭代基本都集中在这两个组件的细节优化上。从LayerNorm到RMSNorm减法式高效优化早期Transformer全部使用LayerNorm归一化核心作用是将每层输入的激活值约束在均值0、方差1的稳定分布区间避免多层叠加后激活值偏移失控保证每层网络输入分布稳定。LayerNorm的计算逻辑完整且严谨但存在冗余开销。它需要遍历向量两次第一次计算均值第二次计算方差整体计算成本较高。2019年业界提出核心猜想归一化的核心作用是缩放激活值幅度而非均值归零均值抵消的操作对模型性能几乎无增益却浪费了大量算力。基于这个猜想诞生的RMSNorm直接移除了均值计算仅通过均方根值对输入向量做缩放归一化。大幅削减计算量的同时模型精度几乎无损失。目前Llama3、Qwen、GLM、Deepseek等所有主流LLM已全部用RMSNorm替代传统LayerNorm成为行业通用标准。Pre-Norm与Post-Norm位置决定训练稳定性归一化层和残差连接的搭配方式分为Post-Norm和Pre-Norm两种这是决定深层模型训练成败的关键细节。原始Transformer采用Post-Norm设计将归一化层放在注意力、FFN模块的残差连接之后。这种设计的优势是每一层的输出分布都足够稳定下游网络接收的信号干净规整。但致命缺陷集中在反向传播阶段深层网络的梯度需要逐层穿过数十个LayerNorm的雅可比矩阵微小的数值偏差会层层累积极易引发梯度消失或爆炸必须依赖复杂的学习率预热策略才能勉强训练。而现代LLM统一采用的Pre-Norm设计将归一化层前置在注意力和FFN模块之前。这种结构最大的优势是保留了完整的残差恒等映射梯度回传时存在一条无损直通路径无论子网络的参数如何变化梯度都能稳定传递到底层完美解决了深层网络的训练发散问题。Pre-Norm会存在轻微的激活值幅值累积问题但通过模型最后一层的最终归一化和合理的参数初始化完全可以抵消该问题。用微小的激活值波动换取深层模型的训练稳定性是绝对划算的技术取舍这也是如今Pre-Norm全面普及的核心原因。核心计算层注意力机制的三代迭代只为极致降本增效注意力机制是LLM捕捉上下文语义关联的核心也是模型算力和显存消耗的最大模块。近三年LLM的注意力迭代主线极其清晰从单纯追求精度的MHA到平衡显存与精度的GQA再到极致压缩显存的MLA最后搭配DSA稀疏注意力突破长序列算力瓶颈每一次迭代都是精准解决落地痛点。读懂KV CacheLLM推理加速的核心秘密想要理解注意力机制的迭代逻辑首先必须吃透KV Cache这是所有推理优化的基础。LLM的推理分为Prefill预填充和Decode解码两个完全不同的阶段。Prefill阶段是模型首次接收用户完整prompt会一次性并行计算整段序列的Q、K、V矩阵完成全量上下文注意力计算同时将每一层的K、V矩阵缓存到显存中最后输出第一个生成token。这个阶段是典型的矩阵乘法计算算力密集属于计算受限场景。Decode阶段是逐token生成阶段从第二个输出token开始模型每次仅接收一个新token只需计算新token的Q向量与显存中缓存的历史K、V向量做注意力交互即可生成下一个token。如果没有KV Cache每生成一个token都要重新计算全部历史序列的K、V向量计算复杂度会达到恐怖的O(L²)长文本推理完全无法落地。KV Cache的核心逻辑就是用显存空间换取推理速度复用历史计算结果将逐token生成的矩阵计算简化为向量计算大幅降低推理开销。但KV Cache带来了新的瓶颈超长上下文场景下256K、1M的序列长度会让缓存的KV数据量爆炸既占用海量显存还会造成频繁的显存数据搬运GPU显存带宽成为推理新瓶颈。后续所有注意力机制优化基本都是围绕压缩KV Cache、减少数据搬运、降低计算量展开。MHA、GQA、MQAKV Cache的轻量化迭代之路标准多头注意力MHA是早期LLM的标配每个注意力头都拥有独立的K、V投影矩阵。多头设计让模型可以从不同维度捕捉上下文特征但对应的KV Cache体量极大显存占用居高不下。为解决这个问题业界首先提出MQA多查询注意力让所有查询头共享唯一一组K、V头。这种方案极致压缩了KV Cache显存占用降到最低但过度压缩导致模型特征表达能力大幅衰减生成质量明显下降无法商用落地。GQA分组查询注意力则是完美的折中方案也是目前绝大多数主流模型的默认配置。它将查询头分为若干组每组查询头共享一组独立的K、V头。以32头查询、8组GQA为例KV头数量从32个降至8个KV Cache直接缩减4倍显存占用大幅降低同时模型语义表达能力几乎无损耗。Llama3、Qwen系列均采用GQA架构平衡了性能与落地成本。MLA多头潜在注意力Deepseek开创的全新优化路径GQA的优化逻辑是减少KV头数量而Deepseek-V2提出的MLA多头潜在注意力开辟了全新的优化思路不减少注意力头数量而是从数据维度压缩KV Cache。MLA的核心设计是低维潜在空间压缩将原始高维K、V向量压缩为低维隐向量推理时仅缓存这份压缩后的向量需要计算注意力时再解压还原。这种方式可以极致缩减KV Cache的显存占用尤其适配超长序列场景。同时MLA引入解耦RoPE设计彻底解决位置编码与内容编码的冲突问题。模型单独设置一组专属向量承载位置信息并施加旋转编码压缩后的KV向量纯粹保留文本语义内容实现位置信息与内容信息的解耦既保证了长文本位置感知精度又最大化压缩了显存开销。目前GLM5.2、Deepseek全系新模型均采用MLA架构是当下最优的KV缓存优化方案之一。DSA稀疏注意力打破长序列O(L²)算力瓶颈MLA解决了KV Cache的显存占用问题但没有改变注意力O(L²)的计算复杂度。当序列长度达到十万、百万级别时即便显存足够海量的注意力计算也会让推理速度断崖式下跌算力成为新的核心瓶颈。Deepseek-V3.2推出的DSA稀疏注意力正是为解决这一问题而生。传统滑动窗口注意力仅能匹配固定窗口内的上下文会丢失长距离关键语义而DSA实现了细粒度、动态的上下文筛选。它由Lighting Indexer轻量索引器和精准token筛选机制两大核心模块组成。Lighting Indexer采用少量注意力头、FP8低精度计算算力开销极低能够快速为每一个历史token计算相关性得分。完成打分后模型仅筛选出得分最高的Top-K核心token参与正式注意力计算摒弃大量无关冗余token。通过这种动态筛选DSA将注意力计算复杂度从O(L²)降至O(L·K)K为固定的超参远小于序列长度L在几乎不损失长文本理解能力的前提下大幅削减长序列推理算力开销完美适配超长文档解析、长文本Agent任务。配套优化QK-Norm与Flash Attention的工程加持除了注意力架构迭代两项通用工程优化进一步提升了模型稳定性和速度目前已成为所有主流LLM的标配。QK-Norm诞生于超大规模模型训练的稳定性问题超大模型训练时Q、K向量内积极易出现数值爆炸导致softmax输出趋近于独热分布注意力权重失效训练loss出现NaN。QK-Norm通过对Q、K向量做归一化约束稳定注意力分数分布彻底解决了超大模型的训练不稳定问题现在主流模型均改用RMSNorm版本的QK-Norm兼顾稳定性和速度。Flash Attention则是基于GPU硬件特性的IO优化算法数学逻辑与标准注意力完全一致但通过分块读写、在线softmax更新的思路规避了GPU高速SRAM与低速HBM显存之间的频繁数据搬运。它不会生成完整的N×N注意力矩阵所有计算都在片上高速内存中完成大幅降低IO开销实现数倍的推理和训练加速是现代LLM高效运行的底层基础。特征交互层FFN前馈网络的迭代SwiGLU成为绝对主流注意力机制负责捕捉token之间的上下文关联而FFN前馈网络负责对提取的语义特征做非线性变换挖掘深层语义信息是模型表达能力的核心载体同时也是模型参数的主要组成部分。早期GPT系列模型采用传统双线性MLP结构搭配GELU激活函数存在计算量大、非线性表达能力弱的问题。目前所有主流LLM已全面升级为SwiGLU结构完成了精度与速度的双重升级。激活函数迭代Swish替代GELU的性价比革命GELU激活函数依赖误差函数erf计算需要复杂的多项式逼近计算开销极大。而Swish激活函数用轻量化的sigmoid函数替代erf计算成本大幅降低同时模型精度几乎无衰减。对于大规模LLM而言海量的训练和推理迭代中这种微小的单步速度提升会累积成巨大的工程收益因此迅速成为行业标配。结构升级GLU门控机制强化特征交互相比激活函数的替换GLU门控结构的升级对模型能力的提升更为关键。传统双层MLP仅有扩展维度、压缩维度两次线性变换特征交互方式单一非线性能力有限。SwiGLU引入三路投影结构分别为gate门控分支、up升维分支、down降维分支。计算逻辑简洁高效先通过gate分支生成权重系数经过Swish激活后与up分支的特征向量逐元素相乘实现特征的选择性筛选和交互最后通过down分支压缩维度输出。门控机制让模型具备了条件计算能力可以自主筛选有效语义特征、抑制无效噪声大幅提升模型的语义挖掘能力。同时工程上可以通过调整中间层维度精准控制参数量在不增加计算负担的前提下显著提升模型表达上限这也是SwiGLU全面替代传统MLP的核心原因。输出增强与训练优化LM Head与MTP多token预测经过多层注意力和FFN的特征迭代后模型会通过最终归一化层梳理特征再经由输出模块完成token预测同时搭配MTP多token预测技术强化训练效果。LM Head从特征向量到概率分布的最后一步LM Head是模型的输出层本质是一层线性变换负责将Transformer输出的高维语义向量映射为词表维度的logits向量再通过softmax函数转化为每个候选token的生成概率分布。模型最终会基于这份概率分布解码输出文本内容。这里有一个关键的模型设计取舍小模型3B及以下通常会共享Embedding层和LM Head的参数大幅压缩参数量、降低训练成本。而Llama、Qwen、GLM等大参数量模型都会选择参数解耦牺牲少量参数成本换取更强的特征表达能力和生成精度。同时模型的解码策略直接影响生成效果主流解码方式各有适配场景。贪心解码速度最快直接选择概率最高的token适合简单场景束搜索保留多条候选序列输出更规整Top-K、Top-P采样搭配温度系数调节可以平衡生成的随机性和流畅度适配创意写作、对话交互等复杂场景。MTP多token预测用密集监督提升模型认知能力传统自回归LLM的训练模式存在明显短板每个token仅监督预测下一个位置的token训练信号稀疏数据利用率低模型只能关注即时上下文缺乏长程规划能力。MTP多token预测彻底改变了这一模式训练阶段让每个token同时预测未来多个位置的token大幅提升单样本的训练信号密度让模型从同等训练数据中学习更多语义规律。同时强制模型基于当前上下文预判未来语义倒逼模型学习长文本结构特征强化全局规划能力显著提升长文本生成和逻辑推理效果。值得注意的是MTP仅作用于训练阶段推理时可以直接移除对应模块不影响主模型结构。同时该模块还可作为轻量草稿模型用于投机解码加速一次前向传播生成多个候选token再由主模型批量验证无损提升推理速度实现训练、推理双向增益。稀疏架构革命MoE混合专家模型解开容量与速度的死结稠密模型的发展存在无法突破的天花板模型参数量越大单token推理计算量越高速度越慢算力成本呈指数级增长。而MoE混合专家架构的出现彻底解开了模型容量与推理速度的绑定关系成为当前超大模型的主流架构Deepseek、GLM、Llama4均深度落地该技术。MoE核心逻辑稀疏激活大参数、小计算传统稠密模型中每一个token都会完整遍历所有FFN参数参数量直接决定计算量。而MoE架构的核心改造就是将单一的FFN层替换为数十、上百个并行的轻量化FFN也就是所谓的专家模块同时新增路由路由器。模型训练和推理时路由器会根据每个token的语义特征动态筛选出最匹配的少量专家进行计算其余专家全部休眠。这就实现了模型总参数量极大但单token激活参数量极小的效果用极低的推理算力成本享受超大参数模型的能力增益。各大模型的MoE层布局各有差异Deepseek-V3.2采用前层稠密、后层MoE的设计底层网络专注学习通用基础语义上层网络通过稀疏专家分化细分知识贴合人类语言认知规律。Llama4则采用稠密层与MoE层交替排布的方式兼顾特征稳定性和知识多样性两种方案各有优劣。专家粒度迭代从粗放到精细提升知识专精度早期MoE模型仅设置8到16个粗粒度专家每个专家需要承载大量不同类型的语义知识知识混杂严重出现样样都会、样样不精的问题无法精准匹配细分语义场景。后续业界提出细粒度专家优化方案将单个大尺寸专家拆分为大量小尺寸专家保持模型总参数量和总计算量不变大幅提升专家数量。比如将16个大专家拆解为64个小专家同时将单token激活专家数量同比例提升。这种迭代带来的增益极其显著细分后的小专家可以专注学习单一细分领域的知识专精度大幅提升。同时专家组合数量呈爆炸式增长模型可以根据不同token的语义需求灵活组合专属专家精准适配各类复杂语义场景大幅提升模型的泛化能力。共享专家消除参数冗余提升学习效率MoE稀疏激活的模式存在天然短板通用语义知识需要被频繁调用若所有专家都是动态路由多个专家会重复学习同一套通用知识造成严重的参数冗余和算力浪费。共享专家机制完美解决了这个问题模型会固定划分出一部分共享专家所有token无论语义特征如何都会无条件经过共享专家计算专门负责承载语法规则、基础语义、通用常识等共性知识。剩余的路由专家则专注学习细分、小众、专业化的知识无需重复学习基础内容。共享专家细粒度路由专家的组合架构实现了通用知识与专属知识的解耦极大提升了参数利用效率让稀疏模型的知识体系更清晰、更精准是当前MoE模型的标准配置。负载均衡解决路由坍塌让MoE发挥全部实力MoE训练最大的难题就是负载不均衡也就是路由坍塌。训练初期部分专家随机获得更多训练样本参数迭代更优路由器会持续将更多token分配给这些热门专家冷门专家长期闲置、参数停滞最终大量专家失效模型退化为小型稠密模型浪费海量参数资源。为解决这个问题业界形成了一套完整的负载均衡体系。首先是三级辅助损失约束体系分工明确、层层兜底。专家级均衡损失聚焦微观层面约束每个专家接收的token数量避免个别专家垄断算力杜绝路由坍塌。设备级均衡损失聚焦宏观算力在分布式训练场景下均衡不同GPU设备的计算负载避免单设备过载、其余设备闲置提升整体训练效率。通信均衡损失聚焦网络传输约束分布式设备的收发数据量解决All-to-All通信的带宽瓶颈避免网络通信成为训练短板。但辅助损失存在天然矛盾损失权重过大会强行干预自然路由规律违背数据本身的分布特征损害模型精度。权重过小又无法有效均衡负载。为此业界推出了无辅助损失方案通过为每个专家设置动态偏置项实时统计批次负载自动调整专家准入门槛。过载专家提高门槛、减少token分配欠载专家降低门槛、增加样本输入全程不干预专家权重计算在保证负载均衡的同时彻底保留模型原生精度上限。除此之外Token Drop机制作为兜底策略会为每个专家设置最大处理容量超出负载的低适配token会被直接丢弃仅通过残差连接传递特征保证训练过程的稳定性。目前主流模型已通过精细化的无辅助损失均衡策略逐步替代传统Token Drop规避信息丢失和训推不一致的问题。结语看透LLM迭代的本质把握技术发展主线通读完整套LLM架构链路我们可以清晰总结出近三年大模型技术迭代的核心本质没有花哨的颠覆式创新所有优化都围绕效率最大化展开。从Tokenizer的分词精度优化到归一化、残差连接的稳定性打磨从注意力机制层层迭代压缩显存、降低算力到SwiGLU强化特征表达再到MoE稀疏架构解耦容量与速度。Llama奠定了现代LLM的基础骨架Qwen在通用细节上持续精进GLM深耕推理与Agent能力适配Deepseek突破注意力和MoE的工程极限。各大模型的差异化优势本质都是核心架构组件的取舍与优化。