[人工智能]LLM算法:架构、训练与推理综述

[人工智能]LLM算法:架构、训练与推理综述 LLM算法架构、训练与推理综述本文面向工程实践视角对大语言模型Large Language Model, LLM相关算法进行概览性总结涵盖Transformer架构、预训练与微调流程、对齐与偏好优化方法以及推理与部署中的常见技术手段。文中示例图表为示意性质不针对任何具体厂商实现可作为从业者的参考资料。图1不同规模Transformer类LLM的参数量单位十亿示意。图2预训练过程中损失随训练步数变化的示意曲线。图3Transformer网络中各层注意力头数量分布示意。阶段目标典型算法/方法说明数据采集与清洗构建大规模通用或垂直语料库。去重、规则过滤、质量打分与采样。数据质量直接决定模型能力和风险。无监督预训练学习通用语言与统计模式。因果语言模型下一个token、掩码LM、序列到序列目标。计算量最大多为自监督学习阶段。有监督微调对齐具体任务和指令风格。基于交叉熵的指令/对话数据微调。使模型更善于遵循提示、调用工具等。偏好对齐与RLHF使模型行为更符合人类偏好与安全要求。RLHFPPO、DPO、IPO、KTO等偏好优化方法。提升有用性、降低有害和偏置输出。表1LLM典型训练与对齐流程。组成模块主要功能关键超参数备注分词/编码将文本或字节映射为离散token编号。词表大小、BPE/Unigram/WordPiece等类型。影响序列长度、稀有词处理能力。嵌入层为token和位置学习稠密向量表示。嵌入维度、位置编码方式。常与输出投影共享权重以减少参数。多头注意力在上下文中建模长程依赖和信息交互。每层头数、键/查询维度、注意力类型。包括因果、滑动窗口、稀疏注意力等变体。前馈网络对每个token进行非线性变换。隐藏层维度、激活函数GEGLU/SwiGLU/ReLU。在许多LLM中占据大部分参数量。层归一化与残差稳定训练、支持深层网络。前归一化/后归一化、epsilon、是否使用bias。大规模训练中多采用前归一化结构。表2Transformer架构中的核心组成模块。推理/生成技术目的关键参数典型场景贪心/束搜索寻找高概率的输出序列。束宽、长度惩罚。机器翻译、摘要等需要稳定输出的任务。采样top-k、核采样通过随机采样提高多样性。k、p、温度。创意写作、头脑风暴、代码补全等。检索增强生成RAG在外部文档基础上进行回答与生成。检索模型类型、上下文长度、重排序策略。问答、知识助手、企业搜索等。工具/Agent调用让模型编排工具、API和多步工作流。动作空间、规划步长、安全约束。复杂任务自动化、智能助手、运维编排等。表3LLM常用推理与生成技术示例。1. LLM架构概览当前主流LLM大多基于Transformer架构尤其是只包含解码器的因果语言模型结构通过自回归方式逐token生成输出。模型堆叠多层自注意力与前馈网络利用残差连接与归一化实现深层网络的稳定训练。架构设计涉及层数、隐藏维度、注意力头数、前馈层维度、激活函数以及归一化方式等超参数。为兼顾质量与效率业界也提出了如MoE专家混合、稀疏注意力、轻量化解码器等多种变体并在多语言、多模态和代码场景中不断演进。2. 分词与输入表示在进入神经网络之前文本需要通过分词/编码映射为token序列。常见做法是使用子词单元如BPE、Unigram、WordPiece在词表大小、序列长度和跨语言能力之间折中。部分模型直接在字节或字符层面进行建模以简化多语言支持和应对未登录词。输入表示通常由token嵌入和位置编码共同组成。绝对位置编码正弦或可学习、相对位置编码以及RoPE等方案会影响长上下文能力和顺序建模效果是近年研究与工程实践的热点方向之一。3. 预训练目标与优化算法LLM的核心训练目标通常是因果语言建模即在给定前文token的条件下预测下一个token。优化上多采用交叉熵损失配合AdamW等自适应优化器结合学习率预热、退火策略、梯度裁剪和权重衰减等技术保证大规模训练的稳定收敛。数据和课程设计同样关键例如不同语料来源的混合比例、序列长度的逐步提升以及后期对特定领域数据的加权等。混合精度训练、梯度检查点、数据/模型并行等技术在工程上是必不可少的使得在可行的时间和成本内完成万亿token级别的训练成为可能。4. 有监督微调与指令微调在基础预训练之后LLM通常会进行一轮或多轮有监督微调以增强任务完成能力和指令遵从性。训练目标仍然多为交叉熵损失但数据来源为精心构造的问答对、任务示例和对话数据等高质量语料。指令微调特别关注提示格式如system/user/assistant角色、few-shot示例以及链式推理、工具调用等能力的显式教导。对于资源受限或需要多变个性化场景可以采用LoRA、前缀微调、Adapter等参数高效微调方法只更新少量新增参数而保持基座模型冻结。5. RLHF与偏好优化仅靠有监督数据难以完全约束模型在开放环境中的行为因此广泛采用RLHF基于人类反馈的强化学习等方法进行对齐。典型流程包括收集人类偏好排序数据、训练奖励模型然后使用PPO等强化学习算法在保持与原模型分布不太偏离的前提下优化奖励。近年来出现的DPO、IPO等直接偏好优化方法则避免显式的RL过程直接从偏好对构造损失函数进行优化往往实现更简洁调参成本较低。这些方法有助于提升助手的有用性并抑制明显有害、偏见或幻觉式输出。6. 检索增强生成RAGRAG通过在推理阶段引入外部知识库缓解LLM参数内存储知识难以及时更新的问题。常见做法是使用向量检索从文档库中选取相关片段然后将检索结果与用户问题一起拼接为模型输入由LLM在此基础上进行回答。从算法角度看RAG将“知识存储”与“推理生成”解耦更新知识只需更新索引无需重新预训练大模型。具体设计包括文本切分策略、嵌入模型与检索算法的选择、重排序方法以及如何在Prompt中组织多个检索片段等。7. Agent化LLM与工具调用Agent化LLM允许模型在对话过程中自主决定何时调用外部工具如搜索引擎、代码执行环境、数据库或业务API等并基于工具返回结果继续推理。模型的输出不仅包含自然语言还包括结构化的“函数调用”信息环境执行后再把结果反馈给模型。从算法层面看这引入了一个围绕LLM调用和工具执行的规划循环。简单做法可通过ReAct等Prompt模式实现更复杂的方案会引入专门的规划器、记忆模块与安全策略。为避免滥用或错误操作需要对可用动作空间进行约束并对输入输出设置多层防护和审计机制。8. 推理阶段技术与性能优化在推理阶段解码策略决定了输出的确定性、多样性和质量。贪心与束搜索倾向于生成高概率但相对单一的结果而top-k、核采样和温度控制可以在可控范围内提高多样性。在安全敏感或对真实性要求较高的应用中需要谨慎选择采样参数。为降低延迟和成本实践中广泛采用量化、KV缓存、推测解码speculative decoding、小模型辅助大模型以及蒸馏等方法。这些技术既涉及算法设计也高度依赖于底层硬件与分布式系统架构。9. 评估、安全与未来方向LLM评估既包括困惑度、标准数据集准确率等客观指标也包括人工评价的有用性、事实性、公平性和安全性等维度。随着应用场景扩展针对具体任务和行业的评测基准与红队测试变得越来越重要没有单一指标可以完全刻画真实世界表现。面向未来算法研究的重点方向包括更高效和更稳健的训练方法如稀疏化、低秩分解、更强的长上下文与多模态能力、与符号推理和外部工具的更紧密结合以及在法律、伦理与技术约束下实现更可解释、更可验证的对齐机制。