大模型核心名词手册(完整版,分层整理,零基础可查)

大模型核心名词手册(完整版,分层整理,零基础可查) 目录一、基础通用概念二、模型训练全流程名词1. 预训练 Pretrain2. 微调 Fine-tune3. 训练配套名词三、推理 部署工程名词四、提示词 应用生态名词五、模型核心架构名词Transformer 体系六、评测、对齐与安全名词七、开源 主流模型系列名词八、行业衍生名词一、基础通用概念大语言模型 LLMLarge Language Model基于 Transformer 架构、海量文本数据训练能理解、生成人类自然语言的巨型神经网络核心是预测下一个文字。生成式 AIGenerative AIAI 自主创造全新内容文字、图片、音频、视频、代码区别于判别式 AI只做分类、识别。基础大模型Base Model / 基座模型仅用海量互联网文本预训练、未做指令对齐、无对话人设的原始大模型输出不可控、不适合直接聊天。对话大模型Chat Model基座模型经过微调、人类反馈优化适配问答、多轮对话场景如 ChatGPT、文心一言、通义千问。多模态大模型Multimodal LLM同时处理文本、图片、音频、视频、3D 等多种信号输入输出代表GPT-4V、Qwen-VL、Gemini。参数Parameter模型神经网络里可学习的权重数值单位 B十亿参数规模越大理论理解能力越强训练推理成本越高。权重Weights模型训练后保存的数值文件存储所有知识与逻辑是模型的 “记忆本体”。Token词元大模型最小计算单位文字会被切分为 token中文 1 汉字≈1.5~2token1token≈0.75 个汉字。上下文窗口 Context Window模型单次能读取、记忆的总 token 上限包含历史对话 当前提问窗口越大长文档处理能力越强。上下文长度 / 上下文扩容原生窗口较小的模型通过算法扩展可读取文本长度如 8K 扩至 32K、128K。嵌入 Embedding把文字、图片转为低维数字向量用于语义检索、知识库匹配、相似度计算。二、模型训练全流程名词1. 预训练 Pretrain预训练阶段第一阶段训练用全网通用无标注文本学习语法、常识、世界知识搭建基础语言能力。预训练数据书籍、网页、论文、代码等无标签原始语料数据规模、干净度直接决定基座上限。预训练损失标准自回归损失目标最大化文本出现概率。2. 微调 Fine-tune对已预训练基座做小规模数据二次训练分多种类型SFT 有监督微调Supervised Fine-Tuning人工标注高质量问答 / 对话数据教会模型遵循人类指令是对话模型必备步骤。RLHF 基于人类反馈的强化学习三段式优化SFT→奖励模型训练→强化学习 PPO让输出贴合人类偏好、价值观、安全规范。RLAIF AI 反馈强化学习用大模型替代人工打分生成奖励信号降低人工标注成本。LoRA 低秩自适应微调轻量化微调方案冻结主模型权重仅训练极小附加矩阵显存占用极低、适配本地部署。全参数微调 Full FT更新模型全部权重效果上限最高但算力、显存成本巨大。Prefix Tuning / Prompt Tuning冻结主模型仅训练少量前缀参数 / 软提示极轻量化微调方案。3. 训练配套名词算力卡GPU/TPU/NPU显卡 / 专用 AI 芯片负责模型训练、推理计算A100、H100、昇腾 910B 为主流。集群训练多 GPU 多机器分布式并行训练超大模型。语料清洗过滤色情、暴力、重复、低质、版权违规文本提升模型安全性与效果。数据去重剔除重复文本避免模型过拟合、记忆重复内容。分词器 Tokenizer负责把文字转 token、token 转回文字模型配套专属工具。Epoch 训练轮次完整跑完一遍全部训练数据为 1 轮多轮易过拟合。Batch 批次单次送入模型计算的数据条数越大训练速度越快、显存占用越高。学习率 Learning Rate权重更新幅度大模型训练用极小学习率。过拟合 Overfit模型死记训练数据陌生新问题表现大幅下滑。欠拟合 Underfit训练不足基础能力差训练集效果也很差。三、推理 部署工程名词推理 Inference模型训练完成后接收用户输入、生成回答的运行过程即线上服务阶段。推理速度 Tokens/s每秒生成 token 数量衡量接口、本地模型响应快慢。量化 Quantization压缩模型权重精度FP16→INT8/INT4/GGUF大幅降低显存占用、提速轻微损失效果。FP3232 位浮点数原始高精度FP16/BF16半精度主流训练格式INT8/INT4低比特量化本地部署常用GGUF / GGMLllama.cpp 开源轻量化模型存储格式专门适配 CPU 本地离线运行。KV 缓存 KV Cache推理加速核心技术缓存历史对话的注意力矩阵避免重复计算大幅提升长对话速度。流式输出 Stream逐字逐 token 实时返回回答前端打字机效果非流式为完整生成后一次性返回。API 应用程序接口厂商开放模型调用接口输入文本返回生成结果企业开发通用方式。私有化部署模型部署在企业本地服务器 / 私有云数据不出内网满足数据安全合规。本地离线部署电脑 / 单机显卡加载模型无需联网、不调用第三方 API。分布式推理超大模型拆分至多块显卡并行运行单卡无法承载时使用。负载均衡多台推理服务器分摊用户请求防止单机器过载。熔断限流请求量过高时限制访问保障服务稳定不崩溃。四、提示词 应用生态名词Prompt 提示词给大模型的输入指令包含问题、角色、格式、约束直接决定输出质量。System Prompt 系统提示词全局角色设定对话全程生效定义模型身份、规则、输出规范。Few-shot 少样本提示Prompt 中附带 2~5 个示例引导模型模仿固定格式输出。Zero-shot 零样本不给示例仅靠文字指令让模型完成任务。CoT 思维链Chain of Thought提示词引导模型分步推理先拆解逻辑再给答案数学、逻辑题效果显著提升。RAG 检索增强生成Retrieval-Augmented Generation核心落地架构先从私有知识库检索真实资料再把资料塞进 Prompt 给大模型回答解决幻觉、知识过时问题。知识库企业文档、PDF、数据库、本地资料集合向量库存储文本 Embedding 向量的数据库Chroma、Milvus、FAISS文本分块 Chunk长文档切割成小段用于向量检索Agent 智能体具备自主规划、工具调用、多步骤任务执行能力的大模型应用能联网、查数据库、调用代码、操作工具。工具调用 Tool Calling模型自主识别需求调用插件 / 外部接口规划 Planning复杂任务拆分为多步执行记忆 MemoryAgent 长期存储历史任务信息Function Calling 函数调用模型输出结构化 JSON 指令自动调用自定义工具、接口。插件 Plugin给大模型扩展外部能力联网搜索、计算、表格处理。微调数据集专门用于 SFT/RLHF 的标注问答对分通用、行业垂直两类。垂直行业大模型在通用基座基础上用行业专业数据微调适配医疗、法律、工业、金融等细分场景。五、模型核心架构名词Transformer 体系Transformer当前所有大模型统一基础架构2017 谷歌提出依靠自注意力机制实现长文本理解。自注意力 Self-Attention核心机制让文字之间互相计算关联权重理解上下文语义关系。多头注意力 Multi-Head Attention拆分多组注意力并行计算同时捕捉语法、逻辑、指代多种语义关系。编码器 Encoder双向注意力同时看前文后文多用于翻译、分类、嵌入模型BERT。解码器 Decoder单向自回归注意力只能读取上文、逐字生成下文LLM 主流架构GPT、Llama。Encoder-Decoder 架构编解码组合适合翻译、摘要T5、BART。层归一化 Layer Norm稳定训练数值分布解决深层网络梯度消失。前馈网络 FFN每层注意力后的非线性转换模块存储大部分知识。位置编码 Positional Encoding给 token 注入文字顺序信息Transformer 本身无时序感知能力。自回归生成 Autoregressive当前只依据上文预测下一个 token主流 LLM 生成逻辑。六、评测、对齐与安全名词对齐 Alignment通过 SFT、RLHF 让模型输出符合人类价值观、指令、安全规范分为能力对齐、价值对齐。幻觉 Hallucination模型编造不存在事实、虚假数据、文献RAG 是主流抑制方案。基准评测 Benchmark标准化试题集量化模型能力MMLU综合知识、GSM8K数学、HumanEval代码、C-Eval中文综合。困惑度 Perplexity PPL衡量模型文本流畅度数值越低语言逻辑越通顺。有害输出生成暴力、色情、谣言、歧视、违法内容依靠安全对齐、内容审核拦截。越狱 Prompt Jailbreak恶意提示词绕过安全限制诱导模型输出违规内容。可解释性 XAI分析模型注意力权重、激活值看懂模型判断逻辑。鲁棒性 Robustness输入错别字、混乱语句、恶意诱导时模型稳定不跑偏的能力。偏见 Bias训练数据自带性别、地域、职业刻板印象导致输出不公平结论。数据泄露训练语料包含隐私、用户原始数据模型会复述隐私信息。七、开源 主流模型系列名词LlamaMeta 开源基座系列全球最通用商用 / 本地模型Llama2、Llama3Qwen 通义千问阿里开源全系列多模态、长短上下文全覆盖GLM智谱 AI 开源模型GLM3/GLM4支持超长上下文Mistral欧洲轻量化高效模型小参数对标大模型效果GPTOpenAI 闭源系列GPT-3.5、GPT-4、GPT-4V 多模态GeminiGoogle 多模态原生大模型RWKV非 Transformer 架构纯 RNN极低显存占用llama.cpp开源本地推理框架支持 CPU/GPU 量化离线运行八、行业衍生名词AIGCAI 生成内容大模型落地应用统称MLOpsAI 模型全生命周期运维训练、评测、部署、监控迭代算力租赁按需租用 GPU 显卡用于训练 / 本地推理知识库问答基于 RAG 的企业落地场景数字人多模态大模型驱动虚拟形象语音、视频对话代码大模型 Code LLM专门优化代码生成、调试、解释CodeLlama、StarCoderAgent 智能体平台可视化搭建自动化 AI 任务流程模型蒸馏 Distillation用大模型输出训练小型模型小模型低成本复刻大模型能力