奖励模型的类型①生成式奖励模型先输出一段文本来分析response好不好再给出一个分数②判别式奖励模型输入query和response只输出一个分数《Qwen3技术报告》架构图Qwen3训练流程Thinking Control整合 thinking 和 non-thinking 两种不同的模式使用户能够灵活选择模型是否进行推理并通过指定思考的 token 预算来控制思考深度。Thinking BudgetThinking Mode Fusion 的一个额外优势是一旦模型学会了以 non-thinking 和 thinking 两种模式进行回应就自然发展出处理中间情况的能力——基于不完整的思考生成 response。为实现对模型思考过程的预算控制提供基础。当模型思考长度达到用户定义的阈值时手动停止思考过程并人为插入停止思考指令“Considering the limited time by the user, I have to give the solution based on the thinking directly now.\n/think.\n\n“。模型会基于此时积累的推理生成最终 response。这一能力没有经过明确训练而是应用 thinking mode fusion 后自然出现的。其他去掉了share-export。BBPE分词。把2.5中的QKVBias改成了QKNorm。DeepSeek-GRM论文论文《Inference-Time Scaling for Generalist Reward Modeling》背景解决RHLF时在没有明确标准答案的“泛化领域”如何更有效地生成高质量奖励信号解决方案这篇论文旨在提升大模型在无明确标准问题中的打分能力提出了一种能“自我总结评分标准”的奖励模型训练方法SPCT并通过推理阶段多次采样 投票/过滤机制实现了不扩大模型规模也能提升表现的“推理时间可扩展性”。Qwen3的Reranker背景BGE-Reranker 采用Cross-Encoder结构Qwen3的Reranker采用Decoder架构图中第三种模式-LLM。reranker实现流程把system_prmptquery和doc是否相关、query、doc拼接到一起进行预测取出输出最后一层中的yes和no的logtis对这两个词进行logSoftmax。然后只对“yes”进行e指数运算得到最终的相关性得到属于为“yes”的概率。《Seed-Thinking-v1.5》三个优化方向①SFT数据②RL使用VAPO和DAPO③RL 推理框架VAPO字节的Seed概述对PPO的改进一种Pair-wise PPO。生成式RM只输出yes或者no这样在训练模型的时候只计算yes和no的交叉熵。把reward模型的训练变成了一个SFT的过程。这里面需要人为的标注yes还是no。但会引入一个 ”颠倒同一个对好坏样本的前后位置输出yes和no的概率应该相等“ 的MSE加到原有交叉熵loss上。直接打分输出一个标量的RM。DAPOdynamic Sample GRPOdapo 对GRPO的工程改进在预填充阶段模型需要处理较长的 Token 序列其核心操作是通用矩阵乘法GEMM。权重-激活量化Weight-Activation Quantization它通过将权重和激活值同时转换为低精度表示大幅提升了计算效率和硬件利用率。在解码阶段大语言模型在每个生成步骤中仅处理一个词元其核心操作为通用矩阵-向量乘法GEMV现有方法集中于对权重进行量化以加速内存访问和减少带宽需求。这种方法称为仅权重量化Weight-Only Quantization。”仅权重量化流程“自适应CoT三家厂商对比参考资料MinmaxLightning Attention1、为什么原始Attention计算时间复杂度是n^2d。其中Q、K、V每个矩阵的维度都是[n, d]即[序列长度,隐层维度]此时Q*K_t结果维度是[n,n]通常 ≫其中d是固定大小随着序列长度平方增加就主导了整体的复杂度。所以整体复杂度是O(n^2*d)。2、注意力计算可抽象成一个Q和K的任何相似度函数而且不一定非要softmax但是需要保证相似度结果是正数。3、如何把attention的时间复杂度改成nd^2。也整体复杂度变成了O(nd^2)随着序列长度n线性增长此时就是线性注意力了。4、在Casual LM遇到的问题矩阵M是哈达马运算它不适用于矩阵乘法交换律和结合律所以应用Mask后输出就变成了。这样的累加操作无法进行高效的矩阵乘法虽然计算复杂度降低了但实际运算的效率并不高。5、如何解决“累加操作无法进行高效的矩阵乘法虽然计算复杂度降低了但实际运算的效率并不高。”总结最终的输出来自“块内”“块间”两部分求和块内的循环来实现mask块间的直接点乘当前KV的结果因为上一个块一直在当前块的前面全部可见。参考资料https://zhuanlan.zhihu.com/p/25198754173GSPOGroup Sequence Policy Optimization背景GRPO的优化目标用sequence_level计算和reward目标不符token_level,所以把重要性采样从token level改成seq_level改成了所有token的重要性采样的几何平均.没有Routing replay的grpo会崩溃reward会降低。把token_level的重要性采样改成了sequence_levelGSPO比GRPO触发clip的占比要高但是效果更好。Qwen的28定律为什么高熵的词在CoT中很重要示例问题“what is 11 in base 2?回答”in dicimal 112,Buthow do that translate to base 2”理解这些虚词泛词引导着推理的流程。token的熵当所有token概率相等此时熵最大。当有一两个概率特别大的时候此时熵很小。《MiMo-V2-Flash》混合注意力机制sliding-window attention:global attention sink比例为5:1MTP使用3个head训练和加速推理。预训练三个阶段每个阶段数据不一一样并逐步拉长上下文32k-256k。后训练①SFT②训练多个领域专家模型 ③用多个专家的reverse-KL来提供token-level的奖励。AttentionSink现象第一个Token通常是 |endoftext| 或 s在语义上没有任何实际意义它依然会获得极高的注意力分数q*k。原因由于要做softmax当token“无事可做”时需要发logtis放到一个token上因为不能模型token概率都趋向相等需要熵减其他自适应快慢思考推理模型Adaptive Reasoning ModelQwen3混合思考-字节AdaCoT-清华AdaThinking_哔哩哔哩_bilibili
Qwen3技术报告、DAPO、自适应Thinking
奖励模型的类型①生成式奖励模型先输出一段文本来分析response好不好再给出一个分数②判别式奖励模型输入query和response只输出一个分数《Qwen3技术报告》架构图Qwen3训练流程Thinking Control整合 thinking 和 non-thinking 两种不同的模式使用户能够灵活选择模型是否进行推理并通过指定思考的 token 预算来控制思考深度。Thinking BudgetThinking Mode Fusion 的一个额外优势是一旦模型学会了以 non-thinking 和 thinking 两种模式进行回应就自然发展出处理中间情况的能力——基于不完整的思考生成 response。为实现对模型思考过程的预算控制提供基础。当模型思考长度达到用户定义的阈值时手动停止思考过程并人为插入停止思考指令“Considering the limited time by the user, I have to give the solution based on the thinking directly now.\n/think.\n\n“。模型会基于此时积累的推理生成最终 response。这一能力没有经过明确训练而是应用 thinking mode fusion 后自然出现的。其他去掉了share-export。BBPE分词。把2.5中的QKVBias改成了QKNorm。DeepSeek-GRM论文论文《Inference-Time Scaling for Generalist Reward Modeling》背景解决RHLF时在没有明确标准答案的“泛化领域”如何更有效地生成高质量奖励信号解决方案这篇论文旨在提升大模型在无明确标准问题中的打分能力提出了一种能“自我总结评分标准”的奖励模型训练方法SPCT并通过推理阶段多次采样 投票/过滤机制实现了不扩大模型规模也能提升表现的“推理时间可扩展性”。Qwen3的Reranker背景BGE-Reranker 采用Cross-Encoder结构Qwen3的Reranker采用Decoder架构图中第三种模式-LLM。reranker实现流程把system_prmptquery和doc是否相关、query、doc拼接到一起进行预测取出输出最后一层中的yes和no的logtis对这两个词进行logSoftmax。然后只对“yes”进行e指数运算得到最终的相关性得到属于为“yes”的概率。《Seed-Thinking-v1.5》三个优化方向①SFT数据②RL使用VAPO和DAPO③RL 推理框架VAPO字节的Seed概述对PPO的改进一种Pair-wise PPO。生成式RM只输出yes或者no这样在训练模型的时候只计算yes和no的交叉熵。把reward模型的训练变成了一个SFT的过程。这里面需要人为的标注yes还是no。但会引入一个 ”颠倒同一个对好坏样本的前后位置输出yes和no的概率应该相等“ 的MSE加到原有交叉熵loss上。直接打分输出一个标量的RM。DAPOdynamic Sample GRPOdapo 对GRPO的工程改进在预填充阶段模型需要处理较长的 Token 序列其核心操作是通用矩阵乘法GEMM。权重-激活量化Weight-Activation Quantization它通过将权重和激活值同时转换为低精度表示大幅提升了计算效率和硬件利用率。在解码阶段大语言模型在每个生成步骤中仅处理一个词元其核心操作为通用矩阵-向量乘法GEMV现有方法集中于对权重进行量化以加速内存访问和减少带宽需求。这种方法称为仅权重量化Weight-Only Quantization。”仅权重量化流程“自适应CoT三家厂商对比参考资料MinmaxLightning Attention1、为什么原始Attention计算时间复杂度是n^2d。其中Q、K、V每个矩阵的维度都是[n, d]即[序列长度,隐层维度]此时Q*K_t结果维度是[n,n]通常 ≫其中d是固定大小随着序列长度平方增加就主导了整体的复杂度。所以整体复杂度是O(n^2*d)。2、注意力计算可抽象成一个Q和K的任何相似度函数而且不一定非要softmax但是需要保证相似度结果是正数。3、如何把attention的时间复杂度改成nd^2。也整体复杂度变成了O(nd^2)随着序列长度n线性增长此时就是线性注意力了。4、在Casual LM遇到的问题矩阵M是哈达马运算它不适用于矩阵乘法交换律和结合律所以应用Mask后输出就变成了。这样的累加操作无法进行高效的矩阵乘法虽然计算复杂度降低了但实际运算的效率并不高。5、如何解决“累加操作无法进行高效的矩阵乘法虽然计算复杂度降低了但实际运算的效率并不高。”总结最终的输出来自“块内”“块间”两部分求和块内的循环来实现mask块间的直接点乘当前KV的结果因为上一个块一直在当前块的前面全部可见。参考资料https://zhuanlan.zhihu.com/p/25198754173GSPOGroup Sequence Policy Optimization背景GRPO的优化目标用sequence_level计算和reward目标不符token_level,所以把重要性采样从token level改成seq_level改成了所有token的重要性采样的几何平均.没有Routing replay的grpo会崩溃reward会降低。把token_level的重要性采样改成了sequence_levelGSPO比GRPO触发clip的占比要高但是效果更好。Qwen的28定律为什么高熵的词在CoT中很重要示例问题“what is 11 in base 2?回答”in dicimal 112,Buthow do that translate to base 2”理解这些虚词泛词引导着推理的流程。token的熵当所有token概率相等此时熵最大。当有一两个概率特别大的时候此时熵很小。《MiMo-V2-Flash》混合注意力机制sliding-window attention:global attention sink比例为5:1MTP使用3个head训练和加速推理。预训练三个阶段每个阶段数据不一一样并逐步拉长上下文32k-256k。后训练①SFT②训练多个领域专家模型 ③用多个专家的reverse-KL来提供token-level的奖励。AttentionSink现象第一个Token通常是 |endoftext| 或 s在语义上没有任何实际意义它依然会获得极高的注意力分数q*k。原因由于要做softmax当token“无事可做”时需要发logtis放到一个token上因为不能模型token概率都趋向相等需要熵减其他自适应快慢思考推理模型Adaptive Reasoning ModelQwen3混合思考-字节AdaCoT-清华AdaThinking_哔哩哔哩_bilibili