文章目录概述核心结果编码能力通用与视觉智能体1 引言2 模型架构2.1 混合注意力机制2.1.1 Kimi Delta注意力(KDA)2.1.2 门控MLA2.2 注意力残差(AttnRes)2.3 稳定潜空间混合专家(Stable LatentMoE)2.3.1 归一化潜空间MoE2.3.2 Sigmoid Tanh单元GLU(SiTU-GLU)2.3.3 分位数均衡(QB)2.4 原生视觉能力2.5 逐头Muon优化器3 预训练3.1 预训练数据3.2 缩放法则3.3 训练方案3.4 长上下文扩展4 训练后流程4.1 方法4.1.1 监督微调(SFT)4.1.2 强化学习4.1.3 多教师同策略蒸馏(MOPD)4.1.4 部署感知的训练后流程4.2 RL任务合成与智能体环境4.2.1 统一白盒RL环境4.2.2 知识图谱引导的任务合成4.2.3 智能体环境中的可验证问题4.2.4 内核优化任务4.2.5 个人助手任务4.2.6 自主执行任务4.2.7 网页开发任务5 基础设施5.1 KDA的算法-系统协同设计5.1.1 多场景KDA内核5.1.2 KDA上下文并行(KCP)5.2 3万亿级预训练基础设施5.2.1 完美均衡的专家并行MoE训练5.2.2 内存高效训练5.2.3 多模态编码器优化5.3 百万token智能体RL基础设施5.3.1 长上下文RL基础设施5.3.2 沙箱基础设施5.4 推理与在线服务5.4.1 KDA感知的前缀缓存管理5.4.2 高性能内核5.4.3 集群级调度6 评测6.1 核心结果6.1.1 基准测试集6.1.2 基线模型6.1.3 评测配置6.1.4 结果6.2 内部评测6.2.1 能力评测6.2.2 网络安全评测概述Kimi K3——一款总参数2.8万亿的混合专家(MoE)模型,单token激活参数为1040亿,具备原生视觉能力,支持100万token上下文窗口。Kimi K3 基于 Kimi Delta 注意力机制(KDA)[64]与注意力残差(AttnRes)[58]构建,优化了序列长度与模型深度维度的信息流动。结合稳定潜空间混合专家(Stable LatentMoE,每个token可从896个路由专家中有效激活16个),以及经过优化的训练与数据方案,这些技术进步让 Kimi K3 的整体缩放效率较 Kimi K2 [59]提升约2.5倍。训练后阶段的亮点在于通用、智能体与编码三大领域的强化学习,以及多档位推理算力支持,实现了组合泛化能力与稳定长时序执行能力。在2.8万亿参数规模下,Kimi K3 依托多领域基础设施突破落地:KDA的算法-系统协同设计、实现完美负载均衡的专家并行训练与高效内存管理、支持持久化推演与沙箱状态的百万token智能体强化学习,以及多项部署侧创新。全面评测显示,Kimi K3 在长时序编码、智能体、知识、推理与视觉任务上均达到前沿水平。尽管整体性能仍略逊于最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol,但在kimi团队的评测体系中,Kimi K3 持续优于其他所有开源与闭源模型。kimi团队已开放 Kimi K3 的完整模型权重,以推动后续研究,加速前沿智能技术的更广泛部署与应用。核心结果所有结果均采用最高推理算力档位:max 或 xhigh编码能力
2.8 万亿参数 Kimi K3 技术报告:MoE 架构、KDA 注意力与百万 Token 上下文全解析
文章目录概述核心结果编码能力通用与视觉智能体1 引言2 模型架构2.1 混合注意力机制2.1.1 Kimi Delta注意力(KDA)2.1.2 门控MLA2.2 注意力残差(AttnRes)2.3 稳定潜空间混合专家(Stable LatentMoE)2.3.1 归一化潜空间MoE2.3.2 Sigmoid Tanh单元GLU(SiTU-GLU)2.3.3 分位数均衡(QB)2.4 原生视觉能力2.5 逐头Muon优化器3 预训练3.1 预训练数据3.2 缩放法则3.3 训练方案3.4 长上下文扩展4 训练后流程4.1 方法4.1.1 监督微调(SFT)4.1.2 强化学习4.1.3 多教师同策略蒸馏(MOPD)4.1.4 部署感知的训练后流程4.2 RL任务合成与智能体环境4.2.1 统一白盒RL环境4.2.2 知识图谱引导的任务合成4.2.3 智能体环境中的可验证问题4.2.4 内核优化任务4.2.5 个人助手任务4.2.6 自主执行任务4.2.7 网页开发任务5 基础设施5.1 KDA的算法-系统协同设计5.1.1 多场景KDA内核5.1.2 KDA上下文并行(KCP)5.2 3万亿级预训练基础设施5.2.1 完美均衡的专家并行MoE训练5.2.2 内存高效训练5.2.3 多模态编码器优化5.3 百万token智能体RL基础设施5.3.1 长上下文RL基础设施5.3.2 沙箱基础设施5.4 推理与在线服务5.4.1 KDA感知的前缀缓存管理5.4.2 高性能内核5.4.3 集群级调度6 评测6.1 核心结果6.1.1 基准测试集6.1.2 基线模型6.1.3 评测配置6.1.4 结果6.2 内部评测6.2.1 能力评测6.2.2 网络安全评测概述Kimi K3——一款总参数2.8万亿的混合专家(MoE)模型,单token激活参数为1040亿,具备原生视觉能力,支持100万token上下文窗口。Kimi K3 基于 Kimi Delta 注意力机制(KDA)[64]与注意力残差(AttnRes)[58]构建,优化了序列长度与模型深度维度的信息流动。结合稳定潜空间混合专家(Stable LatentMoE,每个token可从896个路由专家中有效激活16个),以及经过优化的训练与数据方案,这些技术进步让 Kimi K3 的整体缩放效率较 Kimi K2 [59]提升约2.5倍。训练后阶段的亮点在于通用、智能体与编码三大领域的强化学习,以及多档位推理算力支持,实现了组合泛化能力与稳定长时序执行能力。在2.8万亿参数规模下,Kimi K3 依托多领域基础设施突破落地:KDA的算法-系统协同设计、实现完美负载均衡的专家并行训练与高效内存管理、支持持久化推演与沙箱状态的百万token智能体强化学习,以及多项部署侧创新。全面评测显示,Kimi K3 在长时序编码、智能体、知识、推理与视觉任务上均达到前沿水平。尽管整体性能仍略逊于最强闭源模型 Claude Fable 5 与 GPT-5.6 Sol,但在kimi团队的评测体系中,Kimi K3 持续优于其他所有开源与闭源模型。kimi团队已开放 Kimi K3 的完整模型权重,以推动后续研究,加速前沿智能技术的更广泛部署与应用。核心结果所有结果均采用最高推理算力档位:max 或 xhigh编码能力