Kimi K3 2.8万亿参数登顶全球代码榜——MoE第四极来了点点词元技术专栏 · 第37期上一篇第36期我们横评了国产开源MoE三强Qwen 3.7 Max、Kimi K2.7 Code、DeepSeek V4 Pro。当时Kimi K2系列还停在1T参数级别。不到一个月月之暗面直接甩出了K3——2.8万亿参数、Arena前端代码榜全球第一、完整权重即将开源。国产MoE的第四极来了。一、开场1679分国产模型首次登顶Frontend Code Arena2026年7月17日凌晨月之暗面Moonshot AI在WAIC 2026世界人工智能大会前夕正式发布新一代旗舰模型Kimi K3。发布不到24小时一组数据引爆了整个开发者社区排名模型Arena AI Code Arena 得分第1名Kimi K31679第2名Claude Fable 51631第3名GPT-5.6 Sol (xHigh)1618第4名GLM-5.21587第5名Claude Opus 4.81562这不是月之暗面自己出题、自己打分的内部评测。Arena AI的Frontend Code Arena采用匿名双盲对战投票机制——同一道任务交给两个匿名模型全球用户在真实体验两个结果后投票投票结束才揭晓模型身份。品牌影响被完全剥离结果更具含金量。Kimi K3在七个前端细分领域中拿下六个第一品牌营销、参考图还原、数据分析、消费产品、模拟仿真、内容创作工具。仅在游戏领域小幅落后Fable 5排名第二。从Kimi K2.6的第18名直接跳到第1名——17个名次的跃升累计获得约48万次投票支持。马斯克本人也在评论区留言Impressive令人印象深刻。Arena AI联合创始人兼CEO更是称其为可能是今年最重大的发布认为它动摇了OpenAI、Anthropic等美国闭源模型的主导地位。彭博社报道将此事件比作新的DeepSeek时刻。但Arena只是冰山一角。让我们把K3的核心参数表拉出来逐项拆解。二、核心规格2.8万亿参数的开源巨兽2.1 参数卡片属性数值总参数2.8万亿2.8T架构MoEStable LatentMoE专家配置896个专家每次推理激活16个上下文窗口100万token1,048,576最大输出默认131,072最高可达1,048,576多模态原生支持图像视频输入文本输出注意力机制KDAKimi Delta Attention混合线性注意力深层信息传递AttnResAttention Residuals注意力残差推理模式始终开启思考thinking always-on量化训练MXFP4权重 MXFP8激活量化感知训练开源状态完整权重2026年7月27日发布许可证Modified MIT推荐部署配置supernode≥64个加速器2.8万亿是什么概念在K3之前开源模型的参数上限由DeepSeek V4的1.6T保持。K3直接把这个上限抬到了近两倍——开源阵营首次具备了与闭源旗舰在规模天花板上正面竞争的能力。但参数大不等于能力强。关键在于这2.8万亿参数是怎么被驯服的。2.2 架构拆解两把钥匙驯服2.8TK3的架构基于两项自研核心技术分别解决两个维度的问题问题一100万token的上下文太长传统Attention算不动当上下文窗口拉到100万token时标准自注意力Self-Attention的计算量按序列长度的平方增长。每生成一个新token都要重新对所有历史token做注意力计算——这在百万级上下文下是不可承受之重。解法Kimi Delta AttentionKDA混合线性注意力KDA的核心思路是将长上下文拆解为已总结的历史和新来的变化Delta。对历史部分用线性方式维护一个紧凑的记忆状态新token只需要重点关注变化部分而不是重新计算全量注意力。通俗类比想象你在读一本100万字的小说。传统方法要求你每读一页都重新翻回第一页确认上下文KDA的做法是维护一个不断更新的故事摘要你只需要关注新页和摘要之间的差异。官方数据在百万token上下文场景下KDA将解码速度最高提升了6.3倍。问题二模型太深信息在层层传递中衰减2.8T参数的MoE模型网络深度远超常规模型。早期层学到的有用特征在逐层传递过程中容易被后面层的信息淹没——这就是深度学习经典的信息衰减问题。解法Attention ResidualsAttnRes注意力残差AttnRes的核心思路是让后面的网络层能够根据当前输入从前面不同层中选择性地检索和汇集有用信息而不是简单地将所有前层信息逐层累积。一个值得关注的细节这项技术的核心贡献者之一是17岁的深圳高中生陈广宇。他与月之暗面研究员张宇、苏剑林在AttnRes论文中被标注为同等贡献者。据苏剑林回忆陈广宇和张宇共同提出了Block AttnRes分块注意力残差将逐层选择改为分块选择在保留大部分效果的同时降低了显存占用和通信开销。官方披露的数据极为亮眼AttnRes增加的额外成本不到2%却带来约25%的训练效率提升。对于参数规模以万亿计的大模型这意味着极小的代价换来了显著的收益。加上MoE层面的优化Stable LatentMoE框架896个专家中每次激活16个保持极高稀疏度Quantile Balancing替代启发式的专家均衡策略确保训练稳定Per-Head Muon让注意力头独立优化Sigmoid Tanh UnitSiTU Gated MLA分别改善激活控制和注意力选择性这些技术叠加在一起让K3相较上一代K2实现了约2.5倍的整体扩展效率提升——同样的算力投入能转化出更强的能力。2.3 两个变体K3 Max 与 K3 Swarm MaxK3发布时提供两个变体K3 Max面向对话与智能体Agent任务适合需要深度推理、长程编程的场景K3 Swarm Max面向大规模并行处理适合多Agent协同、高并发任务调度API调用的模型名统一为kimi-k3两个变体通过参数和路由策略区分。三、Benchmark全维度拆解不是全面登顶而是多点开花3.1 编码能力编程赛道正面硬刚闭源旗舰月之暗面明确表示K3是公司迄今编程能力最强的模型。所有分数均在reasoning_effort: max、temperature: 1.0、top_p: 1.0条件下获得。基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2K3排名SWE Marathon极限编码42.035.039.040.014.013.0第一ProgramBench端到端完成度77.876.877.671.970.863.7第一Terminal-Bench 2.188.384.688.884.683.482.7第二差0.5FrontierSWE高难度SE81.286.671.366.764.967.3第二DeepSWE67.570.073.059.067.046.2第三ArenaAI CodeArena167916311618———第一Kimi Code Bench 2.072.976.9————第二解读要点SWE Marathon是最大亮点。这个基准测试衡量的是模型在数小时甚至数十小时的持续工程任务中的表现K3以42.0分登顶而GPT-5.5和GLM-5.2直接掉到了13-14分的低区间——说明K3在长程编码马拉松中的持久力远超同行。ProgramBench以77.8分微弱领先。说明K3在端到端编程完成度上已达到最顶尖水平。Terminal-Bench 2.1只差0.5分。与GPT-5.6 Sol的88.8几乎持平。FrontierSWE和DeepSWE仍有差距。在需要创造性解决复杂系统问题的场景中Fable 5依然是天花板。K3的FrontierSWE81.2超过GPT-5.6 Sol71.3但距Fable 586.6还有5分差距。3.2 Agent智能体能力全面超越Opus 4.8基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2BrowseComp网页深度调研91.288.090.484.3—SpreadsheetBench 2Excel建模34.834.732.431.628.1Automation Bench自动化任务30.829.129.727.212.9DeepSearchQAF195.094.2—93.1—AA-BriefcaseElo1,5481,5831,4951,3541,260GDPval-AA v2Elo1,6681,7601,7481,6001,514Job Bench52.957.446.548.443.4K3在BrowseComp91.2、SpreadsheetBench 234.8、Automation Bench30.8、DeepSearchQA95.0四项测试中均拿下第一。在综合性的GDPval-AA v2和AA-Briefcase中K3位居第三紧贴两款闭源旗舰大幅领先Opus 4.8和GLM-5.2。3.3 推理与视觉能力基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPQA-Diamond93.592.694.191.0HLE-Full43.553.344.549.8HLE-Full w/ tools56.063.058.057.9OmniDocBench91.189.885.8—MMMU-Pro81.681.283.078.9MathVision w/ Python97.8—97.8—在OmniDocBench文档理解上K3以91.1分超越Fable 589.8和GPT-5.6 Sol85.8。在GPQA-Diamond高难度科学推理上拿到93.5%是开源模型中的最佳成绩。但在HLE人类水平评测上K343.5与Fable 553.3差距明显——这是K3目前最大的短板之一。3.4 综合智能指数57分全球第三第三方评测机构Artificial Analysis给出的综合智能指数Intelligence Index模型智能指数输出速度Claude Fable 560—GPT-5.6 Sol59—Kimi K357~62 tok/sClaude Opus 4.856—GPT-5.5~55—K3以57分排在第三介于Opus 4.856与GPT-5.6 Sol59/Fable 560之间。差距在2-4分之内。月之暗面官方在发布博客中坦言“K3的整体表现仍落后于最强闭源系统但已在多项前沿任务上展现出稳定超越其他模型的能力。”这种坦诚在国产大模型发布中实属清流。四、与36号三强横评K3在MoE格局中的位置第36期我们横评了Qwen 3.7 Max、Kimi K2.7 Code和DeepSeek V4 Pro。现在K3来了国产MoE的格局需要重新画维度Qwen 3.7 MaxDeepSeek V4 ProKimi K2.7 CodeKimi K3总参数~600B1.6T~1T2.8T上下文128K-1M128K256K1M编程强项通用均衡推理深度编程专项优化长程编程前端API输出价格28元/MT6元/MT45元/MT100元/MT开源状态部分开源完全开源API-only7.27开源权重Arena排名——— 1679关键变化参数规模断层领先K3的2.8T是DeepSeek V4 Pro的1.75倍是K2.7 Code的近3倍。开源阵营的尺寸上限被直接拉到3T级。价格策略转向K3的API输出价格100元/MT是K2.7 Code45元/MT的2.2倍也远高于DeepSeek V4 Pro6元/MT。月之暗面不再走低价路线而是以能力溢价切入高端市场。定位分化明确DeepSeek V4 Pro继续做极致性价比Qwen 3.7 Max走通用均衡GLM-5.2做编码设计双料冠军K3则定位长程编程全能旗舰。四条路线、四种打法。成本效率的真相K3官方API的编程场景缓存命中率超90%缓存命中时输入价格仅2元/MT约$0.30。实际使用中输入成本可能低至标价的1/4。Artificial Analysis测算K3单任务成本约$0.94与GPT-5.6 Sol的$1.04接近仅为Claude Opus 4.8$1.80的一半。五、API定价与成本分析贵但贵得有道理5.1 官方API价格明细人民币定价每百万token项目价格输入缓存命中2元输入缓存未命中20元输出100元美元定价每百万token项目价格输入缓存命中$0.30输入缓存未命中$3.00输出$15.005.2 与闭源旗舰的价格对比模型输入缓存命中输入缓存未命中输出K3相对便宜Kimi K3$0.30$3.00$15.00—Claude Fable 5$1.00$10.00$50.00输出便宜70%GPT-5.6 Sol$0.50$5.00$30.00输出便宜50%Claude Opus 4.8——~$35.00输出便宜57%K3的输出价格是Fable 5的30%、GPT-5.6 Sol的50%。缓存命中时输入价格仅为Fable 5的1/33。5.3 与国产同行的价格对比模型混合价格$/MT定位Kimi K3~$2.3旗舰级Qwen 3.7 Max~$1.4高端GLM-5.2~$0.9中高端MiniMax M3~$0.22性价比DeepSeek V4 Pro~$0.18极致性价比K3是国产模型中最贵的——但也是能力最强的。月之暗面的定价策略清晰不再用低价换市场而是用能力换溢价。5.4 缓存命中率的成本魔法K3依托Mooncake分离式推理架构编程场景缓存命中率超过90%。这意味着标称输入价格$3.00/MT缓存未命中实际输入价格约90% x $0.30 10% x $3.00 $0.57/MT实际混合成本远低于标称的$2.3/MT在Kimi Code Bench V2上K3以单次约$4取得72.9分Fable 5达到76.9分但单次成本超过$10。K3的性价比分数/美元约为Fable 5的2倍。六、实操接入指南OpenAI SDK双协议兼容6.1 快速接入三行代码跑通K3K3的API完全兼容OpenAI SDK格式迁移成本极低fromopenaiimportOpenAI clientOpenAI(api_keyyour-api-key,base_urlhttps://api.moonshot.ai/v1# Kimi官方API)responseclient.chat.completions.create(modelkimi-k3,messages[{role:system,content:你是一位资深全栈工程师。},{role:user,content:用React TypeScript实现一个带搜索过滤的无限滚动列表组件。}],temperature1.0,top_p1.0,max_completion_tokens131072,)print(response.choices[0].message.content)6.2 当前API的硬性约束⚠️接入K3时必须注意以下参数限制截至发稿时{reasoning_effort:max,temperature:1.0,top_p:0.95,max_completion_tokens:131072,n:1,presence_penalty:0,frequency_penalty:0}视觉输入注意仅支持base64和ms://file-id格式不接受公开URL图片。Web搜索官方提示not recommended for production生产环境建议自行实现搜索工具调用。6.3 Agent场景接入示例K3的100万token上下文 Agent能力是其最大卖点。以下是一个量化研究Agent的接入示例tools[{type:function,function:{name:stockapi_kline,description:获取指定股票的K线数据,parameters:{type:object,properties:{symbol:{type:string,description:股票代码},days:{type:integer,description:获取天数}},required:[symbol,days]}}}]messages[{role:system,content:你是A股量化研究员。可用工具stockapi_kline获取K线数据。任务对指定股票做均线金叉/死叉分析输出结构化报告。},{role:user,content:分析贵州茅台(600519)近60个交易日的均线走势}]respclient.chat.completions.create(modelkimi-k3,messagesmessages,toolstools,temperature1.0,top_p1.0,)6.4 视觉闭环编程Vision in the LoopK3最独特的工作模式之一是视觉闭环——模型生成代码后可以直接查看运行截图识别布局、色彩和层级问题再修改代码、再截图如此反复迭代。importbase64withopen(screenshot.png,rb)asf:image_database64.b64encode(f.read()).decode()messages[{role:user,content:[{type:text,text:这是当前页面的截图请根据截图中的布局问题修改CSS样式。},{type:image_url,image_url:{url:fdata:image/png;base64,{image_data}}}]}]这种模式让K3在前端开发、游戏开发、CAD等场景中形成了独特的看到→修改→再看→再改的工作循环与传统的一次性输出代码模式有本质区别。七、三大硬核案例MiniTriton、48小时芯片、科研复现7.1 从零构建MiniTriton GPU编译器K3从零构建了一个名为MiniTriton的类Triton GPU编译器包含自定义tile级IR层基于MLIR、完整优化pass和PTX代码生成流水线。在Roofline基准测试中性能持平甚至超越官方Triton和torch.compile并能支撑nanoGPT端到端训练收敛。在K3开发后期早期版本已承担团队大部分GPU内核优化工作——这是模型能力反哺研发流程的真实案例。7.2 48小时自主完成芯片设计连续48小时Agent自主运行使用开源EDA工具Nangate 45nm工艺库独立完成芯片构建、优化与验证。4mm²面积内集成146万个标准单元0.277MB SRAM实现INT4 MAC阵列100MHz时序收敛仿真解码吞吐8700 tokens/s。**由模型设计的芯片为模型服务的芯片。**消息发布当天Cadence暴跌9.47%Synopsys暴跌7.85%。7.3 两小时复现天体物理计算K3用约两小时完成通常需要资深研究人员一到两周的工作——阅读二十多篇论文、整理三百多个状态方程、写出三千多行Python代码。7.4 GPU内核优化实测24小时沙箱中完成AttnRes、KDA和512头维度MLA内核在NVIDIA H200上的优化。AttnRes任务前向反向时间从283.6ms压缩到114.4ms。MLA-512内核从零编写达到517.8 TFLOPS超过H200理论BF16峰值一半领先第二名492.7 TFLOPS。八、官方坦承的三个局限局限一对思考历史敏感——K3在保留思考历史模式下训练。如果Agent框架未能完整回传历史思考内容或在会话中途从不兼容模型切换到K3生成质量可能大幅波动。建议使用Kimi Code等已验证兼容的框架。局限二过度主动——训练强调长周期高难度任务遇到简单场景或模糊指令时可能替用户做出非预期决定。需要在system prompt中施加更明确的行为约束。局限三综合体验仍有差距——官方原文尽管Kimi K3总体上是一个非常有竞争力的模型但与Claude Fable 5和GPT-5.6 Sol相比在用户体验上仍有一定差距。对开发者的实际影响(1)接入K3时必须确保Agent框架能完整传递thinking history(2)System prompt需更精确地约束模型行为边界(3)生产环境建议做充分回归测试。九、开源在即7月27日意味着什么K3完整模型权重将于2026年7月27日正式开源技术报告同步发布。意味着(1)企业可私有化部署数据完全不出域(2)社区可做微调、蒸馏、量化、适配等二次开发(3)但硬件门槛极高——2.8T参数即使MXFP4存储也需约1.4TB官方推荐supernode配置64高端加速器(4)vLLM适配方案已贡献社区。对多数开发者云端API仍是更现实的选择。但对金融、医疗、政务等数据敏感行业私有化部署从合规要求变成了战略选择。十、行业震动从追赶到局部领跑K3的发布引发了多层面连锁反应资本市场K3发布当天智谱股价暴跌28%MiniMax下跌16%。投资者迅速重新评估中国大模型赛道的竞争格局。全球评价Arena AI CEO称其为可能是今年最重大的发布卡内基梅隆大学教授、前苹果首任总监Russ Salakhutdinov也是Kimi创始人杨植麟的CMU导师称其为开源模型社区的重大胜利高盛研报指出中国开源模型智能能力已达到全球大规模普及的关键转折点。估值飙升月之暗面半年内完成三级跳——2025年12月估值43亿美元→2026年5月D轮200亿美元→6月新一轮315亿美元。累计融资超370亿人民币为AGI赛道融资最高的新创公司。产品矩阵K3不是孤立产品。K2.7 Code专攻编程Token消耗降低30%Kimi Work把Agent搬到桌面端支持飞书/WPS/钉钉插件Kimi信用卡美国运通农业银行联名用积分换算力。十一、开发者实操建议什么场景该用K3场景推荐模型理由前端开发/Web设计Kimi K3Arena全球第一视觉闭环独特长程编程/大型代码库Kimi K3100万上下文 SWE Marathon第一极致性价比/日常推理DeepSeek V4 Pro输出仅$0.87/MT便宜10倍编码设计双料需求GLM-5.2Code Arena Design Arena双冠通用均衡/中文场景Qwen 3.7 Max生态集成中文能力突出极致综合体验/预算充足Claude Fable 5综合智能60分全球天花板数据私有化/本地部署等K3开源权重2.8T级能力开源可自托管K3核心价值公式接近Fable 5的编程能力 x 1/3的价格 x 开源可私有化 x 100万上下文 前端/长程编程场景最优解。十二、写在最后MoE第四极的启示从DeepSeek R1到GLM-5.2从Qwen 3到Kimi K3国产开源MoE模型在过去一年完成了从追赶到并跑再到局部领跑的三级跳。K3的定位很清晰它不是全能冠军但在编程和Agent赛道上已经坐到了全球最靠前的位置。2.8万亿参数、100万token上下文、原生视觉理解、Arena代码榜第一——这些标签叠加在一起让国产开源模型第一次在规模能力开放三个维度同时站到了世界之巅。当然K3距离全面超越Fable 5和GPT-5.6 Sol还有距离。综合智能57 vs 60的3分之差HLE上43.5 vs 53.3的10分差距FrontierSWE上81.2 vs 86.6的5分落差——这些都是下一步需要攻克的方向。但方向已经明确路径已经验证。7月27日权重开源全球开发者社区将用自己的方式给这个2.8万亿参数的开源巨兽写下新的注脚。实操入口K3刚开权重先用中转跑通再迁移K3完整权重7月27日才正式开放API也刚上线不久——很多开发者的接入工作还在起步阶段。如果你正在做技术选型和API适配不想在官方API注册充值上耗时间也不想一上来就被$3/$15的单价烧预算做压测——可以先用点点词元中转跑通整条链路等验证稳定了再迁回官方。点点词元https://activity.ldzktoken.com/activity/index.html是专门为大模型开发者做的API中转服务同时兼容OpenAI SDK和Anthropic SDK双协议。接入K3只需改base_url和api_key两个配置业务代码完全不动。为什么这个阶段特别适合用中转双协议兼容K3支持OpenAI和Anthropic两种格式点点词元两种都能接价格优势比官方直充便宜20%-50%K3这种高单价模型上差距更明显多模型一站切换K3做前端、DeepSeek做推理、Fable 5做对照——一个API Key搞定迁移零成本等7月27日K3权重开源、环境稳定后随时迁回官方点点词元入口https://activity.ldzktoken.com/activity/index.htmlK3的窗口期稍纵即逝——7月27日权重开源后社区会涌入大量适配需求。先用中转把链路跑通、参数踩熟等官方生态成熟再做长期方案这是当下最务实的技术路线。点点词元技术专栏 · 第37期 · 数据来源月之暗面官方技术博客、Artificial Analysis、Arena AI、felloai、博客园、CSDN、量子位
Kimi K3 2.8万亿参数登顶全球代码榜——MoE第四极来了
Kimi K3 2.8万亿参数登顶全球代码榜——MoE第四极来了点点词元技术专栏 · 第37期上一篇第36期我们横评了国产开源MoE三强Qwen 3.7 Max、Kimi K2.7 Code、DeepSeek V4 Pro。当时Kimi K2系列还停在1T参数级别。不到一个月月之暗面直接甩出了K3——2.8万亿参数、Arena前端代码榜全球第一、完整权重即将开源。国产MoE的第四极来了。一、开场1679分国产模型首次登顶Frontend Code Arena2026年7月17日凌晨月之暗面Moonshot AI在WAIC 2026世界人工智能大会前夕正式发布新一代旗舰模型Kimi K3。发布不到24小时一组数据引爆了整个开发者社区排名模型Arena AI Code Arena 得分第1名Kimi K31679第2名Claude Fable 51631第3名GPT-5.6 Sol (xHigh)1618第4名GLM-5.21587第5名Claude Opus 4.81562这不是月之暗面自己出题、自己打分的内部评测。Arena AI的Frontend Code Arena采用匿名双盲对战投票机制——同一道任务交给两个匿名模型全球用户在真实体验两个结果后投票投票结束才揭晓模型身份。品牌影响被完全剥离结果更具含金量。Kimi K3在七个前端细分领域中拿下六个第一品牌营销、参考图还原、数据分析、消费产品、模拟仿真、内容创作工具。仅在游戏领域小幅落后Fable 5排名第二。从Kimi K2.6的第18名直接跳到第1名——17个名次的跃升累计获得约48万次投票支持。马斯克本人也在评论区留言Impressive令人印象深刻。Arena AI联合创始人兼CEO更是称其为可能是今年最重大的发布认为它动摇了OpenAI、Anthropic等美国闭源模型的主导地位。彭博社报道将此事件比作新的DeepSeek时刻。但Arena只是冰山一角。让我们把K3的核心参数表拉出来逐项拆解。二、核心规格2.8万亿参数的开源巨兽2.1 参数卡片属性数值总参数2.8万亿2.8T架构MoEStable LatentMoE专家配置896个专家每次推理激活16个上下文窗口100万token1,048,576最大输出默认131,072最高可达1,048,576多模态原生支持图像视频输入文本输出注意力机制KDAKimi Delta Attention混合线性注意力深层信息传递AttnResAttention Residuals注意力残差推理模式始终开启思考thinking always-on量化训练MXFP4权重 MXFP8激活量化感知训练开源状态完整权重2026年7月27日发布许可证Modified MIT推荐部署配置supernode≥64个加速器2.8万亿是什么概念在K3之前开源模型的参数上限由DeepSeek V4的1.6T保持。K3直接把这个上限抬到了近两倍——开源阵营首次具备了与闭源旗舰在规模天花板上正面竞争的能力。但参数大不等于能力强。关键在于这2.8万亿参数是怎么被驯服的。2.2 架构拆解两把钥匙驯服2.8TK3的架构基于两项自研核心技术分别解决两个维度的问题问题一100万token的上下文太长传统Attention算不动当上下文窗口拉到100万token时标准自注意力Self-Attention的计算量按序列长度的平方增长。每生成一个新token都要重新对所有历史token做注意力计算——这在百万级上下文下是不可承受之重。解法Kimi Delta AttentionKDA混合线性注意力KDA的核心思路是将长上下文拆解为已总结的历史和新来的变化Delta。对历史部分用线性方式维护一个紧凑的记忆状态新token只需要重点关注变化部分而不是重新计算全量注意力。通俗类比想象你在读一本100万字的小说。传统方法要求你每读一页都重新翻回第一页确认上下文KDA的做法是维护一个不断更新的故事摘要你只需要关注新页和摘要之间的差异。官方数据在百万token上下文场景下KDA将解码速度最高提升了6.3倍。问题二模型太深信息在层层传递中衰减2.8T参数的MoE模型网络深度远超常规模型。早期层学到的有用特征在逐层传递过程中容易被后面层的信息淹没——这就是深度学习经典的信息衰减问题。解法Attention ResidualsAttnRes注意力残差AttnRes的核心思路是让后面的网络层能够根据当前输入从前面不同层中选择性地检索和汇集有用信息而不是简单地将所有前层信息逐层累积。一个值得关注的细节这项技术的核心贡献者之一是17岁的深圳高中生陈广宇。他与月之暗面研究员张宇、苏剑林在AttnRes论文中被标注为同等贡献者。据苏剑林回忆陈广宇和张宇共同提出了Block AttnRes分块注意力残差将逐层选择改为分块选择在保留大部分效果的同时降低了显存占用和通信开销。官方披露的数据极为亮眼AttnRes增加的额外成本不到2%却带来约25%的训练效率提升。对于参数规模以万亿计的大模型这意味着极小的代价换来了显著的收益。加上MoE层面的优化Stable LatentMoE框架896个专家中每次激活16个保持极高稀疏度Quantile Balancing替代启发式的专家均衡策略确保训练稳定Per-Head Muon让注意力头独立优化Sigmoid Tanh UnitSiTU Gated MLA分别改善激活控制和注意力选择性这些技术叠加在一起让K3相较上一代K2实现了约2.5倍的整体扩展效率提升——同样的算力投入能转化出更强的能力。2.3 两个变体K3 Max 与 K3 Swarm MaxK3发布时提供两个变体K3 Max面向对话与智能体Agent任务适合需要深度推理、长程编程的场景K3 Swarm Max面向大规模并行处理适合多Agent协同、高并发任务调度API调用的模型名统一为kimi-k3两个变体通过参数和路由策略区分。三、Benchmark全维度拆解不是全面登顶而是多点开花3.1 编码能力编程赛道正面硬刚闭源旗舰月之暗面明确表示K3是公司迄今编程能力最强的模型。所有分数均在reasoning_effort: max、temperature: 1.0、top_p: 1.0条件下获得。基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPT-5.5GLM-5.2K3排名SWE Marathon极限编码42.035.039.040.014.013.0第一ProgramBench端到端完成度77.876.877.671.970.863.7第一Terminal-Bench 2.188.384.688.884.683.482.7第二差0.5FrontierSWE高难度SE81.286.671.366.764.967.3第二DeepSWE67.570.073.059.067.046.2第三ArenaAI CodeArena167916311618———第一Kimi Code Bench 2.072.976.9————第二解读要点SWE Marathon是最大亮点。这个基准测试衡量的是模型在数小时甚至数十小时的持续工程任务中的表现K3以42.0分登顶而GPT-5.5和GLM-5.2直接掉到了13-14分的低区间——说明K3在长程编码马拉松中的持久力远超同行。ProgramBench以77.8分微弱领先。说明K3在端到端编程完成度上已达到最顶尖水平。Terminal-Bench 2.1只差0.5分。与GPT-5.6 Sol的88.8几乎持平。FrontierSWE和DeepSWE仍有差距。在需要创造性解决复杂系统问题的场景中Fable 5依然是天花板。K3的FrontierSWE81.2超过GPT-5.6 Sol71.3但距Fable 586.6还有5分差距。3.2 Agent智能体能力全面超越Opus 4.8基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2BrowseComp网页深度调研91.288.090.484.3—SpreadsheetBench 2Excel建模34.834.732.431.628.1Automation Bench自动化任务30.829.129.727.212.9DeepSearchQAF195.094.2—93.1—AA-BriefcaseElo1,5481,5831,4951,3541,260GDPval-AA v2Elo1,6681,7601,7481,6001,514Job Bench52.957.446.548.443.4K3在BrowseComp91.2、SpreadsheetBench 234.8、Automation Bench30.8、DeepSearchQA95.0四项测试中均拿下第一。在综合性的GDPval-AA v2和AA-Briefcase中K3位居第三紧贴两款闭源旗舰大幅领先Opus 4.8和GLM-5.2。3.3 推理与视觉能力基准测试Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GPQA-Diamond93.592.694.191.0HLE-Full43.553.344.549.8HLE-Full w/ tools56.063.058.057.9OmniDocBench91.189.885.8—MMMU-Pro81.681.283.078.9MathVision w/ Python97.8—97.8—在OmniDocBench文档理解上K3以91.1分超越Fable 589.8和GPT-5.6 Sol85.8。在GPQA-Diamond高难度科学推理上拿到93.5%是开源模型中的最佳成绩。但在HLE人类水平评测上K343.5与Fable 553.3差距明显——这是K3目前最大的短板之一。3.4 综合智能指数57分全球第三第三方评测机构Artificial Analysis给出的综合智能指数Intelligence Index模型智能指数输出速度Claude Fable 560—GPT-5.6 Sol59—Kimi K357~62 tok/sClaude Opus 4.856—GPT-5.5~55—K3以57分排在第三介于Opus 4.856与GPT-5.6 Sol59/Fable 560之间。差距在2-4分之内。月之暗面官方在发布博客中坦言“K3的整体表现仍落后于最强闭源系统但已在多项前沿任务上展现出稳定超越其他模型的能力。”这种坦诚在国产大模型发布中实属清流。四、与36号三强横评K3在MoE格局中的位置第36期我们横评了Qwen 3.7 Max、Kimi K2.7 Code和DeepSeek V4 Pro。现在K3来了国产MoE的格局需要重新画维度Qwen 3.7 MaxDeepSeek V4 ProKimi K2.7 CodeKimi K3总参数~600B1.6T~1T2.8T上下文128K-1M128K256K1M编程强项通用均衡推理深度编程专项优化长程编程前端API输出价格28元/MT6元/MT45元/MT100元/MT开源状态部分开源完全开源API-only7.27开源权重Arena排名——— 1679关键变化参数规模断层领先K3的2.8T是DeepSeek V4 Pro的1.75倍是K2.7 Code的近3倍。开源阵营的尺寸上限被直接拉到3T级。价格策略转向K3的API输出价格100元/MT是K2.7 Code45元/MT的2.2倍也远高于DeepSeek V4 Pro6元/MT。月之暗面不再走低价路线而是以能力溢价切入高端市场。定位分化明确DeepSeek V4 Pro继续做极致性价比Qwen 3.7 Max走通用均衡GLM-5.2做编码设计双料冠军K3则定位长程编程全能旗舰。四条路线、四种打法。成本效率的真相K3官方API的编程场景缓存命中率超90%缓存命中时输入价格仅2元/MT约$0.30。实际使用中输入成本可能低至标价的1/4。Artificial Analysis测算K3单任务成本约$0.94与GPT-5.6 Sol的$1.04接近仅为Claude Opus 4.8$1.80的一半。五、API定价与成本分析贵但贵得有道理5.1 官方API价格明细人民币定价每百万token项目价格输入缓存命中2元输入缓存未命中20元输出100元美元定价每百万token项目价格输入缓存命中$0.30输入缓存未命中$3.00输出$15.005.2 与闭源旗舰的价格对比模型输入缓存命中输入缓存未命中输出K3相对便宜Kimi K3$0.30$3.00$15.00—Claude Fable 5$1.00$10.00$50.00输出便宜70%GPT-5.6 Sol$0.50$5.00$30.00输出便宜50%Claude Opus 4.8——~$35.00输出便宜57%K3的输出价格是Fable 5的30%、GPT-5.6 Sol的50%。缓存命中时输入价格仅为Fable 5的1/33。5.3 与国产同行的价格对比模型混合价格$/MT定位Kimi K3~$2.3旗舰级Qwen 3.7 Max~$1.4高端GLM-5.2~$0.9中高端MiniMax M3~$0.22性价比DeepSeek V4 Pro~$0.18极致性价比K3是国产模型中最贵的——但也是能力最强的。月之暗面的定价策略清晰不再用低价换市场而是用能力换溢价。5.4 缓存命中率的成本魔法K3依托Mooncake分离式推理架构编程场景缓存命中率超过90%。这意味着标称输入价格$3.00/MT缓存未命中实际输入价格约90% x $0.30 10% x $3.00 $0.57/MT实际混合成本远低于标称的$2.3/MT在Kimi Code Bench V2上K3以单次约$4取得72.9分Fable 5达到76.9分但单次成本超过$10。K3的性价比分数/美元约为Fable 5的2倍。六、实操接入指南OpenAI SDK双协议兼容6.1 快速接入三行代码跑通K3K3的API完全兼容OpenAI SDK格式迁移成本极低fromopenaiimportOpenAI clientOpenAI(api_keyyour-api-key,base_urlhttps://api.moonshot.ai/v1# Kimi官方API)responseclient.chat.completions.create(modelkimi-k3,messages[{role:system,content:你是一位资深全栈工程师。},{role:user,content:用React TypeScript实现一个带搜索过滤的无限滚动列表组件。}],temperature1.0,top_p1.0,max_completion_tokens131072,)print(response.choices[0].message.content)6.2 当前API的硬性约束⚠️接入K3时必须注意以下参数限制截至发稿时{reasoning_effort:max,temperature:1.0,top_p:0.95,max_completion_tokens:131072,n:1,presence_penalty:0,frequency_penalty:0}视觉输入注意仅支持base64和ms://file-id格式不接受公开URL图片。Web搜索官方提示not recommended for production生产环境建议自行实现搜索工具调用。6.3 Agent场景接入示例K3的100万token上下文 Agent能力是其最大卖点。以下是一个量化研究Agent的接入示例tools[{type:function,function:{name:stockapi_kline,description:获取指定股票的K线数据,parameters:{type:object,properties:{symbol:{type:string,description:股票代码},days:{type:integer,description:获取天数}},required:[symbol,days]}}}]messages[{role:system,content:你是A股量化研究员。可用工具stockapi_kline获取K线数据。任务对指定股票做均线金叉/死叉分析输出结构化报告。},{role:user,content:分析贵州茅台(600519)近60个交易日的均线走势}]respclient.chat.completions.create(modelkimi-k3,messagesmessages,toolstools,temperature1.0,top_p1.0,)6.4 视觉闭环编程Vision in the LoopK3最独特的工作模式之一是视觉闭环——模型生成代码后可以直接查看运行截图识别布局、色彩和层级问题再修改代码、再截图如此反复迭代。importbase64withopen(screenshot.png,rb)asf:image_database64.b64encode(f.read()).decode()messages[{role:user,content:[{type:text,text:这是当前页面的截图请根据截图中的布局问题修改CSS样式。},{type:image_url,image_url:{url:fdata:image/png;base64,{image_data}}}]}]这种模式让K3在前端开发、游戏开发、CAD等场景中形成了独特的看到→修改→再看→再改的工作循环与传统的一次性输出代码模式有本质区别。七、三大硬核案例MiniTriton、48小时芯片、科研复现7.1 从零构建MiniTriton GPU编译器K3从零构建了一个名为MiniTriton的类Triton GPU编译器包含自定义tile级IR层基于MLIR、完整优化pass和PTX代码生成流水线。在Roofline基准测试中性能持平甚至超越官方Triton和torch.compile并能支撑nanoGPT端到端训练收敛。在K3开发后期早期版本已承担团队大部分GPU内核优化工作——这是模型能力反哺研发流程的真实案例。7.2 48小时自主完成芯片设计连续48小时Agent自主运行使用开源EDA工具Nangate 45nm工艺库独立完成芯片构建、优化与验证。4mm²面积内集成146万个标准单元0.277MB SRAM实现INT4 MAC阵列100MHz时序收敛仿真解码吞吐8700 tokens/s。**由模型设计的芯片为模型服务的芯片。**消息发布当天Cadence暴跌9.47%Synopsys暴跌7.85%。7.3 两小时复现天体物理计算K3用约两小时完成通常需要资深研究人员一到两周的工作——阅读二十多篇论文、整理三百多个状态方程、写出三千多行Python代码。7.4 GPU内核优化实测24小时沙箱中完成AttnRes、KDA和512头维度MLA内核在NVIDIA H200上的优化。AttnRes任务前向反向时间从283.6ms压缩到114.4ms。MLA-512内核从零编写达到517.8 TFLOPS超过H200理论BF16峰值一半领先第二名492.7 TFLOPS。八、官方坦承的三个局限局限一对思考历史敏感——K3在保留思考历史模式下训练。如果Agent框架未能完整回传历史思考内容或在会话中途从不兼容模型切换到K3生成质量可能大幅波动。建议使用Kimi Code等已验证兼容的框架。局限二过度主动——训练强调长周期高难度任务遇到简单场景或模糊指令时可能替用户做出非预期决定。需要在system prompt中施加更明确的行为约束。局限三综合体验仍有差距——官方原文尽管Kimi K3总体上是一个非常有竞争力的模型但与Claude Fable 5和GPT-5.6 Sol相比在用户体验上仍有一定差距。对开发者的实际影响(1)接入K3时必须确保Agent框架能完整传递thinking history(2)System prompt需更精确地约束模型行为边界(3)生产环境建议做充分回归测试。九、开源在即7月27日意味着什么K3完整模型权重将于2026年7月27日正式开源技术报告同步发布。意味着(1)企业可私有化部署数据完全不出域(2)社区可做微调、蒸馏、量化、适配等二次开发(3)但硬件门槛极高——2.8T参数即使MXFP4存储也需约1.4TB官方推荐supernode配置64高端加速器(4)vLLM适配方案已贡献社区。对多数开发者云端API仍是更现实的选择。但对金融、医疗、政务等数据敏感行业私有化部署从合规要求变成了战略选择。十、行业震动从追赶到局部领跑K3的发布引发了多层面连锁反应资本市场K3发布当天智谱股价暴跌28%MiniMax下跌16%。投资者迅速重新评估中国大模型赛道的竞争格局。全球评价Arena AI CEO称其为可能是今年最重大的发布卡内基梅隆大学教授、前苹果首任总监Russ Salakhutdinov也是Kimi创始人杨植麟的CMU导师称其为开源模型社区的重大胜利高盛研报指出中国开源模型智能能力已达到全球大规模普及的关键转折点。估值飙升月之暗面半年内完成三级跳——2025年12月估值43亿美元→2026年5月D轮200亿美元→6月新一轮315亿美元。累计融资超370亿人民币为AGI赛道融资最高的新创公司。产品矩阵K3不是孤立产品。K2.7 Code专攻编程Token消耗降低30%Kimi Work把Agent搬到桌面端支持飞书/WPS/钉钉插件Kimi信用卡美国运通农业银行联名用积分换算力。十一、开发者实操建议什么场景该用K3场景推荐模型理由前端开发/Web设计Kimi K3Arena全球第一视觉闭环独特长程编程/大型代码库Kimi K3100万上下文 SWE Marathon第一极致性价比/日常推理DeepSeek V4 Pro输出仅$0.87/MT便宜10倍编码设计双料需求GLM-5.2Code Arena Design Arena双冠通用均衡/中文场景Qwen 3.7 Max生态集成中文能力突出极致综合体验/预算充足Claude Fable 5综合智能60分全球天花板数据私有化/本地部署等K3开源权重2.8T级能力开源可自托管K3核心价值公式接近Fable 5的编程能力 x 1/3的价格 x 开源可私有化 x 100万上下文 前端/长程编程场景最优解。十二、写在最后MoE第四极的启示从DeepSeek R1到GLM-5.2从Qwen 3到Kimi K3国产开源MoE模型在过去一年完成了从追赶到并跑再到局部领跑的三级跳。K3的定位很清晰它不是全能冠军但在编程和Agent赛道上已经坐到了全球最靠前的位置。2.8万亿参数、100万token上下文、原生视觉理解、Arena代码榜第一——这些标签叠加在一起让国产开源模型第一次在规模能力开放三个维度同时站到了世界之巅。当然K3距离全面超越Fable 5和GPT-5.6 Sol还有距离。综合智能57 vs 60的3分之差HLE上43.5 vs 53.3的10分差距FrontierSWE上81.2 vs 86.6的5分落差——这些都是下一步需要攻克的方向。但方向已经明确路径已经验证。7月27日权重开源全球开发者社区将用自己的方式给这个2.8万亿参数的开源巨兽写下新的注脚。实操入口K3刚开权重先用中转跑通再迁移K3完整权重7月27日才正式开放API也刚上线不久——很多开发者的接入工作还在起步阶段。如果你正在做技术选型和API适配不想在官方API注册充值上耗时间也不想一上来就被$3/$15的单价烧预算做压测——可以先用点点词元中转跑通整条链路等验证稳定了再迁回官方。点点词元https://activity.ldzktoken.com/activity/index.html是专门为大模型开发者做的API中转服务同时兼容OpenAI SDK和Anthropic SDK双协议。接入K3只需改base_url和api_key两个配置业务代码完全不动。为什么这个阶段特别适合用中转双协议兼容K3支持OpenAI和Anthropic两种格式点点词元两种都能接价格优势比官方直充便宜20%-50%K3这种高单价模型上差距更明显多模型一站切换K3做前端、DeepSeek做推理、Fable 5做对照——一个API Key搞定迁移零成本等7月27日K3权重开源、环境稳定后随时迁回官方点点词元入口https://activity.ldzktoken.com/activity/index.htmlK3的窗口期稍纵即逝——7月27日权重开源后社区会涌入大量适配需求。先用中转把链路跑通、参数踩熟等官方生态成熟再做长期方案这是当下最务实的技术路线。点点词元技术专栏 · 第37期 · 数据来源月之暗面官方技术博客、Artificial Analysis、Arena AI、felloai、博客园、CSDN、量子位