lmdeploy v0.12.2 发布!全面支持 GLM5、Qwen3.5,性能与兼容性双升级,大模型部署再提速

lmdeploy v0.12.2 发布!全面支持 GLM5、Qwen3.5,性能与兼容性双升级,大模型部署再提速 一、版本总览2026开年关键迭代大模型部署生态再进化2026年3月18日InternLM团队正式发布lmdeploy v0.12.2版本作为开年以来的重要迭代该版本聚焦模型支持广度、推理性能、量化能力、硬件兼容性、稳定性五大核心维度完成34次提交、277个文件修改由16位贡献者协同打磨实现了对GLM5、Qwen3.5等主流大模型的全面适配同时在TurboMind引擎优化、量化技术升级、Bug修复等方面实现突破性进展为大模型高效、稳定、低成本部署提供了更强大的技术支撑。lmdeploy作为覆盖大模型压缩、推理、服务的一体化部署工具包凭借TurboMind高性能推理引擎、灵活的量化方案、多模型兼容能力已成为大模型落地的核心基础设施。v0.12.2版本延续了工具的核心优势进一步拓宽模型适配边界强化性能与稳定性无论是个人开发者的本地部署还是企业级的大规模服务化都能提供更优的解决方案。二、核心新特性模型支持全面扩容推理能力再突破一主流大模型全面适配覆盖国产与开源生态支持GLM5模型作为本次版本的核心亮点之一lmdeploy v0.12.2正式新增对GLM5模型的支持补齐了对智谱AI主流大模型的部署能力。GLM5作为智谱AI推出的新一代大模型在通用理解、逻辑推理、多轮对话等方面具备显著优势此次适配让开发者可通过lmdeploy快速实现GLM5模型的本地推理与服务化部署无需复杂的二次开发即可将GLM5的能力集成到各类应用中。新增Qwen3.5模型支持紧跟通义千问模型迭代节奏v0.12.2版本全面支持Qwen3.5系列模型包括密集型Dense与混合专家型MoE架构。Qwen3.5作为阿里云推出的高性能大模型在长文本处理、多模态交互、实时推理等场景表现突出此次适配不仅实现基础推理支持更通过TurboMind引擎深度优化保障Qwen3.5模型在部署后的推理效率与稳定性。GLM-4.7-Flash Turbomind专项支持针对GLM-4.7-Flash模型版本新增专属的TurboMind支持能力。GLM-4.7-Flash主打低延迟、高吞吐推理适配实时对话、智能客服等对响应速度要求严苛的场景lmdeploy通过定制化的TurboMind引擎适配充分释放该模型的性能潜力实现推理延迟与吞吐量的双重优化。Qwen/Internlm/Llama系列模型FP8量化在线支持为解决大模型部署中的显存占用与推理速度矛盾v0.12.2版本实现对Qwen、Internlm、Llama三大主流模型系列含Dense与MoE架构的FP8量化在线支持。FP8量化作为兼顾精度与效率的量化方案可在几乎不损失模型推理精度的前提下将显存占用降低约50%同时提升推理速度大幅降低大模型部署的硬件门槛让中低端GPU也能流畅运行百亿参数级大模型。二推理与生成能力升级提升生成质量与灵活性新增TurboMind对Qwen3.5全架构支持除基础适配外版本通过专项开发实现TurboMind引擎对Qwen3.5 Dense与MoE架构的完整支持。TurboMind作为lmdeploy的核心推理引擎基于C/CUDA实现具备连续批处理、分块KV缓存、高性能算子等优势此次针对Qwen3.5的深度优化可让该模型在lmdeploy部署后吞吐量较原生推理提升数倍同时降低推理延迟。支持Router Replay与量化层忽略Qwen3.5专属针对Qwen3.5模型的MoE架构特性版本新增Router Replay路由重放与忽略量化层功能。Router Replay可优化MoE模型中专家路由的推理效率减少重复计算忽略量化层则允许开发者针对模型特定层跳过量化平衡推理精度与速度满足不同场景的部署需求进一步提升Qwen3.5模型部署的灵活性。新增Repetition Ngram Logits Processor为解决大模型生成过程中的重复文本问题v0.12.2版本新增Repetition Ngram Logits Processor重复N元语法逻辑处理器。该功能通过对生成文本的N元语法进行检测与惩罚有效抑制重复片段的生成提升生成文本的连贯性、多样性与质量尤其适用于长文本生成、内容创作、对话交互等场景。三、性能与兼容性优化引擎升级适配更广泛硬件与框架一TurboMind引擎深度优化适配最新技术栈兼容Transformers 5.0框架随着Hugging Face Transformers框架迭代至5.0版本lmdeploy v0.12.2同步完成TurboMind引擎的兼容性升级确保基于最新Transformers框架训练或导出的模型可无缝通过lmdeploy部署。此次兼容覆盖模型加载、权重解析、推理流程等全链路避免因框架版本不匹配导致的部署失败保障开发者使用最新模型与工具链的顺畅性。支持Qwen与Internlm模型FP32 Head针对Qwen与Internlm系列模型版本新增FP32精度的输出头Head支持。在部分对推理精度要求极高的场景如金融分析、医疗诊断、科学计算FP32精度可避免量化带来的精度损失保障输出结果的准确性同时该功能可与模型其他部分的量化方案灵活搭配实现精度与效率的动态平衡。MLA KV缓存内存占用优化通过核心算法优化版本实现MLAMulti-Head Latent Attention结构的KV缓存内存占用大幅降低。KV缓存作为大模型推理中显存占用的核心部分其优化直接影响模型可部署的上下文长度与并发数此次优化可在相同硬件条件下支持更长的上下文窗口或更多的并发请求显著提升长文本、多轮对话场景的部署能力。新增Recurrent Gated Delta Rule内核引入全新的Recurrent Gated Delta Rule循环门控增量规则计算内核针对循环神经网络相关结构的推理进行专项加速。该内核通过优化门控机制与增量计算逻辑减少冗余计算步骤提升循环结构的推理速度适配具备循环特性的大模型架构进一步拓宽lmdeploy的模型适配范围与性能边界。MLA内核性能再提升在原有MLA内核优化基础上版本推出更快的MLA计算内核通过算子融合、内存访问优化、并行计算调度等手段进一步提升MLA结构的推理效率。对于广泛采用MLA结构的现代大模型该优化可直接降低推理延迟、提升吞吐量让模型在高并发场景下更流畅运行。注意力内核自注册与解耦调度重构注意力内核的注册与调度机制实现注意力内核的自注册与解耦调度。自注册机制简化了新内核的集成流程降低开发者扩展内核的门槛解耦调度则让注意力计算与其他推理步骤分离提升计算调度的灵活性与效率同时为后续多硬件、多架构的注意力内核适配奠定基础。二硬件兼容性拓展覆盖国产与主流算力平台昇腾AscendS1-Pro适配优化针对国产昇腾S1-Pro芯片版本完成深度适配支持数据并行张量并行专家并行dp*tpep混合并行策略。昇腾芯片作为国产算力的核心代表此次适配让lmdeploy可在昇腾硬件上实现大模型的高效分布式部署充分发挥国产芯片的算力优势满足国产化替代场景的大模型部署需求。GLM4.7模型MTP支持新增对GLM4.7模型的MTPMulti-Token Prediction多令牌预测支持。MTP技术可让模型单次推理生成多个令牌大幅提升生成速度尤其适用于长文本生成、批量内容处理等场景结合lmdeploy的推理优化GLM4.7模型部署后可实现更高的生成效率。四、Bug修复全链路问题解决提升部署稳定性一日志与内核问题修复修复RepetitionPenaltyKernel中日志级别错误问题将调试日志从ERROR级别调整为DEBUG级别避免非错误日志干扰系统运行同时保留调试信息的可追溯性。修复InternVL AWQ模型的量化配置解析错误解决AWQ量化模型加载时的配置解析异常保障量化模型的正常部署与推理。二生成与配置问题修复修复XGrammar位掩码初始化错误同时在生成方法中新增对生成配置gen_config的空值检查避免因配置异常导致的推理崩溃提升生成流程的稳定性。修复会话关闭逻辑错误优化会话资源释放流程避免会话关闭时的资源泄漏与异常保障多会话场景下的系统稳定性。三授权与推理流程修复修复授权机制异常解决模型部署与推理过程中的授权验证问题保障合规使用模型的同时避免授权错误导致的服务中断。修复Pipeline模块的多个 minor 问题并补充完善测试用例提升Pipeline离线推理与批量处理的稳定性覆盖更多边缘场景。修复dllm mask在set_step操作中的逻辑错误解决掩码设置异常导致的推理结果偏差保障生成文本的正确性。四框架兼容与硬件适配修复修复与Transformers 5.0及以上版本的模型兼容问题解决因框架接口变更导致的模型加载失败确保新旧版本模型均可正常部署。修复请求中止时的异常抛出问题优化请求中断处理逻辑避免中止请求引发的系统崩溃提升服务的健壮性。修复V100显卡运行Qwen3.5-0.8B模型时的推理崩溃问题解决特定硬件与模型组合的兼容性异常保障主流显卡的部署可用性。五、其他优化工程化与生态完善提升开发与部署体验一CI与开发流程优化优化CI lint流程跳过Python维基页面中不稳定的死链接测试避免因外部链接异常导致的CI构建失败提升持续集成的稳定性与效率。集成clang-format代码格式化工具到pre-commit钩子强制统一代码风格减少团队开发中的代码格式冲突提升代码质量与可维护性。修复FA3安装问题解决FA3库安装过程中的依赖与编译异常保障依赖库的正常安装与使用。修复代码 lint 错误清理代码中的语法、格式与潜在逻辑问题提升代码的健壮性。二依赖与环境升级升级Triton与PyTorch依赖版本适配最新的算子优化与硬件支持借助新版本的性能特性进一步提升推理引擎的效率。新增 speculative decoding推测解码测试用例完善测试覆盖范围保障推测解码功能的稳定性与正确性为后续该功能的正式上线奠定基础。三Docker镜像与构建优化更新Dockerfile移除CUDA 11相关支持将CUDA 12.4升级为CUDA 12.6适配最新的NVIDIA显卡驱动与CUDA生态提升Docker部署的兼容性与性能。调整开发镜像构建策略改为手动构建开发镜像而非每个版本自动发布减少不必要的镜像构建与存储开销优化CI/CD流程。四版本收尾工作完成版本号从v0.12.1升级至v0.12.2的收尾工作同步更新相关配置文件与文档确保版本标识的一致性方便开发者识别与使用。六、版本价值与应用场景总结一核心价值提炼模型支持更全面覆盖GLM5、Qwen3.5、GLM-4.7等最新主流大模型同时兼容Qwen、Internlm、Llama等经典模型满足不同开发者的模型选型需求。推理性能更强劲TurboMind引擎深度优化、MLA内核升级、FP8量化在线支持大幅提升推理速度、降低显存占用让大模型部署更高效、低成本。兼容性更广泛适配Transformers 5.0、昇腾S1-Pro芯片、V100等主流硬件与框架打通国产化与通用化部署路径。稳定性更可靠全链路Bug修复覆盖日志、配置、推理、授权等多个环节解决部署与运行中的各类异常保障服务稳定运行。开发体验更友好CI流程优化、依赖升级、Docker镜像调整降低开发与部署门槛提升团队协作效率。二核心应用场景企业级大模型服务部署支持多模型、高并发、长文本场景适配智能客服、内容生成、数据分析等企业应用保障服务的稳定性与效率。国产化算力部署昇腾芯片深度适配满足金融、政务等领域的国产化替代需求实现安全、自主的大模型落地。个人开发者本地部署FP8量化降低硬件门槛中低端GPU即可运行大模型方便个人开发者快速验证模型效果、开发原型应用。前沿模型快速适配对GLM5、Qwen3.5等最新模型的即时支持让开发者可第一时间体验并部署前沿大模型能力。七、总结与展望代码地址github.com/InternLM/lmdeploylmdeploy v0.12.2版本作为2026年的关键迭代以模型适配、性能优化、兼容性拓展、稳定性提升为核心完成了一次全面且深入的升级进一步巩固了其在大模型部署领域的领先地位。无论是模型支持的广度还是推理性能的深度亦或是工程化的完善度都实现了质的飞跃为大模型的规模化落地提供了更强大的工具支撑。