最近国产大模型集体刷屏。Kimi K3,目前最大的开源模型;GLM-5.2,MIT 许可能商用;还有 DeepSeek-V4,一个个都号称 coding 能力屠榜,某些项超过了 GPT、超过了 Claude。榜分是好看。但做过开发的都知道,榜分和「真写代码好不好用」是两回事。所以我没看榜,直接调它们的 API,拿两道有陷阱的真实编程题,让它们真跑一遍,和 Claude 同题对比,再跑测试用例验证对错。今天(8 月 1 号)真调的,一手结果。先说能力。结论是:真追平了。我出的第一道题是解析时长字符串(把「1h30m」转成 5400 秒这种),里头埋了八个边界陷阱:顺序错、重复单位、纯数字没单位、负数、未知单位、空格、大写……一共十九个测试用例。结果:Kimi K3、DeepSeek-V4-Pro、智谱、还有 Claude,全部满分十九比十九。Kimi 的编程专用版 K2.7-code 差一个,唯一错那个还是它主动把前后空格去掉了(算它更宽容,不算错)。第二道题更刁一点,版本号比较(「1.2.10」和「1.2.9」谁大),埋了前导零、段数不同、要按数值比、别按字符串比这几个坑。Kimi K3 和 DeepSeek-V4-Pro 给出来的代码,和 Claude 几乎一字不差,都对。所以「国产模型 coding 追上第一梯队」,不是营销话,我实测确实追平了。这类有明确对错的编程题,它们和 Claude 一个水平,答案又对又简洁。但我得诚实说一句:这两道常规题,我没测出谁「超过」谁。大家都对、都简洁,是打平,谈不上碾压。要真分出高下,得上那种极难的题;可对大多数人的日常编程,这个水平已经够用了,和 Claude 没什么差别。真正值钱的发现,在第二部分:能力追平了,速度和可用性,差得远。这是榜分不会告诉你的。先说 GLM-5.2,它是这波里 coding 榜单最亮眼、最高调喊「超过 Claude」的一个。可我真调它,智谱官方接口直接 429,限流;换火山的免费接入点,等了两分钟,一个字都没出来。榜分再高,免费渠道你根本用不上。我退而调了智谱能连通的 glm-4.7,满分,三十八秒,说明智谱的模型能力是在线的,但那个屠榜的 5.2,普通开发者想免费用,门都没有。DeepSeek-V4-Pro,答案对,但它是个「先想再答」的推理模型,一道题要想二十多秒。Kimi 的编程专用版 K2.7-code,也对,可一道简单题它要五十七秒,比通用的 K3 还慢一倍多。这轮里综合最好的是 Kimi K3,十几到二十几秒,又快又对,API 也稳。所以给要选模型的开发者一句实在话:别拿榜分选模型。能力这一层,这些国产模型都追平了,榜上差那零点几分,你接进日常工作流根本感觉不到。真正决定你用得爽不爽的,是另外几件榜单不写的事:接进来快不快、稳不稳、免费额度够不够、会不会动不动限流、真花钱多少钱。GLM-5.2 榜分屠榜但免费调不出来,Kimi K3 榜分也许低半分但又快又稳又能白嫖,你选哪个?做过项目的都知道选后者。榜单是给发布会看的,你的工作流才是真考场。这些国产新模型值得上手,但别冲着「超过 Claude」这句宣传去,冲着「够用、够快、够稳、能白嫖」去。挑一个真接得进你活里的,比挑一个榜第一的,实在得多。
国产新模型说写代码超了 Claude,我真调了一遍
最近国产大模型集体刷屏。Kimi K3,目前最大的开源模型;GLM-5.2,MIT 许可能商用;还有 DeepSeek-V4,一个个都号称 coding 能力屠榜,某些项超过了 GPT、超过了 Claude。榜分是好看。但做过开发的都知道,榜分和「真写代码好不好用」是两回事。所以我没看榜,直接调它们的 API,拿两道有陷阱的真实编程题,让它们真跑一遍,和 Claude 同题对比,再跑测试用例验证对错。今天(8 月 1 号)真调的,一手结果。先说能力。结论是:真追平了。我出的第一道题是解析时长字符串(把「1h30m」转成 5400 秒这种),里头埋了八个边界陷阱:顺序错、重复单位、纯数字没单位、负数、未知单位、空格、大写……一共十九个测试用例。结果:Kimi K3、DeepSeek-V4-Pro、智谱、还有 Claude,全部满分十九比十九。Kimi 的编程专用版 K2.7-code 差一个,唯一错那个还是它主动把前后空格去掉了(算它更宽容,不算错)。第二道题更刁一点,版本号比较(「1.2.10」和「1.2.9」谁大),埋了前导零、段数不同、要按数值比、别按字符串比这几个坑。Kimi K3 和 DeepSeek-V4-Pro 给出来的代码,和 Claude 几乎一字不差,都对。所以「国产模型 coding 追上第一梯队」,不是营销话,我实测确实追平了。这类有明确对错的编程题,它们和 Claude 一个水平,答案又对又简洁。但我得诚实说一句:这两道常规题,我没测出谁「超过」谁。大家都对、都简洁,是打平,谈不上碾压。要真分出高下,得上那种极难的题;可对大多数人的日常编程,这个水平已经够用了,和 Claude 没什么差别。真正值钱的发现,在第二部分:能力追平了,速度和可用性,差得远。这是榜分不会告诉你的。先说 GLM-5.2,它是这波里 coding 榜单最亮眼、最高调喊「超过 Claude」的一个。可我真调它,智谱官方接口直接 429,限流;换火山的免费接入点,等了两分钟,一个字都没出来。榜分再高,免费渠道你根本用不上。我退而调了智谱能连通的 glm-4.7,满分,三十八秒,说明智谱的模型能力是在线的,但那个屠榜的 5.2,普通开发者想免费用,门都没有。DeepSeek-V4-Pro,答案对,但它是个「先想再答」的推理模型,一道题要想二十多秒。Kimi 的编程专用版 K2.7-code,也对,可一道简单题它要五十七秒,比通用的 K3 还慢一倍多。这轮里综合最好的是 Kimi K3,十几到二十几秒,又快又对,API 也稳。所以给要选模型的开发者一句实在话:别拿榜分选模型。能力这一层,这些国产模型都追平了,榜上差那零点几分,你接进日常工作流根本感觉不到。真正决定你用得爽不爽的,是另外几件榜单不写的事:接进来快不快、稳不稳、免费额度够不够、会不会动不动限流、真花钱多少钱。GLM-5.2 榜分屠榜但免费调不出来,Kimi K3 榜分也许低半分但又快又稳又能白嫖,你选哪个?做过项目的都知道选后者。榜单是给发布会看的,你的工作流才是真考场。这些国产新模型值得上手,但别冲着「超过 Claude」这句宣传去,冲着「够用、够快、够稳、能白嫖」去。挑一个真接得进你活里的,比挑一个榜第一的,实在得多。