梁文锋押注的方向,中国00后团队先交卷了!性能直逼Opus 4.8

梁文锋押注的方向,中国00后团队先交卷了!性能直逼Opus 4.8 7月15日前OpenAI CTO Mira Murati在旧金山发布了Thinking Machines Lab的首个模型Inkling。上周AI圈都在讨论一件事但大多数人只看到了一半。7月15日前OpenAI CTO Mira Murati在旧金山发布了Thinking Machines Lab的首个模型Inkling。20亿美元融资975B参数100人精英团队——硅谷最受关注的AI创业公司终于亮牌了。几乎同一天强化学习之父Richard Sutton2024年图灵奖得主年近七十宣布创办Oak Lab。老爷子的原话是「当前的深度学习方法是脆弱且低效的需要的不是修修补补而是从根基上重新来过。」不只是Sutton这么想。DeepSeek创始人梁文锋给出了几乎一模一样的判断。他把AI的发展比作一级级台阶语言模型、CoT、Agent……而Agent之后下一个必须迈过的台阶就是持续学习。他的观点是下一代模型的核心能力它必须要有持续学习的能力它才能叫下一代模型。如果先把持续学习做出来通用智能可能就很容易了。当一条技术路线同时被图灵奖得主、硅谷最受关注的AI创业公司和中国最具创新力的大模型创始人押注它就不再是一种技术选择而是一种行业共识。风向已经变了。而就在所有人盯着硅谷的时候太平洋这边一家成立不到一年的中国实验室在同一条赛道上悄悄交出了一份让人意外的答卷。Mind Lab正式发布Macaron-V1。Mind Lab成立于2025年10月是Mindverse心洲科技旗下的前沿研究实验室。整个团队三十多人成员来自xAI、DeepMind、DeepSeek、字节Seed、MIT和清华。年初完成5000万美元A轮融资美团领投蚂蚁、红杉中国、真格等跟投。请注意这个数字5000万美元后面还会用到。748B参数直上强化学习4个LoRA各管一摊先看模型。Macaron-V1分两个版本旗舰版Venti748B参数由744B的GLM-5.2基座加四个1B的LoRA组成原生2M超长上下文标准版Tall35B基于Qwen-3.7后训练Mac上就能跑。但关键不在参数——在那4个LoRA。过去LoRA是全参微调的「穷人版替身」。省钱但打折。Mind Lab把它重新定义了基座模型是「共性」LoRA是「个性」。什么意思就像所有iPhone用的都是同一个iOS系统但你装的App、你的输入法习惯、你的高频操作让你的iPhone变成了「你的iPhone」。聊天要自然共情编程要严格精确Agent要多步规划生成式UI要设计交互——挤在一套参数里训练它们会互相打架。Macaron-V1的做法简单粗暴拆。四个独立LoRA分管聊天、Agent、编程、GenUI各自训练、各自评测、各自回滚。运行时路由器动态切换——你说「帮我排日程」走Agent LoRA你说「这段代码有bug」切Coding LoRA。对用户完全透明。这套架构有个正式名字Mixture-of-LoRAMoL——不同能力在共享基座之上独立训练、灵活组合、按需调用。不是把一个模型逼成全才而是让一群专才协同作战。效果上Macaron-V1还没有在所有能力上做到最强闭源模型的水平。但在整套评测中它已经能在多数任务上打平甚至超越Opus 4.8、GPT-5.5和Gemini 3.1 Pro——尤其在生活场景、代码能力和生成式UI方向表现突出。SWE-bench Verified——业内公认最硬的代码能力评测之一Macaron-V1-Venti以85.6分登顶第一甩开第二名3分把DeepSeek-V4-Pro80.6、MiniMax-M380.5、Kimi-K2.680.2全部压在身后。更狠的是Deep-SWE专测长程复杂软件工程任务。Macaron-V1-Venti拿下58.4分第二名是它的基座模型GLM-5.2——46.2分。同一个底座经过LoRA强化学习后训练直接高出12个点。这就是后训练能带来的增量价值。更关键的是开放权重可私有化部署。闭源模型再强数据得过别人的服务器。Macaron-V1让你把模型搬回自己家里数据一个字节都不用交出去。Andrew在WAIC演讲时秀了一个案例用户拍一张打乱的魔方照片发过去模型识别状态、算法求解、生成可交互的3D还原指南——这需要视觉理解、算法、Agent工具调用和GenUI四种能力联动。还有一个容易被忽略但极其硬核的设计Model和Harness共设计。什么意思大多数模型训练和实际部署是两套环境——训练时用的工具接口、执行流程和上线后的真实环境对不上性能打折。Macaron-V1从一开始就让模型和生产环境的Harness一起训练、一起优化训练时怎么调用工具、怎么操作终端、怎么跑长程任务上线后一模一样。配套的REPL Harness让模型可以通过代码组合工具、保存中间状态、复用有效流程——不用每次从头来减少重复调用和上下文浪费。一句话这不是一个只会聊天的模型这是一个能办事的智能体。为什么它是「全球唯二」你可能会说LoRA微调有什么了不起的满大街都是。了不起的地方在两个字规模。30B模型做LoRA强化学习很多团队能做。但参数量上到万亿级别难度指数级上升。核心难点叫训推不一致。强化学习要一边训练一边推理收集反馈当万亿参数的MoE模型被切片分布到几十张GPU上训练精度和推理精度稍有偏差梯度就会漂移训练曲线直接不收敛。打个比方30人的室内乐团合奏音准差一点还能兜住。换成百人交响乐团任何一把乐器走调整场就是灾难。全球能在万亿参数规模上跑通LoRA强化学习的团队只有两家。一家是Mira Murati的Thinking Machines Lab。一家是Mind Lab。没有第三家。2025年12月Mind Lab在Kimi K2——总参1.04万亿的超大稀疏MoE模型——上跑通了LoRA强化学习。算力只有全参微调的十分之一训练曲线稳定收敛。本月的LongStraw又在固定GPU算力下把强化学习后训练推进到2M上下文。Macaron-V1就是这些积累的一次集中亮相。这条路线不止Mind Lab在走。TML首席科学家John Schulman——OpenAI联合创始人、PPO算法发明者——2025年发表了《LoRA without Regret》实验证明LoRA在大多数后训练场景下性能与全量微调完全一致。他管这叫「低遗憾区间」。行业也在用真金白银投票。上周完成15亿美元D轮的Fireworks AI估值175亿美元能托管数百个LoRATogether AI完成8亿美元C轮已把LoRA设为默认微调方式。硅谷花20亿做底座它花十分之一站在巨人肩上这里有一个非常有意思的对比。Mind Lab和TML走的是同一条技术路线但底座策略截然相反。TML因为种种原因选择自己从零训基座。Inkling975B参数45万亿token——但Murati自己也公开承认「这不是目前最强的模型。」评测显示Inkling明显弱于GLM、Kimi等中国开源模型。从零做底座让他们消耗了大量精力和算力。Mind Lab反着来。它不自己训底座直接站在中国开源模型生态的肩膀上。Kimi K2验证万亿参数LoRA RL、V1-Preview基于GLM-5.1、正式版Venti用GLM-5.2、Tall用Qwen-3.7——每次基座升级后训练的起跑线就高一层。中国开源模型已经卷到了全球接近SOTA的水平。拿这些接近天花板的底座再通过LoRA强化学习把关键能力推到真正SOTA。你不必自己种麦子就能烤出最好的面包。对比多残酷TML20亿美元融资、100人团队、英伟达千兆瓦级算力合作——Inkling能力仍落后于GLM-5.2。Mind Lab三十多人、不到5000万美元融资——Chat、Agent、Coding等多个维度做出了更强的模型。在LoRA强化学习这件事上Mind Lab可能是全球投入产出比最高的团队。没有之一。持续学习凭什么模型越用越聪明讲完技术和对比到了最核心的问题Mind Lab到底在下什么棋答案藏在Richard Sutton和AlphaGo前首席研究员David Silver联合发表的一篇文章标题里——Welcome to the Era of Experience。预训练是「数据时代」模型从人类已有的文本中学习。下一个时代是「经验时代」AI的能力不再来自已有数据而来自智能体在真实环境中的长期行动、反馈与持续学习。今天大模型的根本矛盾就在这里——训完了就冻住了。一个用户纠正了同一个错误十次下次模型还得重读聊天记录。一个Coding Agent在同一个代码库反复失败失败不会变成新能力。模型每天处理海量任务但经验全部流失了。它只是一台无限重复的推理引擎不是一个在成长的智能体。Mind Lab要做的就是打破这个死循环。他们的目标是造一台「经验智能机器」——模型离开实验室后仍然在真实世界里持续学习。经验变成新能力新能力让它解决更难的问题更难的问题又带来更丰富的经验。智能不再是一次训练的结果而成为持续生长的过程。LoRA在这里不再是「省钱工具」而是一种可写入、可回滚、可独立演化的持久状态。基座承载通用知识LoRA承载你的偏好、你的代码风格、你的业务逻辑。不是静态补丁是随交互成长的记忆。实验证明轻量适配模块压缩到基模参数的0.5%以下仍然稳定可靠——基座越强小规模更新反而越有效。这条路Mind Lab走了三年。2023年创始人Andrew与GPT-1作者Karthik Narasimhan、姚顺雨合作发表了FireAct——第一篇用参数学习提升Agent能力的工作。Agent轨迹写入参数后单次执行从9.0秒降到2.7秒。为学习付一次成本之后每次使用都是回报。从FireAct到Macaron-V1这个逻辑被放大到了万亿参数的尺度。群体智能第三条Scaling曲线持续学习只是故事的一半。Macaron-V1体现的第二个核心理念可能更颠覆——群体智能。每个模型沿着自身经历持续学习不同实例就会走向不同方向。不同用户反馈、不同任务、不同数据塑造出不同能力。同一个基座出发时间长了会长成「不同的人」。这种多样性是bug还是feature实验结果很炸。从相同的Qwen3-30B基座出发训练目标和算法完全一致只改变数据顺序和masking。单个adapter在AIME24上准确率36.44%。198个不同adapter做多数投票48.67%。同一个adapter重复采样198次最高只有43.78%。不同的「经历」带来了单个模型给不出的互补性。这不是「多试几次」——而是多样化学习路径之间产生了真正的协作效应。Andrew在WAIC把这叫做第三条Scaling曲线。第一条GPT-3式的Scale Parameters——更大的参数带来更高智能。第二条DeepSeek R1式的Scale Thinking Tokens——更多推理token带来更高智能。第三条Scale Number of Models——更多模型之间的协作带来更高智能上限。实验中模型数量从几个增到200个在对数坐标轴上性能线性提升。如果曲线成立下一步是从200推到2万、200万。Mind Lab自研的MinT平台已经建立了百万级可寻址LoRA目录。100万个LoRA共享同一个万亿参数基座。注意——这不是100万个小模型是100万个一万亿参数的大模型。人与人共享99%以上的基因组但几乎相同的生物基础没有造就相同的心智。正是智能的多样性及其协作带来了人类文明最伟大的成就。2周1000万美金ARR最快商业化验证技术路线再漂亮市场不买单就只是PPT。Mind Lab 7月初开放API商业化。结果2周1000万美金ARR。这很可能是所有模型公司从第一个模型发布开始最快实现千万美金ARR的记录。数字重要但更重要的是速度。一条技术路线能被客户这么快用真金白银投票说明它解决的是真问题、痛问题。Mind Lab卖的不只是Token。它的核心商业逻辑是客户买到的是模型在自身场景中持续学习和迭代的能力。手机厂商把产品知识训进专属LoRA耳机公司把交互偏好写入模型状态——核心数据不必交给基模公司重训客户自己掌握控制权。韶音科技、AI硬件初创Odyss、某头部手机厂商已经在合作名单上。API调用结构也说明问题20%聊天30%Agent工作流30%代码生成剩余来自GenUI——场景分布均衡不是靠单一爆款撑起来的虚假繁荣。旗舰版6美元/百万token标准版4美元极速版2美元。Mind Lab给出的愿景只有一句话会用Token就能训Token。训练模型这件事最终要像调用模型一样简单。不需要大量售前不需要定制人力。持续学习本身就是可规模化的模型能力。题门推开了Richard Sutton在多伦多喊出「经验时代」。梁文锋认为必须有持续学习能力才能叫下一代模型。Mira Murati在旧金山搭万亿参数LoRA强化学习基础设施。Fireworks AI估值175亿美元。所有人都押同一个方向模型应该在部署后继续学习。LoRA是让这件事在万亿参数尺度上可行的关键技术。Mind Lab是这条赛道上最年轻的选手。但起跑姿态可能最高效——不做底座站在中国开源生态上三十多人和不到5000万美元融资做到了和硅谷百亿级团队同一水位的技术能力。这背后是一个简单但深刻的判断大模型竞争的终局不在「谁训出最大的底座」而在「谁能让模型持续变聪明」。预训练是一次性的基建。持续学习才是真正的护城河。Mind Lab想造的是一台经验智能机器——模型离开实验室之后仍然在真实世界里持续学习越用越聪明。当足够多这样的智能开始协作一条通向更高智能的新路线就会打开。Murati用20亿美元和100人的团队在旧金山推这扇门。而先把门推开一条缝的是太平洋这头一家站在中国开源生态肩膀上的年轻实验室。