香蕉和GPT Image之外的第3条路:华人15人团队造出AI生图黑马

香蕉和GPT Image之外的第3条路:华人15人团队造出AI生图黑马 允中 发自 凹非寺量子位 | 公众号 QbitAI一支不到15人的团队把图像模型做到了全球第三。5月6日凌晨Luma AI正式宣布开放Uni-1.1 API。几乎在同一时间由第三方机构Arena.ai发布的图像生成榜单完成了最新一轮的“大洗牌”——Luma凭UNI-1.1与UNI-1.1-Max直接冲进全球前三仅次于OpenAIgpt-image-2和Googlenano-banana-2。△Arena.ai图片生成榜单把Microsoft AI、Reve、xAI等玩家……悉数甩在身后。这个排名的含金量不言而喻Arena.ai采用的是一套依靠用户盲测投票产出的ELO评分系统没有官方公关或自报数据每张图都是由真实用户在不知道模型来源的前提下对两份生成结果二选一投出来的。这意味着在真实场景下图像模型Uni-1.1的审美和输出质量已经成了OpenAI和Google之外的最优解。随API、排名榜单一同发布的还有两项硬指标值得一起看价格腰斩2K分辨率单图最低$0.0404合人民币0.2755元对比Nano Banana级别模型直接砍半落地飞快阿迪达斯、马自达以及阳狮集团等广告大户已经带头签了单。更值得注意的是一个原本预算1500万美元、周期一年的广告campaign用Luma Agents跑了40小时、花了不到2万美元不仅拓展成多国本地化版本还通过了甲方内审。这已经不是在讨论“图画得好不好看”了。推理和生成住进同一个模型很多人最初看到Uni-1第一反应觉得这是又一个图像模型。但Luma这次发布的真正卖点并不在像素质量本身而是它把推理reasoning和生成generation放进了同一个模型。传统图像模型的工作流是用户写prompt → 模型直接出图 → 不满意→ 换prompt重抽。整个过程里模型理解了什么和模型画了什么是两件事企业拿这种AI工具去跑品牌投放最大的痛点是不可控同一个角色到了下一张图就变样、品牌色每次都飘、跨市场素材风格各跑各的。而Uni的架构改变了这件事。它采用decoder-only自回归Transformer文本token与图像token共享同一个序列——也就是说模型不是先翻译再画而是同时跨模态推理构图、空间、品牌一致性这些约束是在像素生成之前就已经在结构层面被求解。API层面的体现就是两个端点Reasoning端点解构指令、规划构图、锁定品牌/角色/产品约束Generation端点在推理结果之上完成像素渲染。这套设计的产业意义是把创意可控性从prompt工程的玄学变成了一组能写进生产pipeline的API契约。谁在用广告巨头、运动品牌、素材平台Luma这次没有把Uni-1.1当成开发者玩具发布而是直接把企业客户名单亮了出来。1、广告与营销侧Publicis Groupe阳狮全球领先的广告与传播集团和Serviceplan欧洲最大的自主经营广告代理集团把Luma Agents基于Uni-1.1部署到从策略、创意开发到生产的全流程。一个被多次援引的标杆案例是把某品牌原计划1500万美元、一年期的广告campaign用40小时、不到2万美元合人民币约13.6万元的成本拓展为多国本地化版本且通过了甲方内部质量审核。Adidas、Mazda把Uni-1.1接入品牌内容生产流水线用于跨市场视觉素材的批量生成与一致性维护。2、素材与开发者生态侧Envato、Comfy、Runware、Flora、Krea、Magnific、Fal、LovArt等创作者平台与AI工作流公司已基于Uni-1.1 API发布了集成。Luma创始人兼CEO Amit Jain把这件事概括为用语言思考用像素想象与渲染这就是像素中的智能intelligence in pixels。三个最先被产业验证的应用方向从已落地的客户案例倒推Uni-1.1 API在以下三个方向上已经有了清晰的ROI模型1. 广告本地化一支在纽约拍的广告主视觉要在东京、利雅得、巴黎、上海各发一版。传统流程要重拍、重P、重做合规审查单条预算从几万到几十万美元不等。Uni-1.1单次API调用支持最多9张参考图联合输入把品牌主形象、文字、产品、地域元素作为模型层级的硬约束传入多语言渲染含中文、阿拉伯文等非拉丁字符一次到位。Publicis案例里40小时 vs 一年的差距就是从这里挤出来的。2. 电商与产品可视化电商场景的痛点是量大、SKU杂、还要保证产品本体一致。开发者可以把产品照、面料样、场景参考一并喂给API单图成本最低$0.0404做到按页/按用户/按地域实时生成产品图而不是一次拍完反复套模板。Luma官方把这种用法叫作reference-grounded brand workflows at scale即参考图作为模型级约束把视觉身份锁在所有channel里。3. 角色与IP一致性游戏美宣、漫画、影视前期、虚拟代言——这些场景需要同一个角色穿越不同场景、姿态、光线但身份信息必须稳如老狗。Uni-1.1的多参考图机制 句子级编辑按句改图默认保留其他元素让这件事可以做成确定性流水线而不是反复抽卡赌运气。能力速览3个例子看懂边界单图直出一整张「2036年新闻网站」PromptGenerate a news website page from the year 2036, featuring relevant news stories and ad blocks designed not for humans, but for AI agents who have evolved into distinct personalities. Both the website and all the advertisements featured on it should be in English.生成一个来自2036年的新闻网站页面其中包含相关的新闻以及专门为Agent设计的广告模块。这些Agent已经进化出各自独特的“人格”。整个网站内容以及所有广告都必须使用英文呈现。一张图测出一个模型的「真实成色」——Uni-1.1单次推理生成了一整页可读的新闻网站包括报头、栏目导航、突发新闻条、头条主图、多栏正文、署名/时间戳、面向AI受众的横幅广告位、页脚链接十几类版式元素同框每一类的英文文本都是真实可读的。而不是图像模型常见的「远看OK、但近看全是乱码」。这样的复杂版面长文本任务在传统pipeline里要由文本编辑、OCR一致性、版面结构多个模块联合完成Uni-1.1把它们捏在了一次推理里。多参考图品牌logo真人融合两只猫一位真人Luma logo4张参考图融合成一个有逻辑的会议场景。GPT Image 1.5把参考图当贴图直接嵌入了PPT区域Uni-1在语义层面完成了融合这是品牌campaign里产品代言人场景logo组合最常见的需求。多轮编辑三连改不丢主体去掉前面那只熊→加一个黑色布帘→改成黑白照片三轮指令叠加主体一致性和空间关系在每一轮都没崩。这是按句编辑在生产环境里最值钱的能力产品经理可以像编辑文档一样迭代视觉。注Uni-1.1还支持中文文字渲染、UV贴图、草稿转漫画、风格迁移、跨年龄角色故事板等更多场景本文不再展开。价格把图像生成的边际成本打到地板API直接对企业敞开了两档计费Build计划按量计费Scale计划预留吞吐最低8单元起订Luma的官方说法是价格与延迟均不到同类模型的一半——这一点在第三方榜单和早期接入客户的成本对比里已被实证。SDK覆盖Python/JavaScript/TypeScript/Go/CLI从platform.lumalabs.ai拿key即可接入。团队不到15人干到全球第三DDIM之父CVPR最佳论文作者带队Uni-1的核心研究团队不到15人由两位华人学者领衔宋佳铭Jiaming Song清华本科、斯坦福博士。代表作DDIMDenoising Diffusion Implicit Models是扩散模型采样加速的奠基工作之一被Stable Diffusion、DALL·E等系统广泛采用沈博魁William Shen斯坦福本科及博士。代表作获CVPR 2018 Best Paper Award和RSS 2022 Best Student Paper Award。一位深耕“生成”、一位精于“理解”。这种互补的阵容恰好对应了Uni-1.1“脑手合一”的架构让模型在落笔画图之前先学会像人类一样思考构图和品牌逻辑。在Google、OpenAI主导的图像赛道里一支不到15人的团队把API定价压到同行一半还顺便在Arena.ai上完成了对一众大厂的“越级反杀”是这次发布另一个值得记一笔的产业信号。API发布前后Luma团队在X平台上贴出了三条短评Luma首席科学家宋佳铭说我们用的算力规模可能会让你感到意外。为我们团队感到骄傲。稍微更详细的报告很快会发布。Uni-1研究负责人沈博魁William Shen说UNI-1的首发让我们成了除OpenAI与Gemini App之外排名最高的实验室。对一个第一代统一图像模型来说这个起点不算差。顺带一提这次榜单更新里GPT Image 2的ELO比之前掉了110分不太确定中间发生了什么……而Luma模型产品lead Barkley Dai说Luma现在是Arena.ai第三名了。GPT-Image 2级别的智能Midjourney级别的审美价格只有Nano Banana的零头。两条背后的潜台词是Uni-1.1是Luma统一智能路线的第一代产品而它是以第一代的身份直接干到Arena.ai第三名把价格压到同类一半。下一步从图像到“看说推想”的连续流按照Luma的路线图Uni-1.1只是统一智能的第一代落地形态。下一步他们会把这套统一框架从静态图像扩展到视频、语音和交互式世界模拟——目标是构建一个能在连续流里看、说、推理、想象的多模态系统。其CEO Amit Jain对此的总结是统一智能的真正价值不是更好看的图而是模型既能理解又能生成之后AI第一次真正具备了端到端完成创意工作的能力。API入口lumalabs.ai/api官方公告lumalabs.ai/news/uni-1-1-api接入文档platform.lumalabs.aiSDKPython/JavaScript/TypeScript/Go/CLI