这项由阿里巴巴Qwen团队完成的研究发表于2026年7月论文以技术报告形式公开编号为arXiv:2607.11699有兴趣深入了解的读者可通过该编号查询完整论文。你有没有过这样的经历脑子里隐约有一段旋律或者特别想要一首符合某个心情的歌却苦于不会乐器、不懂作曲只能干着急又或者你特别喜欢某首老歌的旋律却觉得原来的演唱风格不合胃口想要一个更清新的、更摇滚的版本这两个听起来颇为奢侈的愿望Qwen团队推出的Qwen-Music或许正在把它们变成现实。Qwen-Music是一个大规模音乐生成系统核心能力有两项一是根据文字描述、歌词和音乐属性从零创作完整歌曲二是接收一首参考歌曲后以不同的风格和声线重新演绎这首歌也就是翻唱生成。更难得的是这套系统在专业人士的盲听测试中击败了MiniMax Music 2.6、MiniMax Music 2.5、Mureka V8和Suno V5等商业领先产品与Suno V5.5持平。在外部权威排行榜Artificial Analysis Music with Vocals Leaderboard上Qwen-Music以JazzCat的化名参与评测在英文演唱音乐生成领域名列第三。要理解这件事的难度不妨把创作一首完整歌曲比作烹饪一道复杂的宴席菜。你不仅要选好食材确定歌词、旋律和风格还要掌握火候节奏和动态考虑摆盘混音和立体声并且让整道菜从头到尾保持风味统一歌曲结构的连贯性更关键的是宴席往往长达数分钟每一口味道都不能走样。过去的AI音乐系统要么只会短片段要么缺乏演唱声线要么生成的音频质量粗糙Qwen-Music试图在这些方面同时突破。---一、从声音到语言给音乐找一种AI能读懂的文字要让AI创作音乐首先得解决一个根本问题AI最擅长处理的是文字序列而音乐是随时间流动的连续声波。怎么架桥答案是把音乐也变成类似文字的符号序列。Qwen-Music-Tokenizer承担的就是这个转换工作。把它理解成一位速记员一段几分钟的歌曲经过它的处理会被压缩成一串以每秒25个符号速度排列的整数序列每个符号被称为音乐语义令牌Music Semantic Token。这个速率意味着每隔40毫秒记录一个符号就像把一部电影每隔一小段截一帧缩略图既保留了内容骨架又大幅减少了数据量。这位速记员本身的训练经历了四个阶段每个阶段都在为下一阶段铺路。第一阶段是自学用BestRQ这种自监督学习方法让模型随机遮住音频的某些片段然后猜被遮住的内容是什么就像做完形填空题一样。目标答案由一个固定随机编码器给出不需要人工标注整个阶段使用双向注意力机制也就是模型在猜测时可以参考前后的上下文。第二阶段叫做因果适应在第一阶段的基础上把双向注意力改为单向的因果注意力也就是只看左边过去、不看右边未来。为什么要这么做因为后续的音乐生成模型是自回归的像打字机一样从左到右逐字生成训练时必须模拟这种只有过去没有未来的条件。与其从头训练一个单向模型不如直接在已训练好的双向模型上微调这样既省计算资源又保留了已学到的音乐知识。第三阶段叫做多任务监督微调在速记员的工作台上同时接了三个评分器——一个检查歌词是否被正确记录利用CTC损失做歌词转录一个检查旋律轮廓是否被保留梅尔频谱重建一个检查和声信息是否在场色度特征重建。这三个评分器同时给分倒逼速记员记录的符号必须同时携带语义、旋律和和声信息而不仅仅是抽象的音频特征。这个阶段还去掉了遮掩操作让模型看完整音频并且对整首歌最长300秒进行学习而非短片段。第四阶段是真正引入字符表插入一个向量量化VQ瓶颈层把连续的特征向量强制映射到一本包含32768个条目的码本上每个条目就是一个整数编号最终产出的就是那串25Hz的整数序列。为了防止突然插入量化层导致训练不稳定研究者设计了一个平滑过渡机制先把量化后的特征和未量化的特征按一定比例混合随训练进行逐渐把比例调向全量化同时冻结底层参数只训练量化器和上层之后再逐步解冻整个网络。最终这套码本的利用率超过99%几乎每个字符都被用上没有浪费。---二、AI作曲家如何先打草稿再下笔旋律先行的思考链有了音乐的文字表示下一步就是训练一个AI作曲家能根据用户的文字描述和歌词生成这串符号序列。这个作曲家叫做Qwen-Music-LLM以一个30亿参数的语言模型Qwen3.5-Omni的密集变体为基础进行训练。这里存在一个很微妙的挑战。当用户说给我写一首温暖的民谣歌词是关于雨天的思念这句话确定了风格和情感却对旋律本身没有任何约束。AI必须同时决定旋律走向、伴奏编排、段落结构以及如何把这一切组合成几千个符号。这就像让一个厨师在没有菜谱的情况下从选材到装盘一气呵成创作一道全新的菜——难度相当高且容易出现前后不一致的问题。研究团队的解决方案叫做Melody-CoT即旋律思维链。这个机制的灵感来自大语言模型里常用的链式推理Chain-of-Thought先让模型写出推理过程再给出最终答案推理过程本身会引导答案更准确。对应到音乐生成就是先让模型生成一段旋律草稿再根据这份草稿生成完整的音乐符号序列。这就好像作曲家在正式谱曲之前先用口哨哼出旋律的大致走向心里有底了再落笔。旋律草稿的表示方式经过精心设计核心是一个叫做旋律令牌Melody Token的东西。研究者先用RMVPE算法从音频中提取50Hz的人声音高曲线然后以8倍降采样将其压缩至6.25Hz的序列。降采样的好处是过滤掉颤音、装饰音等演唱细节保留的是旋律的骨架轮廓。更重要的是音高值被转换为相对MIDI表示把所有有声帧的MIDI音高中位数作为基准每个帧的值都减去这个基准得到相对半音偏移量映射到0到255的256个整数中255代表无声帧。这样做的目的是抹去绝对音域和调性信息让旋律条件只传递形状而不泄露原唱的音域或者歌曲的调。在训练时模型会接触三种序列模式的混合。纯文本转音乐模式直接从标签和歌词生成音乐符号序列段落级旋律模式在音乐符号序列之前插入每个有歌词段落的旋律令牌每段旋律前标注段落标签比如[verse]或[chorus]独特段落级旋律模式则更进一步当一首歌有多个副歌时不是把每个副歌的旋律都写出来而是只随机选取一个作为代表。这种设计有三重好处缩短了旋律草稿的长度、提高了训练数据的多样性以及鼓励模型把旋律理解为可复用的创作素材而非逐帧复制的模板。对于翻唱生成场景旋律令牌从参考歌曲中提取后连同目标风格标签和目标歌词一起作为前缀输入模型模型则在遵循旋律轮廓的前提下按照目标标签生成新的音乐符号序列。通过统一的Melody-CoT机制原创生成和翻唱生成在同一个模型中实现不需要两套不同的系统。---三、从符号草稿到立体声波渲染器的三道工序音乐语义符号序列只是一份粗略的乐谱草稿要让它变成能放入耳机里聆听的高保真立体声音频还需要Qwen-Music-Render的三道工序。打个比方这就像把一张粗略的建筑蓝图最终建成可以入住的精装房屋。第一道工序是扩散变换器Diffusion TransformerDiT。这是一个13亿参数的神经网络输入是充满噪声的连续潜在向量经过多步去噪后输出干净的潜在表示。网络由32个变换器块组成每块包含自注意力层、交叉注意力层和前馈层全部由扩散时间步长参数调制。关键在于这个模型同时接收两类条件信息一是语言模型生成的音乐语义符号序列帧对齐地嵌入输入二是重写后的文字条件包括音乐标签如女声、温暖、民谣、吉他和钢琴和歌词。文字条件通过一个冻结的Qwen3-Embedding-0.6B文本编码器提取特征再通过交叉注意力注入每个变换器块。在推理时DiT使用分类器自由引导CFG技术同时运行有条件和无条件两路最终输出是两者的加权组合可以在生成质量和多样性之间调节平衡。研究发现最优策略是在无条件路径中只去掉文字条件而保留音乐语义符号序列这样音乐结构由符号序列主导文字条件则作为补充的语义引导比两者都去掉或者只去掉符号序列效果更好。第二道工序是Spec-VAE解码器。这是一个频谱域的变分自编码器将DiT输出的潜在向量解码回复杂频谱即STFT的实部和虚部。编码器将48kHz立体声音频的复数频谱压缩成128维的25Hz潜在向量压缩比高达192倍解码器做逆变换从潜在向量重建复数频谱再经过逆短时傅里叶变换iSTFT得到波形。在这个解码器里研究者还引入了一个新颖的激活函数叫做Spec-SnakeBeta。它脱胎于BigVGAN中使用的SnakeBeta激活函数不同之处在于把参数从按通道定义改为按频率轴定义。每个频率槽对应一个固定的物理频率因此可以为不同频率设计不同的非线性特性。初始化时参数按对数频率先验设置让高频区域具有更强的周期性调制能力模型再在此基础上学习调整。实验显示学习后的参数在0到5kHz的低中频区间偏离初始值最大说明这个频段最需要定制化的非线性处理。第三道工序是波段模式精修器Band-Mode Refiner。这是一个轻量级的ConvNeXt-1D模块附加在解码器输出之后专门修复解码器留下的频谱残差误差。精修器对不同频段采用不同的修正策略低频段只修正相位中频段同时修正幅度和相位高频段只修正幅度。这种设计的依据是不同频段的误差模式不同分开处理更有针对性。为了保证训练稳定精修器的初始权重全部设为零这意味着在训练开始时精修器的输出和解码器完全一致随训练逐步发挥作用不会破坏解码器已经学到的能力。整个渲染器的训练也分三个阶段先做纯重建的Spec-VAE预训练再引入波形域对抗训练加入多尺度STFT判别器和CQT判别器提供反馈最后冻结Spec-VAE编解码器专门训练精修器同时加入频谱域判别器。这种渐进式训练策略在192倍压缩率的高难度条件下维持了训练稳定性。---四、超过五百万小时的听歌自学如何训练一个懂音乐的AI有了架构还需要数据和训练策略。Qwen-Music-LLM的训练数据超过500万小时的多语言音乐覆盖数百种语言。如何从这座庞大而质量参差不齐的音乐山脉中提炼出一个高水准的生成模型是训练设计的核心问题。研究团队的策略是质量分级预训练课程。他们首先训练了一个内部评分模型基于平均意见分即MOS由具有专业音乐背景的人工评分员标注训练数据模型学会预测每首歌的整体音乐质量。然后在每个音乐类型内部按评分百分位把数据分成七个质量桶Q1到Q7其中Q1是顶尖的10%Q7是最末的1%。去掉Q7之后用Q1到Q6六个档次的数据分三个阶段训练。第一阶段使用Q3到Q6的数据也就是中等偏下质量的大量数据。目标是让模型先学会从文字条件映射到音乐符号序列的基本能力建立对各种风格、语言和伴奏形式的广泛认知。训练过程中采用动态质量采样策略开始时多用低质量数据随训练进行逐渐增加高质量数据的比例就像学徒先从最基础的大量案例中积累经验再逐步接触精品。第二阶段使用Q2数据配合学习率衰减这是一个质量整合阶段。经过第一阶段的广泛学习后模型开始在更稳定、更高质量的数据上巩固改善音乐结构的连贯性同时减少低质量数据引入的噪声。第三阶段专注于Q1顶级数据并从全库中精选高质量样本补充。这个阶段进一步提升可控性和指令遵循能力同时保持各类型和语言的均衡避免模型只在热门流行风格上表现出色。完成预训练后还有三个阶段的后训练对齐。第一阶段是监督冷启动用经过精心挑选的高质量数据做监督微调确保模型在风格标签和歌词标注方面足够准确为后续基于奖励的优化奠定干净的起点。第二阶段是迭代离线偏好对齐让当前模型在多样化提示下生成候选由音乐质量评分模型和指令遵循奖励模型打分构建偏好对再用直接偏好优化DPO训练模型。这个生成—评分—构建偏好对—优化的循环多轮迭代逐步提高音乐性和可控性。第三阶段是在线音乐性优化改用在线群序列策略优化GSPO直接从当前策略的采样中学习优化序列级别的奖励。相比离线DPO这种方式能更充分地探索新的优质生成方向在前两个阶段已经打好基础的情况下专注于音乐细节和音频质量的进一步打磨。---五、专业评委的考卷成绩单全面评测的结果揭晓研究团队对Qwen-Music进行了系统全面的评测兼顾主观偏好和客观指标既有人耳判断也有算法评分既有原创生成也有翻唱生成。在文本转音乐的主观评测中50位具有音乐创作或制作经验的专业评分员进行了盲听A/B测试。每一对比较中两首歌匿名随机呈现评分员只根据整体聆听体验选择更好的那首顺序也随机打乱以消除位置偏见每对由三位评分员独立打分。结果显示Qwen-Music的胜率对MiniMax Music 2.6达到66.7%对MiniMax Music 2.5达到59.1%对Mureka V8为58.3%对Suno V5为55.4%对Suno V5.5为50.3%与这个业内最强竞争对手基本持平。按音乐类型分析的Bradley-Terry评分一种从两两对比数据中估算能力的统计方法显示Qwen-Music在8个类型中的5个电子/EDM、爵士蓝调、朋克硬核、RB/灵魂乐、摇滚获得最高评分在流行和嘻哈/说唱中居第二在金属/硬摇滚中保持竞争力。这说明Qwen-Music的优势并非集中在某一两个特定类型而是相对均衡地分布于各种风格。在客观指标评测中测试集包含300条中文和300条英文提示所有系统使用AI生成的歌词和均衡分布的音乐标签进行评测条件完全一致。使用的评测框架包括SongBench评估旋律、编排、音乐性、人声质量、乐器质量、混音和结构七个维度、SongEval评估连贯性、音乐性、记忆点、清晰度和自然度和AudioBox-Aesthetic评估内容愉悦感、内容实用性、制作复杂度和制作质量。在这16个评测维度中Qwen-Music拿下13个第一其余3个表现也处于竞争性水平。在可控性方面Gemini 3.1 Pro对生成结果在流派、情绪、乐器、人声性别和人声音色五个维度分别打1到10分。Qwen-Music的平均得分为8.44与所有系统中最高分的差距不超过0.04分在人声性别遵循上拿到最高分在情绪和音色控制上名列第二。在歌词清晰度方面使用Qwen3-ASR识别生成音频中的歌词并与输入歌词对比计算音素错误率Qwen-Music的得分是6.10在所有系统中排名第二最低为Suno V5.5的4.19。对于翻唱生成评测研究团队构建了两个测试集一个使用AI生成的参考歌曲Suno V5.5和Mureka V8各出一部分另一个使用真实世界的流行歌曲作为参考旋律各包含100条英文和100条中文样本。旋律保留程度通过旋律平均绝对误差Melody MAE衡量将生成歌曲和参考歌曲都转换为相对MIDI表示用动态时间规整对齐后计算半音级别的平均误差误差越小说明旋律保留越好。在AI生成参考集上Qwen-Music段落级旋律模式的Melody MAE为1.48优于Suno V5.52.00、Suno V51.87和MiniMax Cover1.89。独特段落级旋律模式的Melody MAE为1.80不如直接段落级但在风格标签遵循方面有显著提升五个标签维度的得分都大幅高于段落级模式。在真实流行歌曲参考集上两种Qwen-Music模式均优于MiniMax Cover唯一与Suno系统比较的对象因为Suno不接受真实歌曲输入在SongBench七个维度、PER和大多数标签遵循指标上段落级模式在旋律保留上保持最佳Melody MAE 1.44。渲染器专项评测使用包含546首歌的Song Describer数据集对比Qwen-Music的Spec-VAE、Spec-VAE精修器与其他四个开源音频VAE系统。在频谱重建方面Spec-VAE精修器取得最佳STFT距离0.870和STFTlog1p0.075在梅尔频率重建方面精修器将梅尔距离从0.572大幅降至0.461是所有系统中最低在立体声图像质量方面取得最佳跨通道相位相干性CCPC 0.973与εar-VAE并列和最佳频谱声像误差0.264。---说到底Qwen-Music做的事情可以用一句话来概括它把写歌这件需要天赋、技艺和大量时间积累的事情拆解成一套可以被计算机系统模拟的流程然后在500万小时的音乐数据上把这套流程训练到足够好。这对普通人意味着什么意味着以后你只要能描述出自己想要什么样的音乐系统就能帮你把它变成真实可听的歌曲意味着你喜欢某首歌的旋律但不喜欢它的风格可以把它改编成你想要的样子意味着独立音乐人、播客创作者、游戏开发者等各类内容创作者在音乐配套方面的门槛将大幅降低。当然Qwen-Music并非没有局限。在翻唱生成的评测中商业竞品在SongBench的旋律和编排等整体音乐质量指标上仍然占优在歌词清晰度上仍然逊于最优秀的对手对于长达数分钟的歌曲如何在整个结构层面保持更灵活的创意以及如何实现更细腻的演唱表现力都是研究团队自己在结论部分提出的未来课题。一个值得思考的问题是当AI能够创作出专业级别的音乐那些以音乐创作为生的人未来的角色会如何演变大概率的答案不是被替代而是被解放——从重复性的技术性工作中解放出来更专注于那些只有人类才能带来的情感深度和创造性突破。毕竟Qwen-Music再强也只是在学习和模仿人类已经创作过的音乐而人类能创作出Qwen-Music从未听过的东西。有兴趣了解更多技术细节的读者可以通过arXiv编号2607.11699查阅这篇由阿里巴巴Qwen团队发布的完整技术报告。---QAQ1Qwen-Music生成的音乐质量和Suno这类商业产品比怎么样A在专业评分员的盲听对比测试中Qwen-Music对Suno V5的胜率为55.4%与Suno V5.5基本持平50.3%对49.7%。在客观指标方面Qwen-Music在16个评测维度中的13个取得第一尤其在旋律、编排、音乐性等维度领先。不过Suno V5.5在歌词清晰度上仍然保持优势两个系统各有所长。Q2Melody-CoT旋律思维链机制具体是怎么工作的AMelody-CoT是一种先画草图再落笔的机制。模型在生成完整音乐符号序列之前会先生成一段旋律令牌序列作为草稿描述人声旋律的大致走向。旋律令牌用相对MIDI音高表示抹去了绝对音域信息只保留旋律形状。这份草稿起到打底稿的作用帮助模型先确定音乐结构再填充完整细节从而提升生成歌曲的连贯性和旋律质量。翻唱时这份草稿直接从参考歌曲中提取。Q3Qwen-Music翻唱生成时如何平衡旋律保留和风格自由度AQwen-Music提供两种翻唱模式。段落级旋律模式为每个有歌词的段落都提供旋律令牌条件旋律保留更精准Melody MAE 1.48低于竞品但对目标风格的遵循相对弱一些。独特段落级旋律模式每种段落类型如副歌只提供一段代表旋律条件更宽松旋律保留略低Melody MAE 1.80但风格标签遵循大幅改善。用户可以根据需要选择更贴近参考旋律还是更自由地演绎目标风格。
阿里巴巴Qwen团队打造AI音乐创作神器
这项由阿里巴巴Qwen团队完成的研究发表于2026年7月论文以技术报告形式公开编号为arXiv:2607.11699有兴趣深入了解的读者可通过该编号查询完整论文。你有没有过这样的经历脑子里隐约有一段旋律或者特别想要一首符合某个心情的歌却苦于不会乐器、不懂作曲只能干着急又或者你特别喜欢某首老歌的旋律却觉得原来的演唱风格不合胃口想要一个更清新的、更摇滚的版本这两个听起来颇为奢侈的愿望Qwen团队推出的Qwen-Music或许正在把它们变成现实。Qwen-Music是一个大规模音乐生成系统核心能力有两项一是根据文字描述、歌词和音乐属性从零创作完整歌曲二是接收一首参考歌曲后以不同的风格和声线重新演绎这首歌也就是翻唱生成。更难得的是这套系统在专业人士的盲听测试中击败了MiniMax Music 2.6、MiniMax Music 2.5、Mureka V8和Suno V5等商业领先产品与Suno V5.5持平。在外部权威排行榜Artificial Analysis Music with Vocals Leaderboard上Qwen-Music以JazzCat的化名参与评测在英文演唱音乐生成领域名列第三。要理解这件事的难度不妨把创作一首完整歌曲比作烹饪一道复杂的宴席菜。你不仅要选好食材确定歌词、旋律和风格还要掌握火候节奏和动态考虑摆盘混音和立体声并且让整道菜从头到尾保持风味统一歌曲结构的连贯性更关键的是宴席往往长达数分钟每一口味道都不能走样。过去的AI音乐系统要么只会短片段要么缺乏演唱声线要么生成的音频质量粗糙Qwen-Music试图在这些方面同时突破。---一、从声音到语言给音乐找一种AI能读懂的文字要让AI创作音乐首先得解决一个根本问题AI最擅长处理的是文字序列而音乐是随时间流动的连续声波。怎么架桥答案是把音乐也变成类似文字的符号序列。Qwen-Music-Tokenizer承担的就是这个转换工作。把它理解成一位速记员一段几分钟的歌曲经过它的处理会被压缩成一串以每秒25个符号速度排列的整数序列每个符号被称为音乐语义令牌Music Semantic Token。这个速率意味着每隔40毫秒记录一个符号就像把一部电影每隔一小段截一帧缩略图既保留了内容骨架又大幅减少了数据量。这位速记员本身的训练经历了四个阶段每个阶段都在为下一阶段铺路。第一阶段是自学用BestRQ这种自监督学习方法让模型随机遮住音频的某些片段然后猜被遮住的内容是什么就像做完形填空题一样。目标答案由一个固定随机编码器给出不需要人工标注整个阶段使用双向注意力机制也就是模型在猜测时可以参考前后的上下文。第二阶段叫做因果适应在第一阶段的基础上把双向注意力改为单向的因果注意力也就是只看左边过去、不看右边未来。为什么要这么做因为后续的音乐生成模型是自回归的像打字机一样从左到右逐字生成训练时必须模拟这种只有过去没有未来的条件。与其从头训练一个单向模型不如直接在已训练好的双向模型上微调这样既省计算资源又保留了已学到的音乐知识。第三阶段叫做多任务监督微调在速记员的工作台上同时接了三个评分器——一个检查歌词是否被正确记录利用CTC损失做歌词转录一个检查旋律轮廓是否被保留梅尔频谱重建一个检查和声信息是否在场色度特征重建。这三个评分器同时给分倒逼速记员记录的符号必须同时携带语义、旋律和和声信息而不仅仅是抽象的音频特征。这个阶段还去掉了遮掩操作让模型看完整音频并且对整首歌最长300秒进行学习而非短片段。第四阶段是真正引入字符表插入一个向量量化VQ瓶颈层把连续的特征向量强制映射到一本包含32768个条目的码本上每个条目就是一个整数编号最终产出的就是那串25Hz的整数序列。为了防止突然插入量化层导致训练不稳定研究者设计了一个平滑过渡机制先把量化后的特征和未量化的特征按一定比例混合随训练进行逐渐把比例调向全量化同时冻结底层参数只训练量化器和上层之后再逐步解冻整个网络。最终这套码本的利用率超过99%几乎每个字符都被用上没有浪费。---二、AI作曲家如何先打草稿再下笔旋律先行的思考链有了音乐的文字表示下一步就是训练一个AI作曲家能根据用户的文字描述和歌词生成这串符号序列。这个作曲家叫做Qwen-Music-LLM以一个30亿参数的语言模型Qwen3.5-Omni的密集变体为基础进行训练。这里存在一个很微妙的挑战。当用户说给我写一首温暖的民谣歌词是关于雨天的思念这句话确定了风格和情感却对旋律本身没有任何约束。AI必须同时决定旋律走向、伴奏编排、段落结构以及如何把这一切组合成几千个符号。这就像让一个厨师在没有菜谱的情况下从选材到装盘一气呵成创作一道全新的菜——难度相当高且容易出现前后不一致的问题。研究团队的解决方案叫做Melody-CoT即旋律思维链。这个机制的灵感来自大语言模型里常用的链式推理Chain-of-Thought先让模型写出推理过程再给出最终答案推理过程本身会引导答案更准确。对应到音乐生成就是先让模型生成一段旋律草稿再根据这份草稿生成完整的音乐符号序列。这就好像作曲家在正式谱曲之前先用口哨哼出旋律的大致走向心里有底了再落笔。旋律草稿的表示方式经过精心设计核心是一个叫做旋律令牌Melody Token的东西。研究者先用RMVPE算法从音频中提取50Hz的人声音高曲线然后以8倍降采样将其压缩至6.25Hz的序列。降采样的好处是过滤掉颤音、装饰音等演唱细节保留的是旋律的骨架轮廓。更重要的是音高值被转换为相对MIDI表示把所有有声帧的MIDI音高中位数作为基准每个帧的值都减去这个基准得到相对半音偏移量映射到0到255的256个整数中255代表无声帧。这样做的目的是抹去绝对音域和调性信息让旋律条件只传递形状而不泄露原唱的音域或者歌曲的调。在训练时模型会接触三种序列模式的混合。纯文本转音乐模式直接从标签和歌词生成音乐符号序列段落级旋律模式在音乐符号序列之前插入每个有歌词段落的旋律令牌每段旋律前标注段落标签比如[verse]或[chorus]独特段落级旋律模式则更进一步当一首歌有多个副歌时不是把每个副歌的旋律都写出来而是只随机选取一个作为代表。这种设计有三重好处缩短了旋律草稿的长度、提高了训练数据的多样性以及鼓励模型把旋律理解为可复用的创作素材而非逐帧复制的模板。对于翻唱生成场景旋律令牌从参考歌曲中提取后连同目标风格标签和目标歌词一起作为前缀输入模型模型则在遵循旋律轮廓的前提下按照目标标签生成新的音乐符号序列。通过统一的Melody-CoT机制原创生成和翻唱生成在同一个模型中实现不需要两套不同的系统。---三、从符号草稿到立体声波渲染器的三道工序音乐语义符号序列只是一份粗略的乐谱草稿要让它变成能放入耳机里聆听的高保真立体声音频还需要Qwen-Music-Render的三道工序。打个比方这就像把一张粗略的建筑蓝图最终建成可以入住的精装房屋。第一道工序是扩散变换器Diffusion TransformerDiT。这是一个13亿参数的神经网络输入是充满噪声的连续潜在向量经过多步去噪后输出干净的潜在表示。网络由32个变换器块组成每块包含自注意力层、交叉注意力层和前馈层全部由扩散时间步长参数调制。关键在于这个模型同时接收两类条件信息一是语言模型生成的音乐语义符号序列帧对齐地嵌入输入二是重写后的文字条件包括音乐标签如女声、温暖、民谣、吉他和钢琴和歌词。文字条件通过一个冻结的Qwen3-Embedding-0.6B文本编码器提取特征再通过交叉注意力注入每个变换器块。在推理时DiT使用分类器自由引导CFG技术同时运行有条件和无条件两路最终输出是两者的加权组合可以在生成质量和多样性之间调节平衡。研究发现最优策略是在无条件路径中只去掉文字条件而保留音乐语义符号序列这样音乐结构由符号序列主导文字条件则作为补充的语义引导比两者都去掉或者只去掉符号序列效果更好。第二道工序是Spec-VAE解码器。这是一个频谱域的变分自编码器将DiT输出的潜在向量解码回复杂频谱即STFT的实部和虚部。编码器将48kHz立体声音频的复数频谱压缩成128维的25Hz潜在向量压缩比高达192倍解码器做逆变换从潜在向量重建复数频谱再经过逆短时傅里叶变换iSTFT得到波形。在这个解码器里研究者还引入了一个新颖的激活函数叫做Spec-SnakeBeta。它脱胎于BigVGAN中使用的SnakeBeta激活函数不同之处在于把参数从按通道定义改为按频率轴定义。每个频率槽对应一个固定的物理频率因此可以为不同频率设计不同的非线性特性。初始化时参数按对数频率先验设置让高频区域具有更强的周期性调制能力模型再在此基础上学习调整。实验显示学习后的参数在0到5kHz的低中频区间偏离初始值最大说明这个频段最需要定制化的非线性处理。第三道工序是波段模式精修器Band-Mode Refiner。这是一个轻量级的ConvNeXt-1D模块附加在解码器输出之后专门修复解码器留下的频谱残差误差。精修器对不同频段采用不同的修正策略低频段只修正相位中频段同时修正幅度和相位高频段只修正幅度。这种设计的依据是不同频段的误差模式不同分开处理更有针对性。为了保证训练稳定精修器的初始权重全部设为零这意味着在训练开始时精修器的输出和解码器完全一致随训练逐步发挥作用不会破坏解码器已经学到的能力。整个渲染器的训练也分三个阶段先做纯重建的Spec-VAE预训练再引入波形域对抗训练加入多尺度STFT判别器和CQT判别器提供反馈最后冻结Spec-VAE编解码器专门训练精修器同时加入频谱域判别器。这种渐进式训练策略在192倍压缩率的高难度条件下维持了训练稳定性。---四、超过五百万小时的听歌自学如何训练一个懂音乐的AI有了架构还需要数据和训练策略。Qwen-Music-LLM的训练数据超过500万小时的多语言音乐覆盖数百种语言。如何从这座庞大而质量参差不齐的音乐山脉中提炼出一个高水准的生成模型是训练设计的核心问题。研究团队的策略是质量分级预训练课程。他们首先训练了一个内部评分模型基于平均意见分即MOS由具有专业音乐背景的人工评分员标注训练数据模型学会预测每首歌的整体音乐质量。然后在每个音乐类型内部按评分百分位把数据分成七个质量桶Q1到Q7其中Q1是顶尖的10%Q7是最末的1%。去掉Q7之后用Q1到Q6六个档次的数据分三个阶段训练。第一阶段使用Q3到Q6的数据也就是中等偏下质量的大量数据。目标是让模型先学会从文字条件映射到音乐符号序列的基本能力建立对各种风格、语言和伴奏形式的广泛认知。训练过程中采用动态质量采样策略开始时多用低质量数据随训练进行逐渐增加高质量数据的比例就像学徒先从最基础的大量案例中积累经验再逐步接触精品。第二阶段使用Q2数据配合学习率衰减这是一个质量整合阶段。经过第一阶段的广泛学习后模型开始在更稳定、更高质量的数据上巩固改善音乐结构的连贯性同时减少低质量数据引入的噪声。第三阶段专注于Q1顶级数据并从全库中精选高质量样本补充。这个阶段进一步提升可控性和指令遵循能力同时保持各类型和语言的均衡避免模型只在热门流行风格上表现出色。完成预训练后还有三个阶段的后训练对齐。第一阶段是监督冷启动用经过精心挑选的高质量数据做监督微调确保模型在风格标签和歌词标注方面足够准确为后续基于奖励的优化奠定干净的起点。第二阶段是迭代离线偏好对齐让当前模型在多样化提示下生成候选由音乐质量评分模型和指令遵循奖励模型打分构建偏好对再用直接偏好优化DPO训练模型。这个生成—评分—构建偏好对—优化的循环多轮迭代逐步提高音乐性和可控性。第三阶段是在线音乐性优化改用在线群序列策略优化GSPO直接从当前策略的采样中学习优化序列级别的奖励。相比离线DPO这种方式能更充分地探索新的优质生成方向在前两个阶段已经打好基础的情况下专注于音乐细节和音频质量的进一步打磨。---五、专业评委的考卷成绩单全面评测的结果揭晓研究团队对Qwen-Music进行了系统全面的评测兼顾主观偏好和客观指标既有人耳判断也有算法评分既有原创生成也有翻唱生成。在文本转音乐的主观评测中50位具有音乐创作或制作经验的专业评分员进行了盲听A/B测试。每一对比较中两首歌匿名随机呈现评分员只根据整体聆听体验选择更好的那首顺序也随机打乱以消除位置偏见每对由三位评分员独立打分。结果显示Qwen-Music的胜率对MiniMax Music 2.6达到66.7%对MiniMax Music 2.5达到59.1%对Mureka V8为58.3%对Suno V5为55.4%对Suno V5.5为50.3%与这个业内最强竞争对手基本持平。按音乐类型分析的Bradley-Terry评分一种从两两对比数据中估算能力的统计方法显示Qwen-Music在8个类型中的5个电子/EDM、爵士蓝调、朋克硬核、RB/灵魂乐、摇滚获得最高评分在流行和嘻哈/说唱中居第二在金属/硬摇滚中保持竞争力。这说明Qwen-Music的优势并非集中在某一两个特定类型而是相对均衡地分布于各种风格。在客观指标评测中测试集包含300条中文和300条英文提示所有系统使用AI生成的歌词和均衡分布的音乐标签进行评测条件完全一致。使用的评测框架包括SongBench评估旋律、编排、音乐性、人声质量、乐器质量、混音和结构七个维度、SongEval评估连贯性、音乐性、记忆点、清晰度和自然度和AudioBox-Aesthetic评估内容愉悦感、内容实用性、制作复杂度和制作质量。在这16个评测维度中Qwen-Music拿下13个第一其余3个表现也处于竞争性水平。在可控性方面Gemini 3.1 Pro对生成结果在流派、情绪、乐器、人声性别和人声音色五个维度分别打1到10分。Qwen-Music的平均得分为8.44与所有系统中最高分的差距不超过0.04分在人声性别遵循上拿到最高分在情绪和音色控制上名列第二。在歌词清晰度方面使用Qwen3-ASR识别生成音频中的歌词并与输入歌词对比计算音素错误率Qwen-Music的得分是6.10在所有系统中排名第二最低为Suno V5.5的4.19。对于翻唱生成评测研究团队构建了两个测试集一个使用AI生成的参考歌曲Suno V5.5和Mureka V8各出一部分另一个使用真实世界的流行歌曲作为参考旋律各包含100条英文和100条中文样本。旋律保留程度通过旋律平均绝对误差Melody MAE衡量将生成歌曲和参考歌曲都转换为相对MIDI表示用动态时间规整对齐后计算半音级别的平均误差误差越小说明旋律保留越好。在AI生成参考集上Qwen-Music段落级旋律模式的Melody MAE为1.48优于Suno V5.52.00、Suno V51.87和MiniMax Cover1.89。独特段落级旋律模式的Melody MAE为1.80不如直接段落级但在风格标签遵循方面有显著提升五个标签维度的得分都大幅高于段落级模式。在真实流行歌曲参考集上两种Qwen-Music模式均优于MiniMax Cover唯一与Suno系统比较的对象因为Suno不接受真实歌曲输入在SongBench七个维度、PER和大多数标签遵循指标上段落级模式在旋律保留上保持最佳Melody MAE 1.44。渲染器专项评测使用包含546首歌的Song Describer数据集对比Qwen-Music的Spec-VAE、Spec-VAE精修器与其他四个开源音频VAE系统。在频谱重建方面Spec-VAE精修器取得最佳STFT距离0.870和STFTlog1p0.075在梅尔频率重建方面精修器将梅尔距离从0.572大幅降至0.461是所有系统中最低在立体声图像质量方面取得最佳跨通道相位相干性CCPC 0.973与εar-VAE并列和最佳频谱声像误差0.264。---说到底Qwen-Music做的事情可以用一句话来概括它把写歌这件需要天赋、技艺和大量时间积累的事情拆解成一套可以被计算机系统模拟的流程然后在500万小时的音乐数据上把这套流程训练到足够好。这对普通人意味着什么意味着以后你只要能描述出自己想要什么样的音乐系统就能帮你把它变成真实可听的歌曲意味着你喜欢某首歌的旋律但不喜欢它的风格可以把它改编成你想要的样子意味着独立音乐人、播客创作者、游戏开发者等各类内容创作者在音乐配套方面的门槛将大幅降低。当然Qwen-Music并非没有局限。在翻唱生成的评测中商业竞品在SongBench的旋律和编排等整体音乐质量指标上仍然占优在歌词清晰度上仍然逊于最优秀的对手对于长达数分钟的歌曲如何在整个结构层面保持更灵活的创意以及如何实现更细腻的演唱表现力都是研究团队自己在结论部分提出的未来课题。一个值得思考的问题是当AI能够创作出专业级别的音乐那些以音乐创作为生的人未来的角色会如何演变大概率的答案不是被替代而是被解放——从重复性的技术性工作中解放出来更专注于那些只有人类才能带来的情感深度和创造性突破。毕竟Qwen-Music再强也只是在学习和模仿人类已经创作过的音乐而人类能创作出Qwen-Music从未听过的东西。有兴趣了解更多技术细节的读者可以通过arXiv编号2607.11699查阅这篇由阿里巴巴Qwen团队发布的完整技术报告。---QAQ1Qwen-Music生成的音乐质量和Suno这类商业产品比怎么样A在专业评分员的盲听对比测试中Qwen-Music对Suno V5的胜率为55.4%与Suno V5.5基本持平50.3%对49.7%。在客观指标方面Qwen-Music在16个评测维度中的13个取得第一尤其在旋律、编排、音乐性等维度领先。不过Suno V5.5在歌词清晰度上仍然保持优势两个系统各有所长。Q2Melody-CoT旋律思维链机制具体是怎么工作的AMelody-CoT是一种先画草图再落笔的机制。模型在生成完整音乐符号序列之前会先生成一段旋律令牌序列作为草稿描述人声旋律的大致走向。旋律令牌用相对MIDI音高表示抹去了绝对音域信息只保留旋律形状。这份草稿起到打底稿的作用帮助模型先确定音乐结构再填充完整细节从而提升生成歌曲的连贯性和旋律质量。翻唱时这份草稿直接从参考歌曲中提取。Q3Qwen-Music翻唱生成时如何平衡旋律保留和风格自由度AQwen-Music提供两种翻唱模式。段落级旋律模式为每个有歌词的段落都提供旋律令牌条件旋律保留更精准Melody MAE 1.48低于竞品但对目标风格的遵循相对弱一些。独特段落级旋律模式每种段落类型如副歌只提供一段代表旋律条件更宽松旋律保留略低Melody MAE 1.80但风格标签遵循大幅改善。用户可以根据需要选择更贴近参考旋律还是更自由地演绎目标风格。