
AI音乐开始进入“审美竞争”阶段。
7月19日,昆仑万维在2026世界人工智能大会(WAIC 2026)上举办了“世界模型与多模态范式跃迁”论坛。
这场论坛的嘉宾横跨学术、产业和文娱领域。从中国科学院院士周志华、Reactor AI CEO Alberto Taiuti,到清华大学交叉信息研究院助理教授、破壳机器人创始人许华哲、黎曼机器人创始人刘扬,再到黄晓明、王珞丹、《消失的她》导演崔睿、爱奇艺高级副总裁杨海涛和甲子光年创始人兼CEO张一甲,不同背景的嘉宾围绕技术突破、内容生产和产业落地展开讨论。
当天,昆仑万维发布和升级了三款模型:可交互世界模型Matrix-3.5、AI音乐大模型Mureka V9.5,以及具身智能机器人模型Riemann-1.0,分别覆盖可交互世界、音乐生成和具身智能。
其中,Mureka V9.5的升级最容易被现场观众感知。现场展示的Funk音乐一响,台下观众整齐抬起头。十几部手机很快举了起来,前排还有观众跟着节奏用脚打拍子。

Mureka V9.5配乐MV,视频来源:昆仑万维
圆桌上,黄晓明谈起一次录歌经历,AI演唱的Demo“太完美了”,没有换气,也没有呼吸感,听起来反而“没有人味”。他提到,真人不必再和AI比谁更完美,独特的个性和表达才更重要。

国家一级演员、中国电影家协会副主席黄晓明,图片来源:昆仑万维
黄晓明还分享了今早使用Mureka的经历。他让模型生成了两首歌,一首参考杨宗纬《空白格》的抒情气质,另一首则借鉴他最近喜欢的颜人中,主题是“中年危机”。“还不错,词还挺触动人心的。”他说。
王珞丹则认为,AI可以给自己的想法“增加很多翅膀”,但“决定往哪飞的权利要在我手里”。

“世界模型与多模态范式跃迁”论坛圆桌讨论,图片来源:昆仑万维(从左至右分别为:甲子光年创始人张一甲,昆仑万维董事长兼CEO方汉,中国电影家协会副主席黄晓明,演员王珞丹,爱奇艺高级副总裁杨海涛,青年导演崔睿)
在随后接受「甲子光年」在内媒体采访时,昆仑万维董事长兼CEO方汉反复强调的关键词是“克制”。
这也是Mureka V9.5此次升级的重点。过去,一些AI音乐模型习惯通过增加声部、加厚音色和持续推高情绪来制造完成感,容易出现人声被伴奏遮盖、编曲拥挤、歌曲缺少起伏等问题。
Mureka V9.5没有继续增加音乐的复杂度,而是改善人声、编配和曲风控制,让生成结果更自然,也更贴合用户的创作意图。方汉将这一方向概括为“克制、真实、贴合创作意图”。
与V9.5同时亮相的,还有基于这一底座的O3音乐推理扩展方案。前者提高生成质量和稳定性,后者通过推理时选优,让更多作品接近模型的能力上限。
「甲子光年」认为,AI音乐已经跨过“能不能写歌”的第一道门槛。下一阶段的竞争,是模型能否作出更好的音乐选择。
1.Mureka V9.5,让AI音乐少一点“AI味”
一些AI音乐模型擅长通过密集声部和厚重音色制造完成感,容易出现人声被遮盖、编曲拥挤和情绪缺少起伏等问题。
Mureka V9.5没有继续追求“更满”,而是把重点放在人声、编配和情绪之间的关系上。
中文流行歌曲《夜色缓缓》是其中一例。
它的提示词包括柔和钢琴、氛围合成器、渐进式弦乐和贴近演唱的男声,想要呈现的是“雨夜里未说出口的告别”,忧伤但温柔,情绪从低声诉说逐渐走向释放,又不能显得过分煽情。
这类歌曲考验的是模型对分寸的控制。伴奏太重,人声会被压住;情绪推进太快,后半段便失去变化;弦乐进入得过早,也容易让整首歌显得用力过猛。
从这首Demo呈现的效果看,V9.5试图让伴奏、人声和情绪层次保持更自然的关系。编配既要托住人声,也要为人声留出空间。
另一首《Melted Chrome》,重点变成了模型对复杂曲风的理解和还原。
提示词要求的是迷幻的西海岸G-Funk街头说唱,并进一步限定了滑动合成器低音、Moog哨音、Talkbox、Rhodes电钢琴、哇音吉他和复古磁带质感。鼓点要略微落后于节拍,人声则要保持沙哑、松弛的质感。
提示词还明确排除了Trap踩镲、Drill节奏和EDM式落点。模型不仅要识别G-Funk的核心元素,还要理解这些元素如何组合,才能形成低底盘夜间巡游般的迷幻氛围。
对AI音乐来说,理解“不要什么”,有时和理解“要什么”同样重要。识别一个曲风标签并不困难,难的是让音色、节奏、人声和整体氛围始终指向同一种表达。
前两首作品主要展示V9.5对人声、编配和曲风的控制,与之同时亮相的O3,则把重点放在全曲结构和情绪推进上。
《误差》是一首极简电子与Cosmic Pop风格的无人声作品。提示词以晶莹的合成器脉冲、低频氛围和空间混响,描绘一座漂浮在轨道上的空间站,要求整首歌保持冰冷、空旷和缓慢的基调。
《Still in the Room》则转向Dream Pop。混响吉他、漂浮感男声、柔和的氛围合成器,加上温暖贝斯和松弛鼓组,构成一个独处于房间中的夜晚。提示词同时要求作品保留亲密感和距离感,让情绪缓慢展开。
这两首作品都不依赖密集编配或明显的副歌爆发,更看重氛围能否贯穿全曲,以及局部变化是否破坏整体表达。O3所做的,是在V9.5提供的音乐基础上,进一步检查和调整这些选择。
从中文流行到G-Funk,再到极简电子和Dream Pop,四首Demo分别对应人声与情绪、曲风控制和全曲一致性。Mureka V9.5展示的变化,不是加入更多声音,而是让每一种声音更好地服务整体表达。
2.V9.5打底,O3提高优质结果的稳定性
Mureka此次升级包含两个层次。
Mureka V9.5是音乐生成的底座模型,决定人声、编配、曲风和情绪表达的基础质量;O3建立在V9.5之上,通过推理阶段的持续比较和选优,提高单次生成接近模型能力上限的概率。
简单来说,V9.5负责抬高模型的基础水平,O3则尽量减少优质结果对单次采样运气的依赖。两者共同指向一个问题:如何降低AI音乐生成的随机性。
这也是Mureka V9.5和O3此次最重要的亮点。它想做的不是偶尔生成一首好歌,而是把“好听”拆解为可评测、可训练、可部署,并能在推理阶段继续优化的系统能力。
在训练阶段,V9.5通过强化学习,同时改善整体听感、创作控制和生成稳定性。在MusiCoT音乐思维链的基础上,模型会先确定全曲的结构、曲风和情绪方向,再安排段落推进、乐器进出和强弱变化。

Mureka V9.5/O3发布,图片来源:昆仑万维
这种变化首先体现在结构与编配上。
主旋律需要突出时,其他声部会相应退后;情绪尚未发展到高潮时,编配也不会提前加码。所有音乐元素不再各自追求存在感,而是共同服务整首歌的表达。
第二项能力,是对复杂创作意图的控制。一首歌的主歌、副歌和桥段承担着不同作用。主歌通常负责叙事,副歌集中释放情绪,桥段则完成转折。模型如果只理解单句歌词,便容易出现歌词内容与音乐推进脱节。
V9.5需要判断每段歌词在全曲中的位置,再安排旋律、节奏和编配的变化。它不仅要把歌词唱出来,还要让音乐结构跟随语义自然推进。
第三项能力,是人声表达与情绪的匹配。AI人声是否可信,并不只取决于音准和音质。同一句歌词,在低声讲述和情绪释放时,需要采用不同的唱腔和力度;伴奏也要随之变化,不能始终保持相同的密度。
模型不仅要保证音准和音质,还要处理唱腔、情绪与伴奏之间的关系。例如,演唱方式是否符合歌曲氛围,伴奏是否给人声留下足够空间,人声的力度能否随着段落自然变化。
第四项能力,是对复杂创作意图的控制。用户输入的Prompt通常不只包含曲风和乐器,还可能同时涉及演唱方式、情绪变化、段落结构,甚至明确要求避开某些节奏和音色。模型需要判断这些条件之间的主次,再把它们落实到旋律、节奏、人声和编配中。
这是V9.5区别于关键词拼接式生成的地方。识别出“G-Funk”“Dream Pop”或“中文流行”等标签只是第一步,模型还要让整首歌在音色、节奏、唱腔和整体氛围上保持一致。
根据昆仑万维的数据,在歌曲的主观评分中,V9.5的指令精准度从6.92提高至7.62,旋律、人声、音质和编曲等维度也有所改善。这说明模型不仅需要生成一首结构完整的歌,还要更准确地理解用户究竟想创作什么。

Mureka V9.5等模型生成歌曲的主观评分,图片来源:昆仑万维
底座模型的能力提高后,O3进一步处理生成过程中的偏差。
O3通过test-time scaling扩展MusiCoT的推理过程。模型不会按照最初的选择一路生成到底,而是在生成过程中比较候选方案,并检查局部旋律是否仍然服务全曲、编配是否遮盖人声、情绪是否提前释放,以及段落结构是否偏离最初的提示词。
发现偏差后,模型可以调整后续决策,让旋律发展、编曲结构和情绪推进逐步回到全曲目标上。
由此,V9.5和O3形成了一条相互衔接的技术路径:V9.5通过训练提高底座质量与稳定性,O3再通过推理时优化,提高优质结果出现的概率。
Mureka形成了一条可以随版本持续迭代的技术路径,而不是依赖少数Demo或某一次采样的运气。
从这个意义上看,Mureka在模型层面的差异,不只是“能不能生成音乐”,而是能否把“好听”从偶然结果,转化为可评测、可训练、可复现,并能在推理阶段继续优化的系统能力。
稳定生成更好的音乐只是第一步。Mureka的完整差异还包括版本化创作工具和平台分发能力。模型负责提高作品质量,工具承接比较与修改,平台则连接创作、发布和消费。
3.AI音乐开始进入“审美竞争”阶段
过去,AI音乐最先吸引人的,是速度——几十秒生成一首完整歌曲。但当“会写歌”逐渐成为基础能力,行业竞争也开始转向更难的问题:模型能否理解取舍。
旋律什么时候推进,什么时候留白;什么元素应该保留,什么需要删掉;同一个创意,能否沿着不同方向继续发展。下一阶段的差距,不只在生成速度,也在音乐判断和创作控制。
「甲子光年」认为,AI音乐的“审美竞争”,并不是让模型替用户决定什么是好音乐,而是让用户的取舍和判断更持续地作用于作品。
多数AI音乐工具仍以“一次生成”为基本单位。结果不满意,用户往往只能重新生成,此前满意的旋律、人声或段落也可能被全部改写。
方汉强调,作为模型厂商,他们希望“让提示词写得不好的人,也能做出更好的作品”,把模型的遵从性和易用性继续往前推,降低普通人的创作门槛。
Mureka希望把创作从一次性生成,转向版本化工作流。围绕同一个创意,用户可以快速生成不同版本,比较旋律、唱腔、编配和结构;满意的部分可以保留,不合适的部分则可以单独替换。
在产品层面,Mureka Studio承接了这套工作流。传统数字音频工作站需要创作者熟悉轨道、插件、混音和大量参数。Studio试图把部分操作转化为更直接的创作指令。
它改变的不只是操作方式,也是人与工具之间的分工。创作者的重心,也由执行具体操作转向比较方案和作出审美判断,也就是从“操作DAW”走向“指挥创作”。
对专业音乐人来说,V9.5生成的旋律、编曲和人声可以成为继续发展的素材;对普通用户来说,不熟悉编曲和混音,也可以围绕一个想法逐步完成作品。音乐由此不再只是供人收听的内容,也可以用来记录一段关系、一种情绪或一段记忆。
在产业端,游戏、短剧、影视和有声内容需要大量稳定、可控的音乐素材。昆仑万维也将游戏工业化、短剧量产、音乐创作平民化和影视降本增效列为重点落地场景。
Mureka此前已经开放API,服务于短视频、游戏、播客和影视配乐等场景。 V9.5和O3进一步提高作品质量与生成稳定性后,模型能力也更容易通过Studio和API进入真实的内容生产流程。
Mureka的差异因此不只来自某一次生成效果,而来自模型训练、推理时选优、版本化创作工具和平台分发能力的组合。
当“会写歌”不再稀奇,谁能让用户持续比较、修改和使用作品,才可能建立下一阶段的优势。
Mureka V9.5只是昆仑万维此次WAIC发布中的一个模型,却提供了一个更容易被感知的观察窗口。
从Matrix-3.5到Mureka V9.5,再到Riemann-1.0,昆仑万维试图连接可交互世界、内容生成和现实行动。对Mureka而言,下一步也不只是生成更多歌曲,而是让模型、工具与分发共同进入真实的创作流程。
(封面图及文中视频、音频、配图素材均来自昆仑万维)
文章来自于"甲子光年",作者 "周悦"。