Mureka V9.5 的这次升级,核心在于让旋律、人声、编配、段落和情绪变化形成更自然的整体,并让每个声音承担清晰的表达作用。

如果用一句话概括就是:V9.5 让音乐生成从“把元素做出来”,进一步走向“让每个元素在正确的位置发挥作用”。

这也是 V9.5 与创作者之间最直接的关系:当你输入一个曲风、一个情绪或一段歌词时,模型既生成可听的结果,也让编配、人声和段落推进共同服务于这个创作意图。

V9.5 更新了什么?

V9.5 主要围绕四个方面进行优化:

  1. 更自然的音乐结构: 通过 MusiCoT 从全曲结构组织到局部表达,让段落推进和情绪发展更连贯。

  2. 更有层次的编配方式: 根据段落任务调节密度,为主旋律、人声和情绪变化保留空间。

  3. 更可信的人声表现: 让人声、歌词、唱腔、情绪和伴奏之间的关系更加协调。

  4. 更稳定的意图执行: 让 Prompt 中的曲风、情绪、人声方向和编配要求更稳定地转化为可听的音乐选择。

在100 首歌曲同口径评测中,V9.5 的人声表现良品率为 61.0%,Prompt 控制良品率为 97.0%,曲风完全体现比例为 95.7%,音频健康率为 84.0%,综合可用率为 28.0%

为什么 V9.5 强调“自然感”?

音乐的完成度由旋律、歌词、人声、伴奏和段落结构共同决定,音色数量、声部数量和编配密度需要服务于这种整体关系。

V9.5 模型把这种关系概括为对真实音乐组织方式的进一步理解:编配可以根据歌曲段落保持灵活密度,声部需要有进入和退出的空间,情绪需要随着歌曲结构逐步发展,每个声音选择都应该服务于创作意图。

这意味着 V9.5 更强调把复杂度用在真正需要的地方。主歌可以保持克制,为副歌的进入留下空间;人声需要表达重点时,伴奏可以退后;情绪需要推进时,配器再逐步增加能量。

所谓自然感,最终体现为这些音乐关系听起来更顺畅:段落之间有变化,声音之间有层次,情绪有发展的过程,曲风在全曲中保持清晰。

V9.5 的四项核心变化

1. 从全曲结构组织到局部表达

V9.5 延续并深化了 MusiCoT 的创作路径。模型先形成对全曲结构和表达方向的判断,再逐步处理段落、旋律、人声、编配和声音呈现。

这种从整体到局部的组织方式,可以帮助不同音乐元素找到与歌曲结构相匹配的位置。一个音色或旋律动机,不只是单独判断是否好听,还要考虑它在什么时候出现、在什么段落出现,以及它是否推动了歌曲继续发展。

对创作者来说,试听时可以关注三个问题:

  • 主歌是否为副歌建立了足够的铺垫?

  • 关键声部是否在需要的时刻进入,并为核心表达保留空间?

  • 情绪是否随着歌曲结构逐步推进,形成有方向的强弱变化?

2. 编配更懂得留出空间

V9.5 以段落功能为依据理解配器密度。主歌、副歌、桥段等不同段落,可以承担不同的音乐任务,因此编配密度和声部角色也可以随之变化。

更有层次的编配,让每个声部的作用更加明确:

  • 主旋律需要被听见时,其他声部为它让出空间;

  • 人声需要表达歌词时,伴奏与人声保持更协调的关系;

  • 情绪需要提升时,通过段落和动态形成有方向的推进;

  • 需要留白时,通过空间感和动态变化维持音乐张力。

这种处理也带来更清晰的段落对比。副歌的能量提升之所以有效,是因为前面的段落已经留下了可以被提升的空间。

3. 人声表达更关注“唱得对不对”

V9.5 的人声变化不止体现在音色上。而是人声表现,强调的是情绪、演唱方式、歌词和伴奏之间的整体关系。

在 100 首歌曲同口径评测中,V9.5 的人声表现良品率达到 61.0%,前代基线为 53.0%,提升 8.0 个百分点

这个指标可以从创作试听中拆解为几个具体问题:

  1. 歌词是否在正确的段落中被表达?

  2. 关键词和语义重点是否足够清楚?

  3. 人声的情绪是否符合当前段落的任务?

  4. 人声与伴奏是否形成了协调的关系?

因此,V9.5 的人声优化可以理解为“表达关系更完整”,让音色与唱法共同服务于歌曲意图。

4. Prompt 和曲风执行更加稳定

V9.5 继续提升把创作者要求转化为音乐选择的稳定性。Prompt 中的曲风、情绪、人声方向和编配描述,可以在歌曲中形成持续、清晰的听感,并贯穿主要段落。

在同一轮评测中,V9.5 的 Prompt 控制良品率为 97.0%,前代基线为 92.0%;曲风完全体现比例为 95.7%,前代基线为 84.9%

这两项数据说明,V9.5 的优势不仅体现在“能识别 Prompt”,还体现在把 Prompt 中的方向延续到完整歌曲中。比如,曲风描述中的核心乐器、节奏感觉、人声状态和空间氛围,可以共同组成一个连贯的音乐结果。

歌曲评测:V9.5 的能力画像

以下数据来自 100 首歌曲同口径评测。“前代基线”指该轮评测中的对照基线,这组数据用于刻画 V9.5 在对应样本中的能力变化;不同语言、曲风和 Prompt 可结合具体创作场景进一步观察。

评测维度前代基线V9.5变化
整体听感良品率34.0%35.0%+1.0%
人声表现良品率53.0%61.0%+8.0%
音质类良品率均值34.5%35.0%+0.5%
Prompt 控制良品率92.0%97.0%+5.0%
曲风完全体现比例84.9%95.7%+10.8%
音频健康率81.0%84.0%+3.0%
综合可用率25.0%28.0%+3.0%

从这组数据可以看到,V9.5 的变化集中在三个方面:

  • 人声表达更稳定: 人声表现良品率提升 8.0 个百分点。

  • 创作意图更容易被听见: Prompt 控制良品率提升至 97.0%。

  • 曲风识别更清楚: 曲风完全体现比例提升至 95.7%。

整体听感、音质类良品率、音频健康率和综合可用率也都有提升,但幅度相对克制。这说明 V9.5 是一次围绕多项能力共同成立的升级,而不是只追求单一指标的变化。

V9.5 的取舍:自然形态与第一耳冲击力

V9.5 与部分对照方案之间的差异:一些对照方案在编配丰满度、声部数量和第一耳抓取力上更突出,因此更容易形成“声音很多”“第一印象很满”的听感。

V9.5 选择的是更有层次的方向:让编配密度服务于段落和情绪,让人声、主旋律和曲风意图保持更清晰的关系。

这体现了 V9.5 更明确的音乐取向:用更有层次的编配,带来更自然的音乐形态、更可信的人声表达和更稳定的创作意图执行。

因此,试听 V9.5 时,可以从完整歌曲出发比较:段落是否有发展,情绪是否有推进,副歌是否被主歌托起,人声是否始终处于合适的位置。

Demo 试听:从不同音乐方向观察 V9.5

《Melted Chrome》:小众曲风的完整表达

Melted Chrome 2分版
0:0001:57

这首 Demo 以西海岸 G-Funk 为方向,提示词中明确写到合成器低音、Moog 哨音、Talkbox 氛围、Rhodes、哇音吉他、复古磁带质感、靠后的鼓点和沙哑男声。

它适合用来观察 V9.5 如何把曲风、地域文化联想、乐器选择、节奏位置和人声状态组织成完整的听感,让风格特征从标签转化为可听的音乐细节。

《Still in the Room》:完整而稳定的 Dream Pop 编配

Still in the Room
0:0005:08

这首 Demo 的 Prompt 包含混响吉他、漂浮感男声、柔和氛围合成器、温暖贝斯和松弛鼓组,整体指向朦胧、亲密、内省且带有距离感的 Dream Pop 氛围。

它适合用来观察不同声部如何共同维持空间感,以及歌曲如何通过层次变化保持完整的曲风表达。

V9.5 更多音频素材

JUST MISS ME (2)
0:0002:27
NO KEY (1)
0:0003:16
NO TE SALE FINGIR (1)
0:0005:14

创作者如何判断一次 V9.5 生成?

可以使用下面这套四步试听方法:

第一遍:听结构

建议完整听完歌曲,再判断主歌、预副歌、副歌和桥段是否承担了不同任务,段落之间是否形成明确变化。

第二遍:听人声和歌词

检查歌词重点是否清楚,人声是否在正确的段落表达了对应的情绪,关键词是否被准确传达。

第三遍:听编配空间

关注伴奏密度、声部进入和退出、主旋律位置,以及人声是否始终拥有足够的听觉空间。

第四遍:听 Prompt 是否贯穿全曲

确认曲风、情绪、乐器、人声方向和空间质感是否从开头延续到结尾,并在主要段落保持清晰。

常见问题

V9.5 的“自然”具体指什么?

它主要指音乐元素之间的关系更加协调:编配密度会随段落变化,人声与伴奏更匹配,情绪按照结构发展,曲风意图在全曲中保持清晰。

V9.5 如何处理编配密度?

编配可以根据段落任务保持灵活密度,声部需要空间。V9.5 让声音选择服务于歌曲表达,并通过层次变化保持音乐张力。

哪些指标最能体现 V9.5 的升级?

从歌曲评测看,人声表现良品率、Prompt 控制良品率和曲风完全体现比例的变化最明显,分别达到 61.0%、97.0% 和 95.7%。

选择 V9.5 版本时,应该只看第一耳听感吗?

第一耳可以判断整体吸引力,同时建议继续检查段落发展、歌词清晰度、人声与伴奏的关系、曲风连续性和完整歌曲的情绪推进。

总结

Mureka V9.5 的更新重点,是让模型更好地理解一首歌如何作为完整音乐形态成立。

它通过 MusiCoT 连接全曲结构与局部表达,让编配可以有密度变化,让声部拥有空间,让人声、歌词和伴奏形成更自然的关系,也让 Prompt 中的曲风和情绪意图更稳定地贯穿全曲。

V9.5 在人声表现、Prompt 控制、曲风表达、音频健康和综合可用率等维度都取得了提升。对创作者来说,它带来的核心价值可以概括为:更清晰地表达想法,更自然地组织声音,更稳定地把一个创作方向发展成完整歌曲。