Mureka V9.5 的這次升級,核心在於讓旋律、人聲、編配、段落和情緒變化形成更自然的整體,並讓每個聲音承擔清晰的表達作用。

如果用一句話概括就是:V9.5 讓音樂生成從「把元素做出來」,進一步走向「讓每個元素在正確的位置發揮作用」。

這也是 V9.5 與創作者之間最直接的關係:當你輸入一個曲風、一個情緒或一段歌詞時,模型既生成可聽的結果,也讓編配、人聲和段落推進共同服務於這個創作意圖。

V9.5 更新了什麼?

V9.5 主要圍繞四個方面進行優化:

  1. 更自然的音樂結構: 透過 MusiCoT 從全曲結構組織到局部表達,讓段落推進和情緒發展更連貫。

  2. 更有層次的編配方式: 根據段落任務調節密度,為主旋律、人聲和情緒變化保留空間。

  3. 更可信的人聲表現: 讓人聲、歌詞、唱腔、情緒和伴奏之間的關係更加協調。

  4. 更穩定的意圖執行: 讓 Prompt 中的曲風、情緒、人聲方向和編配要求更穩定地轉化為可聽的音樂選擇。

在 100 首歌曲同口徑評測中,V9.5 的人聲表現良品率為 61.0%,Prompt 控制良品率為 97.0%,曲風完全體現比例為 95.7%,音頻健康率為 84.0%,綜合可用率為 28.0%

為什麼 V9.5 強調「自然感」?

音樂的完成度由旋律、歌詞、人聲、伴奏和段落結構共同決定,音色數量、聲部數量和編配密度需要服務於這種整體關係。

V9.5 模型把這種關係概括為對真實音樂組織方式的進一步理解:編配可以根據歌曲段落保持靈活密度,聲部需要有進入和退出的空間,情緒需要隨著歌曲結構逐步發展,每個聲音選擇都應該服務於創作意圖。

這意味著 V9.5 更強調把複雜度用在真正需要的地方。主歌可以保持克制,為副歌的進入留下空間;人聲需要表達重點時,伴奏可以退後;情緒需要推進時,配器再逐步增加能量。

所謂自然感,最終體現在這些音樂關係聽起來更順暢:段落之間有變化,聲音之間有層次,情緒有發展的過程,曲風在全曲中保持清晰。

V9.5 的四項核心變化

1. 從全曲結構組織到局部表達

V9.5 延續並深化了 MusiCoT 的創作路徑。模型先形成對全曲結構和表達方向的判斷,再逐步處理段落、旋律、人聲、編配和聲音呈現。

這種從整體到局部的組織方式,可以幫助不同音樂元素找到與歌曲結構相匹配的位置。一個音色或旋律動機,不只是單獨判斷是否好聽,還要考慮它在什麼時候出現、在什麼段落出現,以及它是否推動了歌曲繼續發展。

對創作者來說,試聽時可以關注三個問題:

  • 主歌是否為副歌建立了足夠的鋪墊?

  • 關鍵聲部是否在需要的時刻進入,並為核心表達保留空間?

  • 情緒是否隨著歌曲結構逐步推進,形成有方向的強弱變化?

2. 編配更懂得留出空間

V9.5 以段落功能為依據理解配器密度。主歌、副歌、橋段等不同段落,可以承擔不同的音樂任務,因此編配密度和聲部角色也可以隨之變化。

更有層次的編配,讓每個聲部的作用更加明確:

  • 主旋律需要被聽見時,其他聲部為它讓出空間;

  • 人聲需要表達歌詞時,伴奏與人聲保持更協調的關係;

  • 情緒需要提升時,透過段落和動態形成有方向的推進;

  • 需要留白時,透過空間感和動態變化維持音樂張力。

這種處理也帶來更清晰的段落對比。副歌的能量提升之所以有效,是因為前面的段落已經留下了可以被提升的空間。

3. 人聲表達更關注「唱得對不對」

V9.5 的人聲變化不止體現在音色上,而是更強調人聲、情緒、演唱方式、歌詞和伴奏之間的整體關係。

在 100 首歌曲同口徑評測中,V9.5 的人聲表現良品率達到 61.0%,前代基線為 53.0%,提升 8.0 個百分點

這個指標可以從創作試聽中拆解為幾個具體問題:

  1. 歌詞是否在正確的段落中被表達?

  2. 關鍵詞和語義重點是否足夠清楚?

  3. 人聲的情緒是否符合當前段落的任務?

  4. 人聲與伴奏是否形成了協調的關係?

因此,V9.5 的人聲優化可以理解為「表達關係更完整」,讓音色與唱法共同服務於歌曲意圖。

4. Prompt 和曲風執行更加穩定

V9.5 繼續提升把創作者要求轉化為音樂選擇的穩定性。Prompt 中的曲風、情緒、人聲方向和編配描述,可以在歌曲中形成持續、清晰的聽感,並貫穿主要段落。

在同一輪評測中,V9.5 的 Prompt 控制良品率為 97.0%,前代基線為 92.0%;曲風完全體現比例為 95.7%,前代基線為 84.9%

這兩項數據說明,V9.5 的優勢不僅體現在「能識別 Prompt」,還體現在把 Prompt 中的方向延續到完整歌曲中。比如,曲風描述中的核心樂器、節奏感、人聲狀態和空間氛圍,可以共同組成一個連貫的音樂結果。

歌曲評測:V9.5 的能力画像

以下數據來自 100 首歌曲同口徑評測。「前代基線」指該輪評測中的對照基線,這組數據用於刻畫 V9.5 在對應樣本中的能力變化;不同語言、曲風和 Prompt 可結合具體創作場景進一步觀察。

評測維度前代基線V9.5變化
整體聽感良品率34.0%35.0%+1.0%
人聲表現良品率53.0%61.0%+8.0%
音質類良品率均值34.5%35.0%+0.5%
Prompt 控制良品率92.0%97.0%+5.0%
曲風完全體現比例84.9%95.7%+10.8%
音頻健康率81.0%84.0%+3.0%
綜合可用率25.0%28.0%+3.0%

從這組數據可以看到,V9.5 的變化集中在三個方面:

  • 人聲表達更穩定: 人聲表現良品率提升 8.0 個百分點。

  • 創作意圖更容易被聽見: Prompt 控制良品率提升至 97.0%。

  • 曲風識別更清楚: 曲風完全體現比例提升至 95.7%。

整體聽感、音質類良品率、音頻健康率和綜合可用率也都有提升,但幅度相對克制。這說明 V9.5 是一次圍繞多項能力共同成立的升級,而不是只追求單一指標的變化。

V9.5 的取捨:自然形態與第一耳衝擊力

V9.5 與部分對照方案之間的差異在於:一些對照方案在編配豐滿度、聲部數量和第一耳抓取力上更突出,因此更容易形成「聲音很多」「第一印象很滿」的聽感。

V9.5 選擇的是更有層次的方向:讓編配密度服務於段落和情緒,讓人聲、主旋律和曲風意圖保持更清晰的關係。

這體現了 V9.5 更明確的音樂取向:用更有層次的編配,帶來更自然的音樂形態、更可信的人聲表達和更穩定的創作意圖執行。

因此,試聽 V9.5 時,可以從完整歌曲出發比較:段落是否有發展,情緒是否有推進,副歌是否被主歌托起,人聲是否始終處於合適的位置。

Demo 試聽:從不同音樂方向觀察 V9.5

《Melted Chrome》:小眾曲風的完整表達

Melted Chrome 2分版
0:0001:57

這首 Demo 以西海岸 G-Funk 為方向,提示詞中明確寫到合成器低音、Moog 哨音、Talkbox 氛圍、Rhodes、哇音吉他、復古磁帶質感、靠後的鼓點和沙啞男聲。

它適合用來觀察 V9.5 如何把曲風、地域文化聯想、樂器選擇、節奏位置和人聲狀態組織成完整的聽感,讓風格特徵從標籤轉化為可聽的音樂細節。

《Still in the Room》:完整而穩定的 Dream Pop 編配

Still in the Room
0:0005:08

這首 Demo 的 Prompt 包含混響吉他、漂浮感男聲、柔和氛圍合成器、溫暖貝斯和鬆弛鼓組,整體指向朦朧、親密、內省且帶有距離感的 Dream Pop 氛圍。

它適合用來觀察不同聲部如何共同維持空間感,以及歌曲如何透過層次變化保持完整的曲風表達。

V9.5 更多音頻素材

JUST MISS ME (2)
0:0002:27
NO KEY (1)
0:0003:16
NO TE SALE FINGIR (1)
0:0005:14

創作者如何判斷一次 V9.5 生成?

可以使用下面這套四步試聽方法:

第一遍:聽結構

建議完整聽完歌曲,再判斷主歌、預副歌、副歌和橋段是否承擔了不同任務,段落之間是否形成明確變化。

第二遍:聽人聲和歌詞

檢查歌詞重點是否清楚,人聲是否在正確的段落表達了對應的情緒,關鍵詞是否被準確傳達。

第三遍:聽編配空間

關注伴奏密度、聲部進入和退出、主旋律位置,以及人聲是否始終擁有足夠的聽覺空間。

第四遍:聽 Prompt 是否貫穿全曲

確認曲風、情緒、樂器、人聲方向和空間質感是否從開頭延續到結尾,並在主要段落保持清晰。

常見問題

V9.5 的「自然」具體指什麼?

它主要指音樂元素之間的關係更加協調:編配密度會隨段落變化,人聲與伴奏更匹配,情緒按照結構發展,曲風意圖在全曲中保持清晰。

V9.5 如何處理編配密度?

編配可以根據段落任務保持靈活密度,聲部需要空間。V9.5 讓聲音選擇服務於歌曲表達,並透過層次變化保持音樂張力。

哪些指標最能體現 V9.5 的升級?

從歌曲評測看,人聲表現良品率、Prompt 控制良品率和曲風完全體現比例的變化最明顯,分別達到 61.0%、97.0% 和 95.7%。

選擇 V9.5 版本時,應該只看第一耳聽感嗎?

第一耳可以判斷整體吸引力,同時建議繼續檢查段落發展、歌詞清晰度、人聲與伴奏的關係、曲風連續性和完整歌曲的情緒推進。

總結

Mureka V9.5 的更新重點,是讓模型更好地理解一首歌如何作為完整音樂形態成立。

它透過 MusiCoT 連接全曲結構與局部表達,讓編配可以有密度變化,讓聲部擁有空間,讓人聲、歌詞和伴奏形成更自然的關係,也讓 Prompt 中的曲風和情緒意圖更穩定地貫穿全曲。

V9.5 在人聲表現、Prompt 控制、曲風表達、音頻健康和綜合可用率等維度都取得了提升。對創作者來說,它帶來的核心價值可以概括為:更清晰地表達想法,更自然地組織聲音,更穩定地把一個創作方向發展成完整歌曲。