會唱整首歌的開源模型:阿里巴巴發布 Qwen-Music 技術報告
阿里巴巴 Qwen 團隊發布 Qwen-Music 技術報告,定位是能產出「高音樂性、高保真、含完整人聲演唱」的音樂生成模型。核心任務有兩個:文字生成音樂——從文字描述、歌詞與音樂屬性直接生成全新歌曲;翻唱生成——把既有歌曲用不同的風格與聲線特徵重新詮釋。架構上整合三個核心元件,包括專用的音樂分詞器 Qwen-Music-Tok 在內。
放在 Qwen 家族的脈絡看,音樂是他們補上的又一塊拼圖:兩天前才在 WAIC 預告 2.4 兆參數的 Qwen3.8-Max(見今日開源線),語言、多模態、音樂的產品線正在拉齊,而且延續一貫的開放路線。對比美國同行,Suno 與 Udio 都是封閉的商業服務,完整人聲歌曲生成以開放形式釋出,能力的擴散速度會完全不同。
尷尬的是日曆:技術報告發布的同一天,Sony 對 Udio 開出三萬首歌的侵權清單(見今日訴訟線)。翻唱生成功能——用不同聲線重唱既有歌曲——正踩在唱片業最敏感的紅線上;訓練資料的來源與授權狀態,報告裡照例是最少著墨的部分。
歸剛點評:能力面值得肯定,完整人聲演唱的開源模型是個里程碑;但法律面幾乎可以預告劇本——唱片業告得動 Udio,告不動開放權重,接下來的攻防會轉向託管平台與應用層。想拿 Qwen-Music 做產品的人,翻唱功能碰都別碰,原創生成也先弄清楚你所在市場的著作權判例再上。
歸剛點評|完整人聲歌曲生成首次以開放形式出現,能力擴散不可逆,AI 音樂的版權攻防將從告新創轉向整個開放生態。