Suno 遭駭客入侵:原始碼曝光 AI 音樂模型如何從 YouTube、Deezer 偷歌訓練
AI 音樂生成器 Suno 遭供應鏈攻擊,外洩原始碼揭露其抓取 YouTube Music、Deezer、Genius 等平台數百萬首歌曲進行模型訓練,引發版權與資料透明度的雙重危機。
2025 年 11 月,AI 音樂生成器 Suno 遭遇了一次供應鏈攻擊。駭客透過入侵第三方服務取得員工憑證,拿到了 Suno 的原始碼——然後把這些資料交給了 404 Media。直到 2026 年 7 月,外界才真正知道那次攻擊到底洩漏了什麼。
答案比任何人想的都更具破壞性。
不是「訓練資料爭議」,是偷竊的證據
根據 404 Media 記者 Jason Koebler 取得的內部文件,Suno 的 AI 模型使用從以下平台大量抓取的音訊進行訓練:YouTube Music、Deezer、Genius(歌詞資料庫)、多個商用音樂素材庫,以及 Podcast RSS feed。幾十年的音訊內容,全都進了訓練管線。
Suno 之前從未公佈過具體的訓練資料來源。被問到時,他們的標準回應一直是「使用網路上公開可用的音樂檔案」。在 RIAA(美國唱片業協會)提起的訴訟中,Suno 甚至大方承認確實用版權作品進行訓練,理由是「合理使用」。
但駭客外洩的內部文件揭示了一個關鍵區別:公開可用 ≠ 合法抓取。
YouTube 的服務條款明確禁止自動化資料抓取。《數位千禧年著作權法》(DMCA)也禁止規避平台的反爬蟲保護措施。Suno 的做法同時踩了這兩條線。競爭對手 Udio 也被指控做了同樣的事。
「合理使用」的辯護在這種情況下變得非常脆弱。法官要面對的問題不是「AI 能不能從公開資料學習」,而是「故意繞過平台保護機制去抓資料,還算不算合理使用」。
還有一個諷刺的細節:被 Suno 抓取歌詞的 Genius,自己當年也是靠抓取 Original Hip-Hop Lyrics Archive 這個 Web 1.0 時代的歌詞資料庫起家的。歷史總是驚人地相似——只不過這次的規模大了好幾個數量級。
RIAA 的訴訟不只是針對 Suno 一家公司。它是一個測試案例,用來判斷在 AI 訓練資料的語境下,著作權法到底還有沒有牙齒。如果 Suno 輸了,整個 AI 音樂產業的商業模式都要重寫。如果 Suno 贏了,「合理使用」的邊界會被拉到一個沒有人真正準備好接受的位置。
一年前就被駭,客戶到現在才知道
比訓練資料爭議更讓人不舒服的,是 Suno 對那次安全事件的處理方式。
駭客除了拿到原始碼,還取得了客戶資料:電子郵件地址、電話號碼,以及 Stripe 中的部分信用卡號碼。Suno 從未主動通知受影響的用戶。
當 Pitchfork 向 Suno 求證時,公司發言人是這樣回應的:「2025 年 11 月,我們確認 Suno 遭遇了一次有限的安全事件,並已迅速控制。我們立即展開調查,確認事件主要涉及已不再使用的過時原始碼,且沒有敏感的個人資訊遭到洩露。」
八個月。一次「迅速控制」的事件,客戶等了八個月才從新聞裡知道自己的資料可能外流了。
更大的問題:訓練資料的透明黑洞
Suno 事件只是一個縮影。整個生成式 AI 產業——從文字模型到圖像模型,再到音樂模型——都面臨同一個問題:沒有人知道這些模型到底吃了什麼。
OpenAI 不再公佈 GPT-4 的訓練資料細節。Anthropic 對 Claude 的訓練語料三緘其口。Midjourney 被藝術家集體訴訟,仍在法庭上爭論訓練資料是否受商業機密保護。
Suno 的案例之所以特別,是因為我們第一次看到了證據——不是猜測,不是推論,而是被駭客從內部伺服器拿出來的程式碼和資料庫記錄。它證實了很多人長期以來的懷疑:AI 音樂公司的商業模式,從一開始就建立在未經授權的大規模資料抓取之上。
這不只是一個法律問題。對音樂人來說,它關乎生計——當 AI 可以在幾秒內生成模仿你風格的歌曲,而訓練資料正是你花幾十年創作出來的作品時,「合理使用」這個詞聽起來更像諷刺。
Human Artistry Campaign(由多個音樂產業組織組成的聯盟)一直在抗議這種模式。他們的核心論點很簡單:你不能先拿走創作者的作品去訓練 AI,然後用 AI 生成的內容反過來跟創作者競爭。這不是技術創新,這是掠奪。
Suno 不是唯一這樣做的公司。Udio 面臨類似的指控。Google(YouTube 的母公司)自己也被多家大型圖書出版商指控侵犯版權——理由是 Google 掃描書籍來訓練 AI。這形成了一種詭異的局面:Suno 被抓到從 Google 的平台上偷資料,而 Google 同時也在法庭上為自己的訓練資料來源辯護。
八個月。一個駭客。一段揭露產業真相的程式碼。
Suno 事件最讓人不安的不是它做錯了什麼——那些事很多人早就懷疑了。而是連「被駭客入侵、原始碼外洩、客戶資料暴露」這麼大的事,都不能讓這個產業開始認真討論訓練資料的透明度。如果連這種程度的曝光都推不動改變,那還有什麼可以?
分享文章
留言評論
0 則評論暫無評論,搶先發表你的看法吧!
相關文章
Meta Muse Image 登場:社群巨頭首款自研 AI 生圖模型,免費好用但有隱私代價
Meta 超級智慧實驗室推出首款自研 AI 圖片生成模型 Muse Image,免費內建於 Instagram 和 WhatsApp,還能直接把公開 IG 照片拉進創作中——但正是這項功能,引發了不小的隱私爭議。
Krea 2 開源:RAW 與 Turbo 雙模型如何重塑圖像生成工作流
Krea AI 開源美學優先圖像模型 Krea 2,RAW 負責 LoRA 訓練、Turbo 負責八步快速出圖。解析其架構、授權條款與對創作工作流的實際影響。
AI 音樂影片生成工具爆發:2026 年重塑創意工作流程的 10 款工具
從文字生成音樂影片到 AI 剪輯工具,新一波工具正在自動化 MV 製作流程。本文整理目前可用的工具、比較各自特色,以及對創作者的意義。