SynapseWire

K2 Horizon:第一款真正開源的前沿 AI 模型

阿聯酋基礎模型研究院釋出 K2 Horizon,包含權重、程式碼、訓練資料與中間檢查點,從手錶大小的 0.9B 到企業級 375B。『真正開源』到底改變了什麼。

作者: SynapseWire 編輯部 發布於:
桌上擺著一台筆記型電腦,螢幕上是模型架構圖,旁邊放著手錶與手機,暗示不同的裝置尺寸

「開源 AI」這個講法,過去幾年其實一直有點偷換概念。一家公司把權重丟出來,大家就鼓掌,結果你回頭一看:訓練資料是機密、程式碼殘缺不全、真正讓模型有用的那些細節全部上鎖。K2 Horizon 這次想打破的就是這件事。

這不是又一次「開放權重」的交差。阿聯酋基礎模型研究院(IFM)把權重、程式碼、訓練資料、方法論、還有中間訓練檢查點全部釋出。創辦人 Eric Xing 接受路透社訪問時說,目標是「替真正的開源釋出立一個參考點」。這句話的炮口,直接指向業界其餘那些人。

「真正開源」到底是什麼意思

差別很重要,因為業界嘴上說的「開源」,多半不是那個意思。所謂開放權重,大陸幾家開發者很愛用,給你一個下載,然後就靠你自己猜它是怎麼煉出來的。你拿到的是訓練好的權重,但沒有資料、沒有前處理、沒有形塑結果的那些決策。你用得動它,卻研究不了它。

封閉模型走的是完全相反的路。OpenAI 跟 Anthropic 根本不放模型出來下載,也不公布背後的資料與技術。你拿到的是 API,外加一張沒人能稽核的路線圖。

K2 Horizon 兩種都不算。它把訓練資料、程式碼、方法論、中間檢查點一起放出來,讓研究者可以往回追溯整個開發過程、重現結果。這就分出差別了:知道一個模型是怎麼做出來的,跟只知道它會吐出什麼,完全是兩回事。對研究者、稽核者、還有任何想弄懂「為什麼這個模型會這樣反應」的人來說,這是能力上的真改變。

授權也補強了這一點。模型跟程式碼用 Apache 2.0 釋出,這是最寬鬆的授權之一,而且它是連程式碼一起授權,不是事後補一句。

從手錶上的模型,到資料中心的模型

這個家族系列跨度大得異常。K2 Horizon 一共有七種尺寸,最頭跟最尾真的是兩種產品。

最底下是 0.9B 的模型,研究院說它在數學、推理、工具使用上是同尺寸最佳,小到可以跑在手錶上。還有 3.7B,說是適合微調,4B 以下推理最強;7B 則號稱 10B 以下最佳,有很強的軟體工程與深度研究能力,手機就能跑。

中間尺寸才是本機部署有趣的地方。32B 的稠密模型是給筆電跟自架伺服器用的;36B 但只啟動 4B 參數的模型,用新架構做到打敗更大的模型,同時本機跑起來很省。

最上面,375B-A23B 的模型要扛最強能力,瞄準企業級重度部署。這一個發布,同時涵蓋了智慧手錶跟一整座機房。

它現在就可以拿,透過 Hugging Face、vLLM、SGLang,代管則有 Compass、Cerebras、AWS、Nebius 這幾家夥伴。

撐起效能的兩項技術

效能宣稱背後有兩項技術創新,都值得認識,因為它們改變了你對小模型的想像。

第一項是「擴散蒸餾」。它不是一次生成一個 token,而是平行生成一整個區塊的 token。IFM 說這讓速度提高約三倍,而且不犧牲回覆品質。這個數字是重點,因為推論速度往往決定了小模型到底能不能用。

第二項是「價值混合注意力」架構,出現在 36B 那顆模型上。它的精神是在不加更多運算的前提下把推理做好,這正是為何這顆模型可以 36B 參數、卻只啟動 4B。這個比例就是它本機部署省錢的原因,因為你只為真正在跑的參數買單。

這兩招常常被歸類成「我們把它變快了」然後就被遺忘。但正因為有它們,一顆塞得進手機的模型,現在才敢宣稱有頂尖的推理能力。

開放權重、真正開源、封閉,三者比一比

把三種做法並排,差別其實在於「信任」。

開放權重的模型有用但黑箱。你能微調它,卻很難驗證訓練資料有沒有引入偏誤、benchmark 數字是不是誠實的。真正開源的模型讓你能檢查。這不只是學術。對監管、對企業採購、對任何得為模型行為負責的人來說,能不能稽核建造過程,差很多。

Xing 的講法很刺:開放跟競爭力不是互斥的。很長一段時間,大家拿來替封閉模型辯護的理由,就是「開放會犧牲品質」。如果 K2 Horizon 的 benchmark 宣稱在規模上站得住腳,等於用具體方式戳破了那套講法。

這同時也是替「開源 AI」重新定義。過去的標準是「公司願意給你什麼」,IFM 想設一條新基準,即便要花幾個版本的釋出,才能讓這變成大家的期待。

對開發者來說代表什麼

如果你在模型上面蓋東西,實際的差別在「你可以在哪裡跑」跟「你能對它知道多少」。

裝置端的工作變得更有空間。0.9B 你可以戴著,7B 可以塞進手機,這改變了離線跟隱私推論的可能性。如果你一直把東西全丟給 API,現在有本事把一台夠強的模型留在本機,你的延遲、成本、隱私的算式會同時變動。

已經在本機部署的團隊,要看的是 32B 稠密跟 36B 稀疏這兩顆,適合自架伺服器或筆電工作負載。Apache 授權代表你可以直接嵌進產品,不用做平常那些法律體操。

如果你在意的是微調,選 3.7B。它是明擺著給開發者跟研究者做的,同尺寸推理最強,加上有訓練資料跟檢查點,你可以真的追蹤微調怎麼改變模型,而不是靠猜。這是一般開放權重釋出不支援的工作流程。

該提到的保留

一顆邀請你重現的模型,也同時邀請你去檢查它的宣稱,這裡有幾個老實的限制要先講。

第一,benchmark 不是現實。那組「同類最佳」的數字,是在實驗室挑的測試套件上量出來的。一顆在數學跟推理上同尺寸封頂的 0.9B,不代表你會放心拿它上生產線。宣稱是「類別」層級的,你還是得自己跑 eval,才知道特定模型在你資料上做什麼。好的點在於,有訓練資料跟檢查點,你反而能比平常更嚴謹地建 eval。

第二,開源不代表免費跑。就算是 7B 也要真的算力。36B 稀疏的模型便宜,是因為啟動的參數少,但頂級模型還是要硬體。開源拿掉的是授權那堵牆,不是電費單。

第三,釋出的資料乾淨,跟釋出的資料「完全乾淨」,是兩回事。可重現性告訴你模型怎麼煉的,不代表訓練集的每個角落都來源無虞。這是兩個問題,都得看。

這些都不會折損這次發布。它只是提醒你,誠實評估的方式是去跑它,而不是讀新聞稿。

更大的地緣政治圖景

這不是在矽谷發布的。基礎模型研究院是阿聯酋想把自己推向全球 AI 樞紐的一步,時機是算好的。

一顆合法、完全開源、又有競爭力的前沿模型,從波斯灣冒出來,會改變「開放 AI 住在哪裡」的討論。它也給政策制定者跟公益倡議者一個具體例證:開放跟效能可以並存。這本身就是這次釋出的重點,跟 benchmark 一樣重要。

真正的考驗是接下來發生什麼。單一次釋出不會撼動產業。但 K2 Horizon 替「什麼叫真正開源的模型」設了一條線,從這裡開始,問題是其他人會不會跟。開源 AI 的討論卡在一顆低標已經很久了,這是第一次有夠格的實驗室跨過它。

想更了解這個跟成本效能的關係,我們的開源 AI 對比雲端 API 分析把取捨講得很清楚。要看小模型已經能做到什麼程度,本地語音助理教學是很棒的起點。至於 AI 程式代理,則是「完全開源模型加開發者工具」的另一面,也推薦一讀。

分享文章

留言評論

0 則評論

暫無評論,搶先發表你的看法吧!

相關文章