Anthropic、Google、Meta 同一週推出新模型
Claude Fable 5.1 帶頭,Google 出 Gemini 3.8 Flash,Meta 出 Muse Spark 1.3。GPT-6 佔了標題,其餘三家才是你訂閱頁會改到的東西。
OpenAI 這週用 GPT-6 Astra 把版面佔滿。Astra 怎麼放、煞車怎麼踩,我們已經寫過。其他實驗室沒有停工。CNET 的整理比較準:Anthropic、Google、Meta 在同一小段日子裡把新權重丟出來。
36Kr 轉的 CSDN 9 月 3 日稿把日曆寫清楚:9 月 1 日 Anthropic 發 Fable 5.1 與 Mythos 5.1;接著 Google 出 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber;Meta 出 Muse Spark 1.3。只追 Astra 討論串的人,會錯過真正會改到帳單的那幾行版本號。
三家實驗室,同一個日曆週
2026 年的版本號愛扎堆,因為沒有人想空白一週。這次更密。Anthropic 自己的公告把 Fable 5.1 與 Mythos 5.1 說成編碼與知識工作最强的一檔,並附一個研究示範,好讓「科學進展」這頁有圖可截。
Google 這次是 Flash 一對,通常翻譯成較便宜、較快,再加一個名稱裡有 Cyber 的 SKU。Meta 的 Muse Spark 1.3 則想聽起來像同事,而不是補全引擎。
第一天不必重跑評測表。先分清楚:哪個公開賣、哪個是上鎖的雙胞胎、哪個把推理開到最大就會把 token 吃光。
我們先前那篇 Claude 對 Gemini 寫的是產品形狀,不是這組版本字串。這篇是新聞疊上去,不是取代。
Fable 與 Mythos 是政策分叉,不是兩顆腦
Anthropic 有一句很容易略過,卻是整次發布的核心:Fable 5.1 與 Mythos 5.1 是同一個模型,防護等級不同。Fable 公開供應。Mythos 只走可信存取,多出來的欄杆對著網路安全與生命科學。
這不是「Mythos 比較聰明」。這是「Mythos 被允許做聊天窗不賣的工作」。你若不在可信存取名單裡,在社群上吵 Mythos 5.1 等於寫同人。
CNET 補了對已在付 Fable 的人有用的一句:低或中等 effort 時,Fable 5.1 應對齊 Fable 5,帳單更低。若屬實,升級不是換性格,是用較便宜的方式拿到舊能力,需要時再把 effort 拉高。
36Kr 引 Artificial Analysis 綜合智力指數,Fable 5.1 以 66 分排第一。指數不是聖經,只能說明這次沒交白卷。同一篇也警告:最高強度時 token 很兇。這就是 agent 流程裡「推理全開然後罵發票」的標準死法。
工作是在 repo 裡改程式,Fable 5.1 才是你真正打得開的那個。工作是靶場或實驗室,Mythos 是採購流程,不是畫面上的模型下拉選單。
金星地圖,以及這裡的「研究」指什麼
Anthropic 的科學示範具體到可以複述。Fable 5.1 訓練了一個網路,用三十多年前 Magellan 的雷達影像,加上已有的五分之一行星地圖,做出覆蓋金星三分之一的高解析高程圖。官方說解析到兩到三公里。
這是有公開資料的反問題,不是改寫行星科學的論文,也不是「模型寫了一首金星詩」。要宣稱研究能力,帶解析度數字的地圖是對的那種宣稱:可核對、不好看、綁在 NASA 舊資料上。
別和上週 K2 Horizon 搞混。K2 講的是你能下載的權重。Fable 5.1 是託管模型在新聞稿上做完一份地球物理作業。軸線不同。
工程上能用的結論比較小:這些模型會繼續拿「看起來像科學」的示範,因為科學有檔案。你自己的研究型工作,更接近金星那題(髒輸入、數字輸出、單位不能瞎編),而不是聊天討論 AGI 的意義。
Gemini 3.8 Flash 是便宜那條路
36Kr 的數字:同一指數上,Gemini 3.8 Flash 在最高推理強度拿 59,而且可以把思考調低來壓單次成本。他們稱之為勞工馬。這就是產品定位。買 Flash 不是為了贏排行榜截圖,是為了那八成根本不該碰到 Fable 的呼叫。
CNET 把 Gemini 3.8 與 3.8 Flash Cyber 列成 Google 這週的一半。Cyber SKU 已是固定套路:給採購單上必須寫「資安」的客戶一隻稍微鎖緊的雙胞胎。它不會自動等於 Mythos。Anthropic 的可信存取門檻,和 Google 的 Flash Cyber 徽章,是兩份文件。
量已經放在 Gemini 上的人,去釘 3.8 Flash 再做負載測試。重重構已經放在 Claude 上的人,不要因為 Flash 多了一分就改預設。用你真正在付錢的那些工作來跑。
分類、抽取、摘要工單,延遲和單價仍比指數分重要。那些放 Flash。一次錯 API 呼叫貴過 token 的,放 Fable 5.1。
Muse Spark 1.3 想先問再動手
CNET 寫 Meta 的重點是行為,不是分數。Muse Spark 1.3 被訓練成:提示含糊就先問清楚,agent 流程裡要先確認再行動。Muse Code 和 Meta 的 Model API 都有。
36Kr 補效率口號:比較少的工具呼叫、比較少的 token、長任務比較撐得住上下文。這跟 Fable 開到最高強度的問題相反。Meta 想靠「少做一點」贏 agent 迴圈。
聊天窗裡先問一句是禮貌;沒人值守的 cron 裡先問一句是事故。若把 Spark 1.3 接進無頭 agent,要先規定「模型問了但現場沒人」時怎麼辦:失敗退出,或注入預設。不要假設 tool_choice 打開時,先確認再行動的訓練會自己變成 no-op。
Meta 需要一個能和 Claude、Gemini 出現在同一句話裡的模型。Spark 1.3 是這次的嘗試。進 Muse Code 代表它是產品,不是研究傾倒。拿需求含糊的長重構去試,那才是澄清式訓練針對的場景。別先拿去跑沒人看的批次。
8 月 2 日之後的浮水印
Anthropic 公告裡有一條會比版本號活得久。2026 年 8 月 2 日之後發布的模型,輸出帶浮水印。那是只有偵測 API 讀得到的數值訊號。官方說:其它情況看不見、不含使用者或對話中繼資料、不影響品質。
你若把模型輸出當自己的文章發出,偵測器現在比較有機會抓到 8 月 2 日之後的 Claude。學校或新聞室若已買偵測器,問它認不認這個 API。
公司若用 Claude 起草客戶信,依 Anthropic 的說法浮水印不是隱私外洩,是出處標記。法務仍要決定在你的法域裡這算不算一回事。工程不該進房間討論怎麼改寫輸出來躲浮水印。
這週二手報導裡,Google 與 Meta 沒有把浮水印當頭條。不代表它們的輸出沒標記,只代表 Anthropic 選擇說出來。
怎麼選,而不再跑一場評測
鎖版本。已經住在 Claude、又在意低/中 effort 成本承諾的,用 Fable 5.1。需要更便宜預設、可以把 Cyber 放到安全帳號的,用 Gemini 3.8 Flash。想要 agent 在 rm 之前先問、且你願意留在迴圈裡的,試 Muse Spark 1.3。
三家同一週出貨時,不要搬生產級的工具呼叫圖。先看幾天發票。看 Fable 5.1 中等 effort 是不是真的像 Fable 5。看 Spark 1.3 會不會停在那裡等人答。看 Flash Cyber 的額外規則會不會打爆評測。
Astra 可以繼續當大聲的那個。比較悶的問題是:十一月稿件過期之後,這三個你還會打哪一個。多數團隊仍是 Flash 扛量、一顆貴的腦扛會出聲的失敗。這週只是把兩邊都改了名。
分享文章
留言評論
0 則評論暫無評論,搶先發表你的看法吧!
相關文章
又一名 Anthropic 研究員離職,同事說他沒講錯
Jacob Coxon 本週離開 Anthropic,說實驗室在衝向自我改進的超智慧。Evan Hubinger 回他:我們真的相信 AI 可能殺死所有人,然後把八月風險報告丟出來。
Claude Opus 5 vs GPT-5.6:你到底該用哪個 AI 模型?
兩個頂尖 AI 模型在 2026 年 7 月相隔兩週內發布。這裡是它們在基準測試、定價和實際應用場景上的真實比較。
OpenAI、Anthropic、Google API 漏洞讓較弱模型破解較強模型的推理過程
研究人員發現,透過 API 操控,較便宜的 AI 模型可以從前沿模型中提取隱藏的推理痕跡,過程中還暴露了個人識別資訊和憑證。