Copilot 的 HydraFusion 能省錢,但只贏過 Opus 一次
GitHub 在 Copilot CLI 放了多模型路由預覽。三個基準成本都下降。品質只在 TerminalBench 2.1 勝過 Claude Opus 5。
GitHub 把 Project HydraFusion 做成 Copilot CLI 的研究預覽。簡報上很好寫:別再把每件程式工作丟給同一顆前沿模型。先替這個請求組一條短流程,貴的呼叫只留在便宜草稿過不了關的時候。
傳得最遠的數字是 TerminalBench 2.1。對上 Claude Opus 5,HydraFusion 估計成本低 67%,通過驗證的品質分高 4.9 點。公告圖就是這張。品質往上走的,也只有這張。
VentureBeat 把另外兩行補齊。DeepSWE:便宜 36%,品質低 1.5 點。CheckpointBench 是 GitHub 用真實 Copilot 會話做的重播集:便宜 65%,品質低 0.1 點。成本贏三次。品質贏一次。
你如果已經住在 Cursor 裡,或是因為「這顆比較聰明」在付 Claude,沒必要為了這篇拆編輯器。值得看的是 CLI agent 把 token 燒在哪。
實際落地的是路由器,不是新權重
HydraFusion 不是新模型。它是三種執行型態的路由器,所有 Copilot 方案都能在 Copilot CLI 用 /experimental 打開。帳單按底下各模型的正常單價算。沒有 HydraFusion 這個 SKU。跑了哪些腿,就付哪些腿。
GitHub 說系統會讀推理、寫碼、除錯、工具使用這些能力訊號,再選一條「應該過品質線」的最便宜流程。部落格裡的對照是 Claude Opus 5 與 GPT-5.6 Sol,推理強度都設中等。缺結果的處理方式各輪相同。成本含草稿、評論、改寫、升級、重試、後援。最後這句才是關鍵。拿 HydraFusion 去比「一次 Opus 呼叫」,帳本對不上。
MarkTechPost 整理的三種型態:
- Single. 一顆模型,不再審。
- Cascade. 便宜模型先寫。品質閘門通過就收,不通過就升級。
- Critique. 一顆寫,另一個模型家族的唯讀評論者看,原作者改一次。官方拿 Rubber Duck 來比。
VentureBeat 引 Awan Farz 的讀法,Cascade 就一句:每次 Cascade 請求都先付便宜模型。貴的只跑沒過閘門的那一小撮。不是魔法。是帶發票的 if。
把表讀完,不要只截第一欄
TerminalBench 2.1 是終端機裡的多步任務,跟 Copilot CLI 的使用場景近。那裡品質加 4.9、錢少三分之二,對「agent,從 shell 把這段整合修好」這種日子是真的。
DeepSWE 是倉庫級工程:跨檔依賴、整段修完。HydraFusion 比 Opus 低 1.5 點,便宜 36%。GitHub 說這是划算的取捨。前提是你本來就要為每個 DeepSWE 形狀的任務付 Opus。這不是「前沿品質,更便宜」。這是「差不多 Opus,更便宜」。兩句不能混著講。
CheckpointBench 該信、不該拿去吹。它從真實 Copilot 軌跡來,錨在不可變的公開 commit 上,跑得回去。HydraFusion 幾乎打平 Opus(低 0.1),成本少 65%。這才是比較誠實的產品句:在 Copilot 真正會碰到的活上,品質能留住,錢能少燒。
GitHub 說路由策略是用 beam search 在三個集合上一起爬,不是為單一基準調參。把它當成意圖。你的私有巨型 repo 是不是同一分布,部落格決定不了。
它不是什麼
它不能取代你選 Claude 還是 Gemini 當預設腦。那題我們寫過,是產品形狀對上智力。HydraFusion 假設帳號上本來就掛好幾顆腦,讓軟體挑流程。
它不是本機。程式不能出門的人,看上週那篇 LM Studio Bionic 就好。Copilot CLI 的 /experimental 是多繞幾步的雲帳單。
它也治不好生產力悖論。token 變便宜,只會讓更多沒人要的 diff 被接受。閘門判錯的時候,路由器照樣會升級。測試還是要自己寫。HydraFusion 不幫你加測試。
它不便宜到不用看帳單。「估計成本低 67%」是對 GitHub 假設下的 Opus 5。若你的 Copilot 方案預設已經是較便宜的模型,差值會縮小。髒 repo 上 Cascade 一直重試,也可能比一次中階呼叫更貴。官方寫得很清楚:每條被叫到的腿都算錢。
怎麼開,才不算騙自己
先用在長得像 TerminalBench 的活:shell、多步、有邊界。架構重構、四百個檔的服務請人「先理解」,暫時仍指定模型。等你有一週軌跡再說。
記五天帳。每次 HydraFusion:CLI 有沒有回報型態、你有沒有收下補丁、CI 綠不綠、成本體感。五天夠看出 Cascade 是在做事,還是什麼都在升級。
別指著祕密開。多模型流程代表更多供應商看到提示。公司若已經禁某些 repo 用 Copilot,HydraFusion 不是後門。政策更重要,因為同一段程式現在可能進兩家。
盯品質閘門。若便宜草稿在你希望有第二讀者的任務上一直過關,你就活在 DeepSWE 那行虧損裡。那類工單把實驗關掉。
GitHub 自己的用詞是研究預覽。/experimental 不是 SLA。
比較能活過新聞週的那一段
有意思的不是「我們把 Claude 和 GPT 混在一起」。大家都在混。有意思的是第一個 token 之前先選流程:Single、Cascade、還是 Critique。
這比較接近小心的人本來就在做的事。簡單 grep:做一次。難搞的 bug:便宜先寫,再付錢找人看。跨家族評論是多數人省掉的步驟,因為再開一個分頁很煩。把這段摩擦自動化,才是產品。
GitHub 搜出來的策略適不適合你的 repo,不是一篇表能回答的。表仍然有用。它提前告訴你失敗長什麼樣:截圖裡成本會很好看,三個公開測試裡有兩個品質是「有點像 Opus」,唯一的勝場住在終端機 agent 基準裡,而那本來就對終端機產品友善。
若這就是你要的取捨,打開 /experimental,把收據留下。若你指望路由器讓 Opus 退休,去截 DeepSWE 那一行。
分享文章
留言評論
0 則評論暫無評論,搶先發表你的看法吧!
相關文章
AI 生產力悖論:為什麼你的團隊寫了更多代碼,卻交付更少功能
AI 編碼工具承諾更快的交付速度。Faros AI 2026 年對 22,000 名開發者的數據顯示了相反的結果:更多 Bug、更多事故、更少部署。這是為什麼。
Goose 能換模型,換不掉 token 帳單
Block 的開源 agent 用同一套桌面程式和 CLI 接 Claude、Gemini、本機模型跟 MCP。Spotify 同一週用 bulk-reader 把 Claude Code 的 token 砍了約九成。先裝 Goose,再讓它少讀檔。
Claude 對上 Gemini:2026 年該為腦還是為產品付錢
PCMag 最新對決指出 Claude 推理與寫程式仍較強,Gemini 則在價格、Google 整合與 5 美元方案勝出。這篇只談你每天會碰到的差別。