SynapseWire

AI Edge Gallery 登陸 Mac:離線跑 Gemma 4 的官方新選擇

Google 在 6 月 4 日把 AI Edge Gallery 帶上 Mac,免費下載、離線執行 Gemma 4 12B 等五款模型。這篇整理硬體門檻、架構亮點、與 Ollama 的定位差異,以及到底該不該裝。

作者: SynapseWire 編輯部 發布於:
一台 Mac 筆電在木質桌面上離線執行本地語言模型介面的編輯插畫

Google 在 6 月 4 日把 AI Edge Gallery 桌面版搬上了 Mac。根據 AppleInsider 的報導,這是 Google 第一次為 Mac 使用者提供自家的本地模型執行工具:去官方網站下載安裝檔,不用註冊帳號、不用碰命令列,就能在完全離線的狀態下跑 Gemma 系列模型。同一天 Google 還發布了 Gemma 4 12B 模型,以及一個叫 AI Edge Eloquent 的系統級離線聽寫工具。

先講結論。如果你想在 Mac 上體驗本地 LLM,又一直被 Ollama 那套終端機操作勸退,AI Edge Gallery 是目前門檻最低的官方方案。但它只跑 Gemma 家族,定位跟通用模型管理工具不一樣,已經有本地部署習慣的人不需要搬家。

AI Edge Gallery 是 Google 的本地 AI 體驗應用,先前只在手機上提供。Google 官方部落格 6 月 9 日的文章還在引導使用者「到 iOS 或 Android 的 AI Edge Gallery 試用 Gemma 4」,桌面平台一直是空缺。

這次補上的就是這一塊。AppleInsider 指出,Mac 版從 6 月 4 日起在 Google 開發者網站開放直接下載。熟悉本地部署的玩家其實早就能在 Mac 上跑 Gemma,但過去得靠第三方工具自己拼,這是 Google 官方工具第一次到位。

報導也點出本地執行的實際好處:不用連網,資料不出機器,而且省掉雲端往返之後,回應往往更快。這些是整個本地 LLM 賽道共同的賣點,差別只在工具把門檻降到多低。

內建五款模型,16GB 記憶體是分水嶺

Mac 版 AI Edge Gallery 開箱提供五款模型,AppleInsider 列出的清單如下:

模型定位
Gemma-4-12B-it新旗艦,主打筆電上的代理式多模態能力
Gemma-4-E4B-itGemma 4 邊緣檔,效果與資源的折衷
Gemma-4-E2B-itGemma 4 邊緣檔,最輕量
Gemma-3n-E4B-it上一代邊緣模型,留給舊機型
Gemma-3n-E2B-it上一代邊緣模型,資源占用最小

門檻劃在記憶體上。Google 給 Gemma 4 12B 的最低要求是 16GB VRAM 或統一記憶體,AppleInsider 的說法是現代 Apple 筆電幾乎全數過關,唯一的例外是 MacBook Neo。換句話說,12B 這一檔是為 16GB 起跳的機器準備的。8GB 的舊機器也能用這個 App,只是得退到 E2B、E4B 這些小檔位。

我們先前在 Qwen3.5 小模型評測裡提過:本地部署玩到最後,卡住人的通常是記憶體,它決定你能跑哪一檔。這個結論放到 AI Edge Gallery 一樣成立,只是 Google 把選擇題簡化成了下拉選單。

Gemma 4 12B:免編碼器架構是真正的賣點

跟 App 一起發布的 Gemma 4 12B 才是這次更新的技術主角。Chrome Unboxed 的分析給了兩個關鍵數字:120 億參數的它,多步推理表現逼近 Google 自家 26B 的 MoE 模型,記憶體佔用卻不到對方一半,而且明確以 16GB RAM 的消費級筆電為目標硬體。

更有意思的是架構。傳統多模態模型處理圖片或聲音時,要先經過獨立的編碼器轉換成主模型看得懂的表示,這些中間層既吃記憶體又拖延遲。Chrome Unboxed 解釋,Gemma 4 12B 採用免編碼器(encoder-free)的多模態設計,視覺與音訊輸入直接進入主幹網路。這讓它成為 Google 第一個原生支援音訊輸入的中型開放模型,語音轉寫和翻譯都能在完全離線的情況下完成。

授權與生態的部分,Google 官方部落格提到 Gemma 4 全系列採 Apache 2.0 授權,家族累計下載量已超過 1.5 億次,較大的型號支援到 256K 上下文,官方也釋出了量化感知訓練(QAT)的檢查點。我們在 Gemma 4 發布解析裡判斷過 Google 的意圖:開放模型對它而言是吃下本地代理場景的入口。AI Edge Gallery 登陸 Mac 等於把這個入口從手機擴張到桌面。

和 Ollama、LM Studio 是同一回事嗎

不是,定位差很多。

AI Edge Gallery 是「官方展示櫃」:模型清單由 Google 決定,只有 Gemma 家族,換來的是零設定,模型跟硬體的適配也由官方先調好。Ollama、LM Studio 這類通用工具則是「自助倉庫」:Qwen、Llama、DeepSeek 想跑什麼自己拉,自由度高,但從挑模型到調量化都得自己來。

所以判斷標準很單純。你的需求如果是「在 Mac 上低成本體驗離線 AI」,AI Edge Gallery 的體驗會比自己架來得省事;你要是想跑 Gemma 以外的模型,例如我們評測過的 Qwen3.5 那幾檔小模型,那它幫不上忙,通用工具仍是唯一解。兩類工具會長期並存,誰也取代不了誰。

對開發者來說還有第三種視角:把模型塞進自己的產品。Google 的 builders 案例裡,HubX 用 4-bit 量化的 Gemma 4 E2B 做出離線英語家教 App BetterSpeak,語音和文字全部在裝置端處理。Gallery 在這條路上的角色是試衣間:先在自己的硬體上確認模型能力,再決定要不要往產品裡整合。

同場加映:Eloquent 聽寫與 DiffusionGemma

這週 Google 在本地 AI 上的動作不只一個。

第一個是跟著 Mac 版一起出的 AI Edge EloquentAppleInsider 介紹它是完全在裝置端執行的聽寫與文字編輯工具,用鍵盤快捷鍵喚出,可以在所有 Mac 應用程式裡使用,先前同樣是 iPhone 限定。對常做會議記錄或口述草稿的人,這個小工具的實用性可能不輸主角。

第二個是 6 月 10 日發布的實驗性模型 DiffusionGemmaGoogle 官方部落格說明它是 26B 的 MoE 模型,推理時只啟用 3.8B 參數,改用文字擴散方式一次生成整段文字,在獨立 GPU 上最高可達 4 倍生成速度(H100 上超過每秒 1000 token),量化後可塞進 18GB VRAM。官方同時坦承它的輸出品質低於標準 Gemma 4,定位是給開發者探索即時互動場景的實驗品。

把這些放在一起看,再對照上個月 Google I/O 的代理平台路線,Google 的分工已經很清楚:雲端歸 Gemini,裝置端歸 Gemma,而 AI Edge Gallery 是後者面向一般使用者的門面。

該不該裝?三種使用者的判斷

沒玩過本地 LLM 的 Mac 使用者可以直接裝。不花錢、離線可用、零設定,這是目前認識本地模型最便宜的方式。16GB 記憶體以上直接試 12B,8GB 的機器從 E2B 開始。

已經在用 Ollama 或 LM Studio 的人不用搬家。Gallery 跑不了 Gemma 以外的模型,對你沒有增量,倒是 Eloquent 這個離線聽寫工具可以單獨拿走。

想做裝置端產品的開發者,可以把它當免費的硬體相容性測試台:先在目標機型上確認 E2B 到 12B 各檔位的實際表現,再參考 BetterSpeak 的量化路線決定要不要整合。

最後留一個觀察點:桌面版目前只到 Mac,Windows 使用者還在名單之外。以 Google 過去先行動裝置、後全平台的節奏,這個缺口多半只是時間問題。補上之前,Windows 上的本地模型入門仍然是通用工具的天下。

分享文章

留言評論

0 則評論

暫無評論,搶先發表你的看法吧!

相關文章