SynapseWire

2026 年完整本地 AI 環境搭建教學:Ollama + Open WebUI 從零開始

手把手教你用 Ollama 和 Open WebUI 在自己的電腦上運行 AI 模型——不需雲端訂閱,資料完全留在本地。

作者: SynapseWire 編輯部 發布於:
電腦螢幕顯示連接到本地伺服器的聊天介面,副螢幕上有終端機指令

在自己的電腦上跑 AI 模型,過去意味著跟 CUDA 驅動程式搏鬥、從原始碼編譯 Python 套件,然後祈禱 GPU 不會過熱。到了 2026 年,體驗已經完全不同。Ollama 和 Open WebUI 這類工具,把原本要花一整個下午排查的問題,壓縮成 anyone 有台像樣電腦就能搞定的 15 分鐘設定。

這篇教學會走完整個流程:安裝 Ollama、下載第一個模型、用 Docker 部署 Open WebUI 作為聊天介面,最後把所有東西串起來。完成後你會擁有一套完整的本地 AI 環境,完全不需要網路連線,所有資料都留在自己的硬體上。

你需要準備什麼

開始之前,確認你有:

  • 一台運作 Linux、macOS 或 Windows 的電腦,至少 16GB 記憶體(8GB 可以跑較小的模型,但 16GB 才有餘裕舒適地運行 7B 參數模型)
  • 網路連線用於初次下載(Ollama 模型從 4GB 到 40GB 不等)
  • 大約 20GB 的可用磁碟空間,用來安裝 Ollama、Docker、Open WebUI 和一兩個模型
  • 可選但強烈建議: 一張 NVIDIA GPU,至少 6GB VRAM,能大幅加速推論速度

最後一點比你想的更重要。CPU 推論跑小模型沒問題,但一旦開始跑 7B 或 13B 參數的模型,有沒有 GPU 的差別是 5 秒回應和 30 秒回應的差距。如果沒有獨立 GPU 也別擔心——這篇教學的所有步驟都能在純 CPU 環境下運作,只是比較慢而已。

第一步:安裝 Ollama

Ollama 是負責下載和執行本地 AI 模型的引擎。每個平台的安裝都只需要一行指令。

Linux(Ubuntu/Debian):

curl -fsSL https://ollama.com/install.sh | sh

就這樣。腳本會自動偵測你的系統、安裝執行檔、設定 systemd 服務,如果偵測到 NVIDIA GPU 還會自動設定 GPU 支援。可以用以下指令驗證安裝:

ollama --version

macOS:

ollama.com 下載安裝程式,像一般應用程式一樣執行。或者如果你用 Homebrew:

brew install ollama

Windows:

ollama.com 下載安裝程式。安裝方式和一般 Windows 應用程式相同,會自動加入 PATH 環境變數。

安裝完成後,Ollama 會在背景啟動服務,監聽 localhost:11434。你不會看到視窗或介面——它是無頭服務,供其他應用程式連線使用。

第二步:下載並執行第一個模型

裝好 Ollama 後,下載模型很簡單。開啟終端機執行:

ollama pull llama3.1

這會下載 Meta 的 Llama 3.1 8B 模型(大約 4.7GB)。下載完成後可以立刻開始對話:

ollama run llama3.1

你會看到一個輸入提示,可以直接打字聊天並取得回應。這是基本的文字介面,但足以確認一切正常運作。

如果記憶體只有 8GB,試試這個更輕量的選擇:

ollama pull phi3
ollama run phi3

Phi-3 是微軟的小型模型(3.8B 參數),以它的體積來說表現出乎意料地好,特別是在程式碼和推理任務上。

幾個實用的 Ollama 指令:

# 列出所有已下載的模型
ollama list

# 顯示模型詳細資訊(大小、參數、量化方式)
ollama show llama3.1

# 刪釋模型以釋放磁碟空間
ollama rm phi3

# 用特定設定執行模型
ollama run llama3.1 --temperature 0.7

想看看有哪些模型可用,瀏覽 ollama.com/library。熱門選項包括 Llama 3.1、Mistral、Gemma 2、Qwen 2.5 和 DeepSeek Coder。

第三步:安裝 Docker

Open WebUI 以 Docker 容器方式運行,所以系統上需要安裝 Docker。如果已經裝過,直接跳到第四步。

Linux:

# 更新套件索引
sudo apt update

# 安裝 Docker
sudo apt install docker.io -y

# 設定開機自動啟動
sudo systemctl enable docker

# 將你的使用者加入 docker 群組(避免每次都要加 sudo)
sudo usermod -aG docker $USER

# 登出再登入,讓群組設定生效

macOS 和 Windows:

下載並安裝 Docker Desktop。它會自動處理所有設定。

驗證 Docker 是否正常運作:

docker --version
docker run hello-world

第二條指令會下載一個小型測試映像並執行。如果輸出中看到 “Hello from Docker!”,就表示一切正常。

第四步:部署 Open WebUI

Open WebUI 是一個自架的聊天介面,連接到 Ollama 後就能提供類似 ChatGPT 的體驗,而且完全在你自己的機器上運行。部署只需要一行 Docker 指令:

docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

解釋每個參數的用途:

  • -d 在背景運行容器(分離模式)
  • -p 3000:8080 將你機器的 port 3000 映射到容器內的 port 8080
  • --add-host=host.docker.internal:host-gateway 讓容器能連到主機上運行的 Ollama
  • -v open-webui:/app/backend/data 用 Docker volume 持久化你的聊天記錄和設定
  • --restart always 容器崩潰或電腦重啟時自動重新啟動

等一兩分鐘(首次執行會下載 Open WebUI 映像),打開瀏覽器前往 http://localhost:3000

系統會要求你建立管理員帳號。這是本地的——不會傳送任何資料到外部伺服器。設定使用者名稱和密碼後就能進入。

第五步:連接 Open WebUI 到 Ollama

進入 Open WebUI 後,點選聊天視窗頂部的模型選擇下拉選單。如果 Ollama 正在運行且可連線,你應該會看到第二步下載的模型出現在清單中。

如果看不到模型,檢查以下常見問題:

  1. Ollama 沒在運行。ollama serve 啟動,或檢查 systemd 服務狀態:systemctl status ollama

  2. Docker 無法連到 Ollama。 Docker 指令中的 --add-host 參數應該能處理這個問題,但如果你的 Docker 版本較舊,可以改用 --network host 取代 port 映射。

  3. 防火牆擋住連線。 在 Linux 上確認 port 11434 可以存取:sudo ufw allow 11434

連線成功後,就能在下拉選單中選擇任何 Ollama 模型開始聊天。Open WebUI 提供了對話歷史、系統提示詞、檔案上傳(支援的模型),以及讓本地 AI 體驗更精緻的整潔介面。

第六步:GPU 加速(可選但建議)

如果有 NVIDIA GPU,可以透過在 Docker 中啟用 GPU 支援來大幅加速模型推論。這需要安裝 NVIDIA Container Toolkit。

Linux:

# 加入 NVIDIA 套件來源
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg

curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
  sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
  sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list

sudo apt update
sudo apt install nvidia-container-toolkit -y

# 重啟 Docker
sudo systemctl restart docker

安裝 toolkit 後,用 GPU 存取重新啟動 Open WebUI 容器:

docker stop open-webui
docker rm open-webui

docker run -d \
  -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  --gpus all \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

關鍵差別是 --gpus all,這會將你的 GPU 傳遞給容器。Ollama 會自動偵測並使用 GPU 進行推論。

驗證 GPU 加速是否生效,在 Open WebUI 中執行一個模型,然後檢查 Ollama 日誌:

journalctl -u ollama -f

你應該會看到指示 CUDA 正在用於計算的輸出。

第七步:不同用途的推薦模型

選擇哪個模型取決於你的硬體和想做什麼。以下是實用指南:

一般聊天和寫作(8GB+ 記憶體):

  • llama3.1:8b — Meta 最好的小型模型,什麼都擅長
  • mistral:7b — 快速且有能力,適合快速回應

程式碼開發(16GB+ 記憶體):

  • deepseek-coder:6.7b — 程式碼生成和解釋表現優秀
  • qwen2.5-coder:7b — 強大的多語言程式碼支援

分析和推理(16GB+ 記憶體):

  • llama3.1:13b — 比 8B 版本聰明顯著
  • mixtral:8x7b — 混合專家模型,擅長複雜推理(需要約 24GB)

資源有限的系統(8GB 記憶體):

  • phi3:3.8b — 微軟的高效小型模型
  • gemma2:2b — Google 的超輕量選擇

GPU 資源豐富的設定(24GB+ VRAM):

  • llama3.1:70b — 接近 GPT-4 等級的效能
  • mixtral:8x22b — 大型混合專家模型

多拉幾個模型試試看。Ollama 的優勢之一就是切換模型非常容易——你不會被鎖定在單一選擇上。

保持更新

Ollama 和 Open WebUI 都會定期發布更新。更新 Ollama:

# Linux
curl -fsSL https://ollama.com/install.sh | sh

# macOS(Homebrew)
brew upgrade ollama

更新 Open WebUI:

docker pull ghcr.io/open-webui/open-webui:main
docker stop open-webui
docker rm open-webui
# 重新執行第四步的 docker run 指令

你的聊天記錄和設定都保存在 Docker volume 中,更新不會遺失任何資料。

這套環境能給你什麼

本地 AI 環境代表了几個雲端替代方案無法比擬的優勢。你的對話永遠不會離開你的機器。沒有訂閱費——一旦下載了模型,就可以無限期使用。你可以同時運行任意多個對話,不會碰到速率限制或按 token 收費。

代價也很清楚:本地模型通常不如最大的雲端模型(GPT-4、Claude Opus)那麼強。筆電上跑的 7B 參數模型在複雜推理任務上比不上 GPT-4。但在程式碼輔助、寫作支援、摘要整理和日常聊天方面,兩年來的差距已經大幅縮小。

對許多人來說,隱私和成本效益勝過能力差距。而且隨著開源模型持續進步——Llama 4 預計今年稍後推出——這個差距只會繼續縮小。

分享文章

留言評論

0 則評論

暫無評論,搶先發表你的看法吧!

相關文章