2026 年完整本地 AI 環境搭建教學:Ollama + Open WebUI 從零開始
手把手教你用 Ollama 和 Open WebUI 在自己的電腦上運行 AI 模型——不需雲端訂閱,資料完全留在本地。
在自己的電腦上跑 AI 模型,過去意味著跟 CUDA 驅動程式搏鬥、從原始碼編譯 Python 套件,然後祈禱 GPU 不會過熱。到了 2026 年,體驗已經完全不同。Ollama 和 Open WebUI 這類工具,把原本要花一整個下午排查的問題,壓縮成 anyone 有台像樣電腦就能搞定的 15 分鐘設定。
這篇教學會走完整個流程:安裝 Ollama、下載第一個模型、用 Docker 部署 Open WebUI 作為聊天介面,最後把所有東西串起來。完成後你會擁有一套完整的本地 AI 環境,完全不需要網路連線,所有資料都留在自己的硬體上。
你需要準備什麼
開始之前,確認你有:
- 一台運作 Linux、macOS 或 Windows 的電腦,至少 16GB 記憶體(8GB 可以跑較小的模型,但 16GB 才有餘裕舒適地運行 7B 參數模型)
- 網路連線用於初次下載(Ollama 模型從 4GB 到 40GB 不等)
- 大約 20GB 的可用磁碟空間,用來安裝 Ollama、Docker、Open WebUI 和一兩個模型
- 可選但強烈建議: 一張 NVIDIA GPU,至少 6GB VRAM,能大幅加速推論速度
最後一點比你想的更重要。CPU 推論跑小模型沒問題,但一旦開始跑 7B 或 13B 參數的模型,有沒有 GPU 的差別是 5 秒回應和 30 秒回應的差距。如果沒有獨立 GPU 也別擔心——這篇教學的所有步驟都能在純 CPU 環境下運作,只是比較慢而已。
第一步:安裝 Ollama
Ollama 是負責下載和執行本地 AI 模型的引擎。每個平台的安裝都只需要一行指令。
Linux(Ubuntu/Debian):
curl -fsSL https://ollama.com/install.sh | sh
就這樣。腳本會自動偵測你的系統、安裝執行檔、設定 systemd 服務,如果偵測到 NVIDIA GPU 還會自動設定 GPU 支援。可以用以下指令驗證安裝:
ollama --version
macOS:
從 ollama.com 下載安裝程式,像一般應用程式一樣執行。或者如果你用 Homebrew:
brew install ollama
Windows:
從 ollama.com 下載安裝程式。安裝方式和一般 Windows 應用程式相同,會自動加入 PATH 環境變數。
安裝完成後,Ollama 會在背景啟動服務,監聽 localhost:11434。你不會看到視窗或介面——它是無頭服務,供其他應用程式連線使用。
第二步:下載並執行第一個模型
裝好 Ollama 後,下載模型很簡單。開啟終端機執行:
ollama pull llama3.1
這會下載 Meta 的 Llama 3.1 8B 模型(大約 4.7GB)。下載完成後可以立刻開始對話:
ollama run llama3.1
你會看到一個輸入提示,可以直接打字聊天並取得回應。這是基本的文字介面,但足以確認一切正常運作。
如果記憶體只有 8GB,試試這個更輕量的選擇:
ollama pull phi3
ollama run phi3
Phi-3 是微軟的小型模型(3.8B 參數),以它的體積來說表現出乎意料地好,特別是在程式碼和推理任務上。
幾個實用的 Ollama 指令:
# 列出所有已下載的模型
ollama list
# 顯示模型詳細資訊(大小、參數、量化方式)
ollama show llama3.1
# 刪釋模型以釋放磁碟空間
ollama rm phi3
# 用特定設定執行模型
ollama run llama3.1 --temperature 0.7
想看看有哪些模型可用,瀏覽 ollama.com/library。熱門選項包括 Llama 3.1、Mistral、Gemma 2、Qwen 2.5 和 DeepSeek Coder。
第三步:安裝 Docker
Open WebUI 以 Docker 容器方式運行,所以系統上需要安裝 Docker。如果已經裝過,直接跳到第四步。
Linux:
# 更新套件索引
sudo apt update
# 安裝 Docker
sudo apt install docker.io -y
# 設定開機自動啟動
sudo systemctl enable docker
# 將你的使用者加入 docker 群組(避免每次都要加 sudo)
sudo usermod -aG docker $USER
# 登出再登入,讓群組設定生效
macOS 和 Windows:
下載並安裝 Docker Desktop。它會自動處理所有設定。
驗證 Docker 是否正常運作:
docker --version
docker run hello-world
第二條指令會下載一個小型測試映像並執行。如果輸出中看到 “Hello from Docker!”,就表示一切正常。
第四步:部署 Open WebUI
Open WebUI 是一個自架的聊天介面,連接到 Ollama 後就能提供類似 ChatGPT 的體驗,而且完全在你自己的機器上運行。部署只需要一行 Docker 指令:
docker run -d \
-p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
解釋每個參數的用途:
-d在背景運行容器(分離模式)-p 3000:8080將你機器的 port 3000 映射到容器內的 port 8080--add-host=host.docker.internal:host-gateway讓容器能連到主機上運行的 Ollama-v open-webui:/app/backend/data用 Docker volume 持久化你的聊天記錄和設定--restart always容器崩潰或電腦重啟時自動重新啟動
等一兩分鐘(首次執行會下載 Open WebUI 映像),打開瀏覽器前往 http://localhost:3000。
系統會要求你建立管理員帳號。這是本地的——不會傳送任何資料到外部伺服器。設定使用者名稱和密碼後就能進入。
第五步:連接 Open WebUI 到 Ollama
進入 Open WebUI 後,點選聊天視窗頂部的模型選擇下拉選單。如果 Ollama 正在運行且可連線,你應該會看到第二步下載的模型出現在清單中。
如果看不到模型,檢查以下常見問題:
-
Ollama 沒在運行。 用
ollama serve啟動,或檢查 systemd 服務狀態:systemctl status ollama -
Docker 無法連到 Ollama。 Docker 指令中的
--add-host參數應該能處理這個問題,但如果你的 Docker 版本較舊,可以改用--network host取代 port 映射。 -
防火牆擋住連線。 在 Linux 上確認 port 11434 可以存取:
sudo ufw allow 11434
連線成功後,就能在下拉選單中選擇任何 Ollama 模型開始聊天。Open WebUI 提供了對話歷史、系統提示詞、檔案上傳(支援的模型),以及讓本地 AI 體驗更精緻的整潔介面。
第六步:GPU 加速(可選但建議)
如果有 NVIDIA GPU,可以透過在 Docker 中啟用 GPU 支援來大幅加速模型推論。這需要安裝 NVIDIA Container Toolkit。
Linux:
# 加入 NVIDIA 套件來源
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt update
sudo apt install nvidia-container-toolkit -y
# 重啟 Docker
sudo systemctl restart docker
安裝 toolkit 後,用 GPU 存取重新啟動 Open WebUI 容器:
docker stop open-webui
docker rm open-webui
docker run -d \
-p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
--gpus all \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
關鍵差別是 --gpus all,這會將你的 GPU 傳遞給容器。Ollama 會自動偵測並使用 GPU 進行推論。
驗證 GPU 加速是否生效,在 Open WebUI 中執行一個模型,然後檢查 Ollama 日誌:
journalctl -u ollama -f
你應該會看到指示 CUDA 正在用於計算的輸出。
第七步:不同用途的推薦模型
選擇哪個模型取決於你的硬體和想做什麼。以下是實用指南:
一般聊天和寫作(8GB+ 記憶體):
llama3.1:8b— Meta 最好的小型模型,什麼都擅長mistral:7b— 快速且有能力,適合快速回應
程式碼開發(16GB+ 記憶體):
deepseek-coder:6.7b— 程式碼生成和解釋表現優秀qwen2.5-coder:7b— 強大的多語言程式碼支援
分析和推理(16GB+ 記憶體):
llama3.1:13b— 比 8B 版本聰明顯著mixtral:8x7b— 混合專家模型,擅長複雜推理(需要約 24GB)
資源有限的系統(8GB 記憶體):
phi3:3.8b— 微軟的高效小型模型gemma2:2b— Google 的超輕量選擇
GPU 資源豐富的設定(24GB+ VRAM):
llama3.1:70b— 接近 GPT-4 等級的效能mixtral:8x22b— 大型混合專家模型
多拉幾個模型試試看。Ollama 的優勢之一就是切換模型非常容易——你不會被鎖定在單一選擇上。
保持更新
Ollama 和 Open WebUI 都會定期發布更新。更新 Ollama:
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# macOS(Homebrew)
brew upgrade ollama
更新 Open WebUI:
docker pull ghcr.io/open-webui/open-webui:main
docker stop open-webui
docker rm open-webui
# 重新執行第四步的 docker run 指令
你的聊天記錄和設定都保存在 Docker volume 中,更新不會遺失任何資料。
這套環境能給你什麼
本地 AI 環境代表了几個雲端替代方案無法比擬的優勢。你的對話永遠不會離開你的機器。沒有訂閱費——一旦下載了模型,就可以無限期使用。你可以同時運行任意多個對話,不會碰到速率限制或按 token 收費。
代價也很清楚:本地模型通常不如最大的雲端模型(GPT-4、Claude Opus)那麼強。筆電上跑的 7B 參數模型在複雜推理任務上比不上 GPT-4。但在程式碼輔助、寫作支援、摘要整理和日常聊天方面,兩年來的差距已經大幅縮小。
對許多人來說,隱私和成本效益勝過能力差距。而且隨著開源模型持續進步——Llama 4 預計今年稍後推出——這個差距只會繼續縮小。
分享文章
留言評論
0 則評論暫無評論,搶先發表你的看法吧!
相關文章
打造本地 AI 語音助理:Whisper + Ollama + Piper 完整教程(2026)
手把手教你用 OpenAI Whisper 做語音辨識、Ollama 跑本地語言模型、Piper 做文字轉語音,打造一個完全離線的語音助理。
用 LM Studio Bionic 在本機跑真正會動手的 Agent
LM Studio Bionic 在舊版聊天窗上加了 MCP、專案檔案和本機/雲端模型切換。這篇教你依記憶體選模型,並把 repo 留在自己的磁碟上。
用 n8n 打造 AI Agent 工作流:2026 完整教程
從零開始用 n8n 建構 AI Agent,整合 LLM、記憶體與外部工具,一步步打造可部署的自動化工作流。