想要擁有一個完全離線、零 API 費用,而且不用綁定任何雲端訂閱的 AI Agent 嗎?今天這篇文章將帶大家手把手在 Windows 11 環境下,將開源的 Hermes Agent 桌面版 串接至本地運行的 Ollama,並選擇最適合的本地模型(Gemma 或 Qwen)。
雖然串接過程並不複雜,但筆者在實測過程中也踩了不少關於「模型大小」與「設定檔」的硬傷。為了讓大家少走彎路,這篇教學不僅整理了完整的安裝步驟,更收錄了實際避坑的關鍵心得,幫助你的本地 AI Agent 順利運作!
相關筆記:hermes本地模型安裝(安裝截圖)|AI-LLM-MOC
核心概念與運作架構釐清
在開始動手之前,我們先來釐清幾個核心名詞,避免在安裝與設定時走錯路。
| 你說的 | 實際對應 | 說明 |
|---|---|---|
| Hermes desktop | Hermes Agent(Nous Research 出品) | 開源、可完全離線運行的 AI agent,具備記憶與技能系統。它本身不附帶模型,需要外接一個「模型端點」。 |
| Gemini 的 Gemma 4 E2B | gemma4:e2b(Google Gemma 系列,Apache 2.0) | 邊緣裝置用的輕量模型,「有效 2B 參數」、支援文字/圖片/音訊多模態。不是 Gemini,是 Gemma(Gemini 的開源親戚)。 |
| 中間的橋樑 | Ollama | 把 Gemma 跑在本機,並開出一個 OpenAI 相容的 API(http://localhost:11434/v1),讓 Hermes 連上。 |
架構流程圖
Hermes 桌面 App ──(OpenAI 相容 API)──> Ollama ──> Gemma 4 E2B 模型
(Windows 原生) (Windows 本機,port 11434)
✅ 本教學使用 Hermes 桌面版 GUI(原生 Windows App,不需要 WSL)。 若你打算改用 CLI 版本,安裝時需要使用
curl | bash腳本,才會需要 WSL2 / Git Bash 環境(相關步驟可參考文末附錄)。
Gemma 4 E2B 規格速覽
- 下載大小:約
7.2 GB(Q4_K_M 量化) - 有效參數:2.3B(含 embedding 約 5.1B)
- 上下文長度:
128K tokens - 多模態輸入:文字、圖片、音訊
- 建議取樣參數:
temperature=1.0、top_p=0.95、top_k=64 - 記憶體建議:至少 8GB RAM(16GB 以上更順)
步驟一:安裝 Ollama 並下載本地模型
這一步驟的任務是準備好「模型倉庫與引擎」。Hermes 作為「Agent 大腦的指揮中心」,本身只負責指揮,並不提供模型下載。因此,我們必須先讓 Ollama 在本機把模型跑起來,並開出 API。
1. 安裝並啟動 Ollama
- 前往 ollama.com 下載 Windows 版 安裝(或使用指令
winget install Ollama.Ollama)。 - 安裝後 Ollama 會在背景常駐,並監聽
http://localhost:11434。 - 開啟 PowerShell 輸入以下指令,確認服務有正常運作:
ollama --version
💡 白話小知識:Ollama 是什麼? 把它想成「本地版的模型 App Store + 引擎」。它負責三件事:下載模型權重、自動量化(壓縮成電腦跑得動的大小),以及開一個
localhost:11434的服務,讓 Hermes 能順利呼叫。什麼是「OpenAI 相容 API」? 它是一種「講話的通用插頭規格」。只要網址後面有
/v1,各種前端(Hermes、LM Studio…)就能無痛接上。
2. 下載模型
開啟 PowerShell 執行以下指令,系統會自動下載、量化並啟動本機 API:
# ✅ agent 用途(推薦):工具能力強,本次實測可正常驅動 Hermes
ollama pull qwen3:4b
# (選用)輕量多模態,僅適合純聊天、不要拿來跑 agent
ollama pull gemma4:e2b⚠️ 特別提醒:跑 Hermes Agent 請務必使用
qwen3:4b。gemma4:e2b雖然純聊天可行,但進入 Agent 模式後會吐出亂碼。
下載完成後,可以在本機先測試模型能否正常回應:
ollama run gemma4:e2b出現對話提示符後,隨意輸入文字測試。確認能正常回覆後,按下 Ctrl + D 即可離開。
(如果你想要的是 Gemma 3n 版本,可將指令換成 gemma3n:e2b,後續設定皆同。)
步驟二:桌面版 GUI 串接(直接修改設定檔最保險)
雖然桌面版 GUI 比命令列(CLI)友善許多,但在設定本地模型時,有兩個非常容易讓人卡住的「坑」。
⚠️ 避坑指南
- 坑 1:Providers 沒有「Custom endpoint」選項
Providers分頁預設只顯示需要帳號登入的雲端供應商。本地入口隱藏在右上角小字 → 「Have an API key instead?」。點進去後,最接近本地的選項是 「Ollama Cloud」,我們需要「借用」它的 「Ollama Cloud base URL override(預設https://ollama.com/v1)」 欄位來指向本地。 - 坑 2:Ollama Cloud 的模型下拉選單只列出雲端目錄
即使把 base URL 改成了本地,
Model分頁的下拉選單仍只會出現qwen3-vl:235b、kimi-k2:1t等雲端大模型,永遠選不到你本機的gemma4:e2b。因此,純靠 GUI 介面是無法設定成功的,我們必須直接修改設定檔。
✅ 實測走通做法:直接編輯設定檔
真正決定 Hermes 「連到哪裡、用哪個模型」的是底層設定檔,GUI 的下拉選單僅是輔助。既然下拉選單抓不到,我們就直接寫死設定。
步驟 A — 完全關閉 Hermes App
在 Windows 系統匣的 Hermes 圖示上點擊右鍵,選擇 Quit / Exit。 (注意:必須完全關閉,不能只是最小化,否則 App 關閉時會用舊的記憶體設定覆蓋你的修改。)
步驟 B — 編輯主設定檔 config.yaml
開啟以下路徑的檔案:
C:\Users\<你的電腦帳號>\AppData\Local\Hermes\config.yaml
將最上方的 model: 區塊修改為:
model:
default: qwen3:4b
provider: ollama-cloud
base_url: http://localhost:11434/v1
context_length: 64000| 欄位 | 說明 |
|---|---|
default | 輸入你在本機執行 ollama list 看到的模型名稱。Agent 用途建議使用 qwen3:4b。 |
provider | 沿用 ollama-cloud(借殼),並透過 base_url 導向本地。 |
base_url | 填寫本地 API 位置。注意開頭是 http 而非 https,且結尾必須帶有 /v1。 |
context_length | 必須設定為 64000 或以上,否則 Hermes 啟動時會報錯 agent init failed。 |
步驟 C — 在 .env 補上虛擬的金鑰
開啟以下路徑的檔案:
C:\Users\<你的電腦帳號>\AppData\Local\Hermes\.env
找到 # OLLAMA_API_KEY=... 這行,將其修改為(去掉註解符號 #,並填入任意字串):
OLLAMA_API_KEY=ollama
💡 為什麼要填? 本地 Ollama 雖然不需驗證,但 OpenAI 相容客戶端通常要求金鑰欄位不可為空,否則初始化會失敗。
步驟 D — 重啟 App 並進行測試
- ⚠️ 請勿再去觸碰
Model分頁的下拉選單或點擊 Apply,否則設定會被覆蓋回雲端模型。 - 直接切換到
Chat分頁隨意輸入一句話。能成功收到回覆就代表大功告成!🎉 - 由於第一次執行需要載入模型,請耐心等候數十秒。
關鍵心得:為 Agent 挑選對的模型與 Context 長度
在本次的實測(2026-06-05)中,筆者獲得了幾點非常關鍵的硬體與模型配置心得:
⚠️ 踩雷 3:2B 小模型扛不住 Agent 的系統 Prompt
Hermes 作為一個 Agent,運作時會塞入大量的「系統指令 + 工具定義 + 技能 + 記憶」,這會產生動輒上萬的 tokens。
gemma4:e2b雖然純對話表現優異,但因其「有效 2B 參數」的體量較小,被上萬 tokens 的系統提示詞淹沒時,極容易輸出亂碼(例如一直吐「我PleaseI」)並中斷。- 診斷方法:可以直接用
curl打 Ollama API 測試。如果純對話正常,但進了 Hermes 卻壞掉,通常就是模型太小。
⚠️ 踩雷 4:Context 長度必須 64,000
Hermes 啟動時會主動檢查模型的 Context 限制,如果低於 64K 會直接中斷並顯示:
agent init failed: ... below the minimum 64,000 required by Hermes Agent
- 請務必在
config.yaml的model.context_length填入64000。像 Qwen3 原生支援達 256K,完全沒問題。
依硬體配備選擇模型建議
| 你的硬體 | 建議模型 | 備註 |
|---|---|---|
| 6GB 顯卡 / 16GB RAM(如本次實測環境) | qwen3:4b(約 2.5GB) | 工具調用能力強、CP 值高。在 64K context 下 KV 快取可能會溢出到系統 RAM,速度會稍慢但能穩定執行。 |
| 更高級顯卡 / 想要更聰明的回答 | qwen2.5-coder:7b、qwen3:8b | 部分模型權重與快取會溢出到 RAM,但推理能力更佳。 |
| 純聊天、不跑 Agent | gemma4:e2b | 輕量且多模態,但請不要拿來驅動 Hermes 的工具系統。 |
💡 關於 Qwen3 的兩點提醒:
- 思考模型特性:Qwen3 是思考模型,回答前會進行推理。雖然 Hermes 預設關閉了思考過程顯示(
show_reasoning: false),但如果你覺得速度較慢,可以在 Prompt 後方加上/no_think關閉思考。- 內建立場:Qwen 作為阿里巴巴開發的模型,在政治敏感話題上會帶有北京官方的框架(例如自動稱「台灣省」)。若需要用於公開社群發文且內容敏感,建議改用 Llama、較大的 Gemma 或雲端的 Claude/GPT。
疑難排解(Troubleshooting)
| 症狀 | 可能原因 / 解決方法 |
|---|---|
| 回覆吐亂碼如「我PleaseI」後中斷 | 模型太小扛不住 agent prompt。請換成 qwen3:4b 以上的模型。 |
出現 agent init failed ... below the minimum 64,000 錯誤 | context 設定太小。請至 config.yaml 將 model.context_length 設為 64000。 |
| GUI 模型下拉選單選不到本地模型 | 正常現象。Ollama Cloud 下拉只列雲端目錄,請直接依本文「步驟二」修改設定檔。 |
| Hermes 連不上端點 | 1. 確認 Ollama 正在執行(ollama ps)。2. 確認 .env 檔中的 OLLAMA_API_KEY 有填寫任意值(例如 ollama)。 |
| 回應極慢 / 記憶體爆滿 | 64K context 的 KV 快取極大,6GB 顯卡裝不下時會溢出到 RAM。請關閉其他佔用記憶體的程式,或使用 /no_think 提升速度。 |
| 修改了設定檔卻沒有生效 | App 沒有完全關閉就被重新開啟。App 會用記憶體中的舊設定覆蓋你的修改,請務必先 Quit 再修改。 |
| 改完後 GUI 設定又跑回雲端模型 | 因為在 Model 分頁按到了 Apply。改完設定檔後請不要去觸碰該下拉選單與 Apply 按鈕。 |
📌 關於 Claude 訂閱的額外結論: 目前 Anthropic 的 OAuth 登入在第三方 App(如 Hermes)中,會被導引至獨立的
extra_usage計費池。如果你的計費池是空的,會經常被 HTTP 400 錯誤阻擋。要使用雲端 Claude 必須另外申請 API Key(按 token 計費)。相較之下,使用本地模型能完美避開此問題。
附錄:CLI 版本安裝指引(適合 WSL2 使用者)
如果你習慣在終端機(CLI)下操作,且本機已安裝 WSL2,可以參考以下步驟進行安裝:
1. 安裝 Hermes Agent
進入 WSL2(或 Git Bash)後執行官方安裝腳本:
curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
source ~/.bashrc # zsh 使用者改用 source ~/.zshrc驗證安裝是否成功:
hermes --version(如果已有 Python 環境,也可以直接使用 pip install hermes-agent)
2. 把 Hermes 指向 Gemma(自訂端點)
執行模型設定精靈:
hermes model依提示選擇 Custom OpenAI-compatible endpoint(自訂 OpenAI 相容端點),並填入:
| 欄位 | 填入內容 |
|---|---|
| API Base URL | http://localhost:11434/v1 |
| API Key | (留空,Ollama 本機不需驗證) |
| Model name | gemma4:e2b |
| Context length | 64000 以上(最高可填 131072) |
| Display name | 自訂,例如 gemma-local |
💡 在 WSL2 中連不到 Windows 本機的 Ollama? 你可以使用 Windows 的主機 IP。在 WSL 中執行
cat /etc/resolv.conf取得 nameserver IP,將 Base URL 換成http://<該IP>:11434/v1;或者在 Windows 系統環境變數中設定OLLAMA_HOST=0.0.0.0並重啟 Ollama。
3. 直接編輯設定檔(替代方案)
如果不透過設定精靈,可以直接修改 ~/.hermes/config.yaml:
hermes config edit # 用 $EDITOR 開啟設定檔內容範例:
model:
default: gemma4:e2b
provider: custom
base_url: http://localhost:11434/v1
context_length: 32768小結
透過本篇教學,我們成功在 Windows 本地環境利用 Ollama 與 Hermes Agent 搭建起了一個完全離線、不產生額外 API 費用的智能助理。
實測下來,對於 6GB 顯卡和 16GB 記憶體的配備來說,qwen3:4b 絕對是目前跑 Agent 最穩定且高 CP 值的選擇。儘管 2B 等級的輕量模型(如 gemma4:e2b)在日常對話中表現優異,但面對 Agent 的複雜系統 Prompts 時仍顯吃力。
希望這篇避坑指南能幫助大家順利打造出專屬的本地 AI 秘書!有任何設定上的問題,也歡迎在下方留言討論。
參考來源
- Run Local AI Models with Hermes Agent — Unsloth Docs
- Run Hermes Agent with Ollama and Local LLMs (2026) — Fastio
- Run Local LLMs on Mac — Hermes Agent (Nous Research)
- Hermes Agent Local LLM Support
- Ollama Library — gemma4:e2b
- Ollama Library — gemma3n:e2b
- Run Gemma with Ollama — Google AI for Developers