想要擁有一個完全離線、零 API 費用,而且不用綁定任何雲端訂閱的 AI Agent 嗎?今天這篇文章將帶大家手把手在 Windows 11 環境下,將開源的 Hermes Agent 桌面版 串接至本地運行的 Ollama,並選擇最適合的本地模型(Gemma 或 Qwen)。

雖然串接過程並不複雜,但筆者在實測過程中也踩了不少關於「模型大小」與「設定檔」的硬傷。為了讓大家少走彎路,這篇教學不僅整理了完整的安裝步驟,更收錄了實際避坑的關鍵心得,幫助你的本地 AI Agent 順利運作!

相關筆記:hermes本地模型安裝(安裝截圖)|AI-LLM-MOC


核心概念與運作架構釐清

在開始動手之前,我們先來釐清幾個核心名詞,避免在安裝與設定時走錯路。

你說的實際對應說明
Hermes desktopHermes Agent(Nous Research 出品)開源、可完全離線運行的 AI agent,具備記憶與技能系統。它本身不附帶模型,需要外接一個「模型端點」。
Gemini 的 Gemma 4 E2Bgemma4:e2b(Google Gemma 系列,Apache 2.0)邊緣裝置用的輕量模型,「有效 2B 參數」、支援文字/圖片/音訊多模態。不是 Gemini,是 Gemma(Gemini 的開源親戚)。
中間的橋樑Ollama把 Gemma 跑在本機,並開出一個 OpenAI 相容的 API(http://localhost:11434/v1),讓 Hermes 連上。

架構流程圖

Hermes 桌面 App ──(OpenAI 相容 API)──> Ollama ──> Gemma 4 E2B 模型
  (Windows 原生)                       (Windows 本機,port 11434)

✅ 本教學使用 Hermes 桌面版 GUI(原生 Windows App,不需要 WSL)。 若你打算改用 CLI 版本,安裝時需要使用 curl | bash 腳本,才會需要 WSL2 / Git Bash 環境(相關步驟可參考文末附錄)。

Gemma 4 E2B 規格速覽

  • 下載大小:約 7.2 GB(Q4_K_M 量化)
  • 有效參數:2.3B(含 embedding 約 5.1B)
  • 上下文長度128K tokens
  • 多模態輸入:文字、圖片、音訊
  • 建議取樣參數temperature=1.0top_p=0.95top_k=64
  • 記憶體建議:至少 8GB RAM(16GB 以上更順)

步驟一:安裝 Ollama 並下載本地模型

這一步驟的任務是準備好「模型倉庫與引擎」。Hermes 作為「Agent 大腦的指揮中心」,本身只負責指揮,並不提供模型下載。因此,我們必須先讓 Ollama 在本機把模型跑起來,並開出 API。

1. 安裝並啟動 Ollama

  1. 前往 ollama.com 下載 Windows 版 安裝(或使用指令 winget install Ollama.Ollama)。
  2. 安裝後 Ollama 會在背景常駐,並監聽 http://localhost:11434
  3. 開啟 PowerShell 輸入以下指令,確認服務有正常運作:
    ollama --version

💡 白話小知識:Ollama 是什麼? 把它想成「本地版的模型 App Store + 引擎」。它負責三件事:下載模型權重、自動量化(壓縮成電腦跑得動的大小),以及開一個 localhost:11434 的服務,讓 Hermes 能順利呼叫。

什麼是「OpenAI 相容 API」? 它是一種「講話的通用插頭規格」。只要網址後面有 /v1,各種前端(Hermes、LM Studio…)就能無痛接上。

2. 下載模型

開啟 PowerShell 執行以下指令,系統會自動下載、量化並啟動本機 API:

# ✅ agent 用途(推薦):工具能力強,本次實測可正常驅動 Hermes
ollama pull qwen3:4b
 
# (選用)輕量多模態,僅適合純聊天、不要拿來跑 agent
ollama pull gemma4:e2b

⚠️ 特別提醒:跑 Hermes Agent 請務必使用 qwen3:4bgemma4:e2b 雖然純聊天可行,但進入 Agent 模式後會吐出亂碼。

下載完成後,可以在本機先測試模型能否正常回應:

ollama run gemma4:e2b

出現對話提示符後,隨意輸入文字測試。確認能正常回覆後,按下 Ctrl + D 即可離開。 (如果你想要的是 Gemma 3n 版本,可將指令換成 gemma3n:e2b,後續設定皆同。)


步驟二:桌面版 GUI 串接(直接修改設定檔最保險)

雖然桌面版 GUI 比命令列(CLI)友善許多,但在設定本地模型時,有兩個非常容易讓人卡住的「坑」。

⚠️ 避坑指南

  • 坑 1:Providers 沒有「Custom endpoint」選項 Providers 分頁預設只顯示需要帳號登入的雲端供應商。本地入口隱藏在右上角小字 → 「Have an API key instead?」。點進去後,最接近本地的選項是 「Ollama Cloud」,我們需要「借用」它的 「Ollama Cloud base URL override(預設 https://ollama.com/v1)」 欄位來指向本地。
  • 坑 2:Ollama Cloud 的模型下拉選單只列出雲端目錄 即使把 base URL 改成了本地,Model 分頁的下拉選單仍只會出現 qwen3-vl:235bkimi-k2:1t 等雲端大模型,永遠選不到你本機的 gemma4:e2b。因此,純靠 GUI 介面是無法設定成功的,我們必須直接修改設定檔。

✅ 實測走通做法:直接編輯設定檔

真正決定 Hermes 「連到哪裡、用哪個模型」的是底層設定檔,GUI 的下拉選單僅是輔助。既然下拉選單抓不到,我們就直接寫死設定。

步驟 A — 完全關閉 Hermes App

在 Windows 系統匣的 Hermes 圖示上點擊右鍵,選擇 Quit / Exit(注意:必須完全關閉,不能只是最小化,否則 App 關閉時會用舊的記憶體設定覆蓋你的修改。)

步驟 B — 編輯主設定檔 config.yaml

開啟以下路徑的檔案: C:\Users\<你的電腦帳號>\AppData\Local\Hermes\config.yaml

將最上方的 model: 區塊修改為:

model:
  default: qwen3:4b
  provider: ollama-cloud
  base_url: http://localhost:11434/v1
  context_length: 64000
欄位說明
default輸入你在本機執行 ollama list 看到的模型名稱。Agent 用途建議使用 qwen3:4b
provider沿用 ollama-cloud(借殼),並透過 base_url 導向本地。
base_url填寫本地 API 位置。注意開頭是 http 而非 https,且結尾必須帶有 /v1
context_length必須設定為 64000 或以上,否則 Hermes 啟動時會報錯 agent init failed

步驟 C — 在 .env 補上虛擬的金鑰

開啟以下路徑的檔案: C:\Users\<你的電腦帳號>\AppData\Local\Hermes\.env

找到 # OLLAMA_API_KEY=... 這行,將其修改為(去掉註解符號 #,並填入任意字串):

OLLAMA_API_KEY=ollama

💡 為什麼要填? 本地 Ollama 雖然不需驗證,但 OpenAI 相容客戶端通常要求金鑰欄位不可為空,否則初始化會失敗。

步驟 D — 重啟 App 並進行測試

  • ⚠️ 請勿再去觸碰 Model 分頁的下拉選單或點擊 Apply,否則設定會被覆蓋回雲端模型。
  • 直接切換到 Chat 分頁隨意輸入一句話。能成功收到回覆就代表大功告成!🎉
  • 由於第一次執行需要載入模型,請耐心等候數十秒。

關鍵心得:為 Agent 挑選對的模型與 Context 長度

在本次的實測(2026-06-05)中,筆者獲得了幾點非常關鍵的硬體與模型配置心得:

⚠️ 踩雷 3:2B 小模型扛不住 Agent 的系統 Prompt

Hermes 作為一個 Agent,運作時會塞入大量的「系統指令 + 工具定義 + 技能 + 記憶」,這會產生動輒上萬的 tokens。

  • gemma4:e2b 雖然純對話表現優異,但因其「有效 2B 參數」的體量較小,被上萬 tokens 的系統提示詞淹沒時,極容易輸出亂碼(例如一直吐「我PleaseI」)並中斷。
  • 診斷方法:可以直接用 curl 打 Ollama API 測試。如果純對話正常,但進了 Hermes 卻壞掉,通常就是模型太小。

⚠️ 踩雷 4:Context 長度必須 64,000

Hermes 啟動時會主動檢查模型的 Context 限制,如果低於 64K 會直接中斷並顯示: agent init failed: ... below the minimum 64,000 required by Hermes Agent

  • 請務必在 config.yamlmodel.context_length 填入 64000。像 Qwen3 原生支援達 256K,完全沒問題。

依硬體配備選擇模型建議

你的硬體建議模型備註
6GB 顯卡 / 16GB RAM(如本次實測環境)qwen3:4b(約 2.5GB)工具調用能力強、CP 值高。在 64K context 下 KV 快取可能會溢出到系統 RAM,速度會稍慢但能穩定執行。
更高級顯卡 / 想要更聰明的回答qwen2.5-coder:7bqwen3:8b部分模型權重與快取會溢出到 RAM,但推理能力更佳。
純聊天、不跑 Agentgemma4:e2b輕量且多模態,但請不要拿來驅動 Hermes 的工具系統。

💡 關於 Qwen3 的兩點提醒:

  1. 思考模型特性:Qwen3 是思考模型,回答前會進行推理。雖然 Hermes 預設關閉了思考過程顯示(show_reasoning: false),但如果你覺得速度較慢,可以在 Prompt 後方加上 /no_think 關閉思考。
  2. 內建立場:Qwen 作為阿里巴巴開發的模型,在政治敏感話題上會帶有北京官方的框架(例如自動稱「台灣省」)。若需要用於公開社群發文且內容敏感,建議改用 Llama、較大的 Gemma 或雲端的 Claude/GPT。

疑難排解(Troubleshooting)

症狀可能原因 / 解決方法
回覆吐亂碼如「我PleaseI」後中斷模型太小扛不住 agent prompt。請換成 qwen3:4b 以上的模型。
出現 agent init failed ... below the minimum 64,000 錯誤context 設定太小。請至 config.yamlmodel.context_length 設為 64000
GUI 模型下拉選單選不到本地模型正常現象。Ollama Cloud 下拉只列雲端目錄,請直接依本文「步驟二」修改設定檔。
Hermes 連不上端點1. 確認 Ollama 正在執行(ollama ps)。
2. 確認 .env 檔中的 OLLAMA_API_KEY 有填寫任意值(例如 ollama)。
回應極慢 / 記憶體爆滿64K context 的 KV 快取極大,6GB 顯卡裝不下時會溢出到 RAM。請關閉其他佔用記憶體的程式,或使用 /no_think 提升速度。
修改了設定檔卻沒有生效App 沒有完全關閉就被重新開啟。App 會用記憶體中的舊設定覆蓋你的修改,請務必先 Quit 再修改。
改完後 GUI 設定又跑回雲端模型因為在 Model 分頁按到了 Apply。改完設定檔後請不要去觸碰該下拉選單與 Apply 按鈕

📌 關於 Claude 訂閱的額外結論: 目前 Anthropic 的 OAuth 登入在第三方 App(如 Hermes)中,會被導引至獨立的 extra_usage 計費池。如果你的計費池是空的,會經常被 HTTP 400 錯誤阻擋。要使用雲端 Claude 必須另外申請 API Key(按 token 計費)。相較之下,使用本地模型能完美避開此問題。


附錄:CLI 版本安裝指引(適合 WSL2 使用者)

如果你習慣在終端機(CLI)下操作,且本機已安裝 WSL2,可以參考以下步驟進行安裝:

1. 安裝 Hermes Agent

進入 WSL2(或 Git Bash)後執行官方安裝腳本:

curl -fsSL https://raw.githubusercontent.com/NousResearch/hermes-agent/main/scripts/install.sh | bash
source ~/.bashrc   # zsh 使用者改用 source ~/.zshrc

驗證安裝是否成功:

hermes --version

(如果已有 Python 環境,也可以直接使用 pip install hermes-agent)

2. 把 Hermes 指向 Gemma(自訂端點)

執行模型設定精靈:

hermes model

依提示選擇 Custom OpenAI-compatible endpoint(自訂 OpenAI 相容端點),並填入:

欄位填入內容
API Base URLhttp://localhost:11434/v1
API Key留空,Ollama 本機不需驗證)
Model namegemma4:e2b
Context length64000 以上(最高可填 131072
Display name自訂,例如 gemma-local

💡 在 WSL2 中連不到 Windows 本機的 Ollama? 你可以使用 Windows 的主機 IP。在 WSL 中執行 cat /etc/resolv.conf 取得 nameserver IP,將 Base URL 換成 http://<該IP>:11434/v1;或者在 Windows 系統環境變數中設定 OLLAMA_HOST=0.0.0.0 並重啟 Ollama。

3. 直接編輯設定檔(替代方案)

如果不透過設定精靈,可以直接修改 ~/.hermes/config.yaml

hermes config edit     # 用 $EDITOR 開啟設定檔

內容範例:

model:
  default: gemma4:e2b
  provider: custom
  base_url: http://localhost:11434/v1
  context_length: 32768

小結

透過本篇教學,我們成功在 Windows 本地環境利用 Ollama 與 Hermes Agent 搭建起了一個完全離線、不產生額外 API 費用的智能助理。

實測下來,對於 6GB 顯卡和 16GB 記憶體的配備來說,qwen3:4b 絕對是目前跑 Agent 最穩定且高 CP 值的選擇。儘管 2B 等級的輕量模型(如 gemma4:e2b)在日常對話中表現優異,但面對 Agent 的複雜系統 Prompts 時仍顯吃力。

希望這篇避坑指南能幫助大家順利打造出專屬的本地 AI 秘書!有任何設定上的問題,也歡迎在下方留言討論。


參考來源