AgentsRoom 現已支援 Ollama:讓本地模型與雲端並肩執行

Ollama 現已成為 AgentsRoom 的一個提供方。讓 Llama、Qwen、Gemma、DeepSeek 等本地開源模型與雲端代理並肩執行,併為每個代理設定一個本地或雲端的旋鈕,對話中途也能切換。

Ollama 現已成為 AgentsRoom 中受支援的提供方。你可以把一個本地開源模型分配給任意代理,讓它與 Claude、Codex、Grok Build 和 Mistral Vibe 在同一塊看板上執行,並在對話中途切換而不丟失上下文。你早已熟悉的那些開放權重模型:Llama、Qwen、Gemma、DeepSeek 等等,如今都到你的 room 裡報到了。

Ollama 和我們此前加入的其他提供方不太一樣。它不是又一個值得押注的代理,而是通往整個開源模型目錄的一扇門:跑在你自己的硬體上,每個 token 的成本為零,且預設私有。

Ollama 是什麼

Ollama 是一個免費、開源的執行時,它把大語言模型下載到你自己的機器上執行。一條命令 ollama pull qwen3-coder 就能拉取模型。ollama run 會把它託管在 http://localhost:11434 的本地端點上。它暴露一個相容 OpenAI 的 API,正因如此,程式設計代理無需任何定製粘合程式碼就能與它通訊;它支援 macOS、Windows 和 Linux。

它還支援工具呼叫,這正是程式設計代理不只是聊天、而要編輯檔案和執行命令時所需的能力。它的模型庫堪稱開放權重的名人錄:Llama、Qwen、Gemma、DeepSeek、Mistral、Phi 等等,尺寸覆蓋從筆記本到工作站 GPU 的各種場景。

這篇文章餘下的內容都建立在兩個事實之上。模型跑在你自己的機器上,所以你輸入的任何內容都不會穿過網路。而本地推理沒有按 token 計費的賬單。下面的一切,都是這兩點的必然結果。

人人都接受的本地與雲端之選

在此之前,這個決定是非此即彼的。全押雲端,你能獲得前沿的推理能力,但你的每一條提示、你碰過的每一個檔案,都會被髮往第三方 API 並按 token 計費。全押本地,你能獲得隱私和零成本,卻要在那些真正需要強模型的問題上放棄最強的模型。大多數團隊選定一條車道,就不再挪窩。

這種非黑即白其實是個偽命題,因為一個程式碼庫並不是單一型別的工作。在四十個檔案裡重新命名一個符號、編寫樣板測試、總結一段 diff、起草一條提交資訊:這些都不需要前沿模型,而且其中很多都會碰到你並不想外發的程式碼。反倒是一次棘手的架構重構,也許才需要那臺大引擎。為樣板工作付前沿雲端的價錢,或用一個太小的模型去束手束腳地啃硬骨頭,就是你把這個選擇當成非此即彼所要繳的稅。

在 AgentsRoom 裡,本地或雲端是一個旋鈕,而不是一個開關

AgentsRoom 本就為每個代理配備各自的提供方和模型。加入 Ollama 意味著,如今每個代理都能停在本地到雲端這個旋鈕上的任意位置,而且由你按代理、按任務來設定。

標題為「每個代理一個本地到雲端旋鈕」的示意圖。三個代理各自處在自己的水平軌道上,軌道從左端的本地(私有、免費、在你的機器上)一直延伸到右端的雲端(前沿、付費、託管)。一個批次重構代理的旋鈕靠近本地一端,執行 qwen3-coder:30b;一個測試編寫代理也靠近本地一端,執行 gemma3:12b;而一個架構師代理的旋鈕靠近雲端一端,執行 glm-4.6:cloud。

這個旋鈕,字面上就是模型 ID。輸入 qwen3-coder:30b,代理就透過 Ollama 在本地、在你的硬體上、免費地執行 Qwen。加上 :cloud 字尾,寫成 glm-4.6:cloud,同一個代理就改為透過你的 Ollama Cloud 訂閱來執行那個模型。一個字尾,就能在不改動配置中其他任何設定的情況下,把一個代理從你的 GPU 挪到一臺託管 GPU 上。

因為 AgentsRoom 會在切換提供方時保留你的上下文,所以這個旋鈕在對話中途也能撥動。讓一個代理從本地模型起步,把任務裡機械的部分磨完,再在唯一需要更深推理的那一步把它切換到雲端模型。AgentsRoom 會生成一份交接摘要,記錄改動過的檔案、進度和會話活動,讓雲端模型正好從本地模型停下的地方接手。等硬骨頭啃完,再把它撥回來。

如何使用

如果你已經在用 AgentsRoom,幾乎沒有什麼新東西要學:

  1. ollama.com 安裝 Ollama 並拉取一個模型:ollama pull qwen3-coder:30b。Qwen Coder 模型是寫程式碼時一個很強的預設選擇。配置較低的機器也能輕鬆跑 7B,而一塊 24GB 的 GPU 能帶著大上下文視窗駕馭 30B。
  2. 在 AgentsRoom 設定裡,把 Ollama 選為提供方,無論是作為預設,還是隻用在某一個代理上。
  3. 建立一個代理,給它一個角色,然後在模型欄位裡輸入 Ollama 的模型 ID。用 qwen3-coder:30b 在本地執行,或加上 :cloud 透過 Ollama Cloud 執行。
  4. 傳送一條提示。AgentsRoom 會在你的專案資料夾裡啟動真正的 ollama run 程序,並實時流式輸出,方式和它驅動其他每一個提供方完全一樣。

來自一線的一個小提示:Ollama 給新模型預設的是一個很小的上下文視窗。做代理式的工作時,請把它調大,好讓代理能把儲存庫裡實實在在的一大塊內容納入視野,而不只是最近幾條訊息。

一支免費而私有的代理叢集的經濟賬

AgentsRoom 天生就是為並行執行代理而造的:滿滿一塊看板,每個代理各司其職,各有一顆狀態圓點。在雲端提供方上,這種並行伴隨著一隻不停轉的計價表,因為六個代理同時開工,就是六張 token 賬單一起往上爬。而在本地的 Ollama 模型上,一個 token 的邊際成本為零。開起一支叢集,讓它跑一整個下午,唯一的賬單隻有電費。

一張對比六個程式設計代理並行工作時執行成本的柱狀圖。雲端機隊是一根高高的柱子,因為這六個代理每一個都按 token 計價。用 Ollama 模型的本地機隊則是貼近基線的一根很矮的柱子,因為本地推理沒有按 token 計費的賬單,唯一的成本就是電費。

這改變了並行的用途。當每個代理都要計價,你就會省著用。當它們免費,你就能以有益的方式慷慨起來:一個盯著 lint 走樣的本地代理,一個把 changelog 保持更新的代理,一個為每個新函式起草測試的代理,全都以零邊際成本在後臺跑著,而那個要計價的雲端代理則留給真正需要它的工作。如果同時跑很多代理對你來說還是新鮮事,我們在並行執行程式設計代理一文裡講過這個模式。

無需為之申辯的隱私

對很多團隊來說,決定性因素不是成本,而是程式碼去了哪裡。受監管的行業、NDA 之下的客戶專案、法務絕不允許靠近第三方 API 的內部程式碼庫:本地推理在問題被問出口之前就給出了答案,因為模型就跑在本機上,提示從不跨越網路。沒有什麼要走審查,沒有資料處理協議,也沒有資料駐留條款。

混合模式的流程圖,預設本地、按需雲端。進來的程式設計工作抵達一個按任務分流的分診環節。批次的、私有的、例行的工作交給 Ollama 上的本地模型,它私有、免費,並讓許多代理並行執行,程式碼從不離開本機。困難而不敏感的推理則交給雲端模型,為唯一需要它的那一步提供前沿算力。一條虛線箭頭表示同一個代理在任務中途從本地升級到雲端,AgentsRoom 帶著上下文一路跨過這次切換。

AgentsRoom 從頭到尾都契合這種姿態。本地模型把你的程式碼留在本機,而 AgentsRoom 自身在桌面版與手機之間的同步是端到端加密的,所以哪怕你從房間另一頭監督整支機隊,也絕不會拆穿本地模型剛剛為你換來的隱私。如果你讀到這裡是因為合規,那麼正是這個組合才是重點,它也與我們在vibe coding 與 GDPR 合規一文中的做法相得益彰。

那麼混合模式便會自行浮現:把私有的和批次的分流給本地模型,只把困難而不敏感的推理升級到雲端,交接就交給旋鈕去打理。前沿算力用在它能掙回身價的地方,其餘每一處則享有本地的隱私。

為何重要

AgentsRoom 從來都不是某一個模型或某一家廠商的客戶端。它是一個座艙,讓你為每項任務執行最合適的代理,彼此並肩,同在一雙眼睛的注視之下。Ollama 以一種具體的方式拓寬了這個承諾:它不是又一個要接入的雲端代理,而是整個開放權重生態,按你自己的條件,價格為零,且預設私有。

多數的活兒交給本地,少數的交給雲端,再用一個旋鈕把任意代理在兩者之間挪動。下載 AgentsRoom,接上 Ollama,讓滿屋子的開源模型開工。檢視完整的提供方相容性矩陣,或進一步瞭解多提供方支援,以及對話中途切換如何讓你的上下文完好無損。

繼續閱讀

下載 AgentsRoom

在一個視窗中執行你所有專案的 AI 代理(Claude、Codex、Antigravity CLI、OpenCode、Aider、Grok Build、Mistral Vibe、Kimi Code)。

免費下載 AgentsRoom

配套應用:隨時隨地監控你的 Agent

使用 Claude、Codex、Antigravity CLI 或其他 AI 提供商。

獲取擴充套件
Chrome Web Store

把 Bug 和需求直接傳送到您的公開待辦清單。

AgentsRoom 實際執行一瞥。

多專案管理
多供應商
多代理執行
實時狀態
檔案差異與提交
行動應用
實時預覽
代理團隊
瀏覽器自動化
Backlog 驅動開發
提示詞庫
技能庫
檢視所有功能