代理委派 :
你的開發代理把測試委派出去
代理委派讓你的開發代理完成一個功能後,把驗證交給獨立的 QA 代理。開發端繼續用你信任處理難題的模型寫程式碼。QA 代理在更便宜的模型上跑測試。兩者透過 AgentsRoom MCP 伺服器對話,所以代理委派端到端工作,不用你手動複製任何東西。
你不再為瀏覽器點選付 Opus 價格。你不再用截圖和 DOM dump 撐爆開發代理的上下文。代理委派把每個任務路由到合適價格的合適模型,QA 代理完成後會回 ping 開發代理,迴圈自動閉合。
代理委派執行中 : Codex 開發代理完成功能,呼叫 run_qa_test,QA 代理在更便宜的模型上開啟瀏覽器並回報結果。
這就是代理委派要解決的問題。你跑一個強力的開發代理 (Claude Opus、Codex,那種能設計 API 或重構 store 的模型)。代理 10 分鐘交付功能。然後再花 8 分鐘在瀏覽器裡點來點去驗證功能。同樣昂貴的 token 單價。同一個剛才還在深入思考你的領域邏輯的模型,現在在讀按鈕的文字。
代理委派解決了這個問題。功能完成時,開發代理呼叫一個 MCP 工具 run_qa_test,附帶一個場景。AgentsRoom 用你為 QA 選定的模型 (Claude Haiku、Codex mini、GPT-4 mini,隨你) spawn 一個臨時 QA 代理。QA 代理拿到 AgentsRoom Browser MCP,驅動頁面,斷言結果,回報判定。開發代理讀取判定,繼續前進。
這就是代理委派,也是本頁面覆蓋的唯一迴圈。一個開發,一個 QA,一個 MCP。和資深工程師把迴歸測試委派給初級工程師或 QA 是同一個想法 : 資深繼續設計,初級跑清單。代理委派在模型之間複製了這種分工。

代理委派視覺化 : 父開發代理 (Codex) 和子 QA 代理 (Claude) 出現在同一個代理列表裡,開發到 QA 的交接一目瞭然。
為什麼值得接入代理委派
首先,錢。在 Claude Opus 上的一次測試透過和在 Claude Haiku 上的一次測試透過成本相差懸殊。同樣的瀏覽器、同樣的斷言、同樣的截圖。代理委派讓便宜的模型做便宜的活。開啟這個開關的人報告說,在 QA 多的日子裡,他們的 token 賬單按一個真實可測量的倍數下降,不是 5 到 10 個百分點。
其次,上下文。當開發代理自己跑測試時,每一張截圖、每一個 DOM dump、每一條 console log 都會進入開發代理的上下文視窗。20 分鐘的點選就是開發代理接下來整段會話都要扛著的兆位元組級別的噪音。代理委派把那些噪音隔離在臨時的 QA 代理裡。開發代理只拿回一句乾淨的'透過'或'失敗',沒別的。
第三,生態角度。每一次代理委派都節省真實的算力。在 Opus 在跑的地方改跑 Haiku,那一步的能耗砍半。乘上團隊所有人和一年裡所有的測試迴圈,代理委派就成了你技術棧碳排放面上的一個不容忽視的旋鈕。
第四,可靠性。自己驅動瀏覽器的開發代理容易跑偏。截了兩張圖後,它就忘了自己原本想驗證什麼。代理委派裡的 QA 代理只有一個任務、一個提示。它測試、它回報、它消亡。迴圈短、可預測、易於除錯。
本頁唯一涵蓋的流程
一個開發代理。一個 QA 代理。一個 MCP 呼叫。端到端的代理委派。
開發代理交付功能
你的開發代理 (Claude Opus、Codex high reasoning,任何你信任的貴模型) 完成實現。新端點、新頁面、新流程。程式碼寫好,檔案儲存。
開發代理呼叫 run_qa_test
開發代理不自己開瀏覽器,而是呼叫 AgentsRoom Test Runner 伺服器的一個 MCP 工具 run_qa_test,附帶一個樸素英文場景。那就是代理委派 API 表面的全部。
AgentsRoom spawn QA 代理
AgentsRoom Test Runner 用你配置的更便宜的模型 (Claude Haiku、Codex mini、GPT-4 mini) spawn 一個臨時 QA 代理。QA 代理拿到 AgentsRoom Browser MCP 的工具 : navigate、click、type、screenshot、evaluate、get_logs、get_state。
QA 代理跑測試
QA 代理開啟頁面,走完場景,斷言結果,必要時捕獲截圖,並讀取 console log 抓住開發代理可能會漏掉的執行時錯誤。
QA 代理提交判定
完成後,QA 代理呼叫 submit_verdict,給出透過、失敗或無法判定的結果以及簡短摘要。截圖和日誌會附上。QA 代理程序被銷燬。它的上下文視窗隨之消失。
開發代理讀判定繼續
開發代理收到判定作為 run_qa_test 的響應。透過時,開發代理提交或轉下一張工單。失敗時,開發代理讀取失敗摘要,修 bug,觸發新一輪代理委派。迴圈自動閉合。
代理委派的經濟學
為什麼聰明的開發到 QA 分工在不降低標準的前提下降低你的 AI 賬單。
瀏覽器測試是重複的。開啟頁面、點按鈕、讀標籤、檢查 toast。每百萬 token 50 美元的模型幹這活,和每百萬 token 3 美元的模型幹這活一樣好。甚至可能更好,因為便宜的模型不會覺得無聊。代理委派把工作裡無聊的那一半交給便宜的模型。
真實會話裡的真實數字 : 一個複雜流程的典型端到端測試在截圖、DOM dump 和推理步驟之間會燒掉 60k 到 200k token。在 Opus 上,那是每次測試真金白銀。在 Haiku 上,那是零錢。代理委派把每日 QA 習慣從預算負擔變成免費的反射動作。
乘以每一次迴圈。一個非平凡功能的正常開發日要跑 5 到 20 次測試。代理委派在這些重複中複利累積。開發代理保持昂貴 (你希望它昂貴),QA 代理保持便宜,差額就是純粹的節省。
代理委派對地球也更友好。同樣的活更少的算力意味著更少的能源、資料中心更少的水、更少的碳排放。這不是接入代理委派的唯一理由,但確實是把任務路由到合適大小的模型的一個合理副作用。
代理委派的真實模型分工
人們實際接到代理委派開發端和 QA 端上的東西。
開發端 (有意保持昂貴)
- Claude Opus 4.7
- Claude Sonnet 4.6
- Codex high reasoning
- GPT-4 with deep reasoning
- Gemini 3 Pro
QA 端 (委派給更便宜的)
- Claude Haiku 4
- Claude Sonnet 4 (low effort)
- Codex mini
- GPT-4 mini
- Gemini 3 Flash
代理委派不鎖死這張矩陣。你按專案配置 QA 模型。你甚至可以代理委派到完全不同的提供商 : 開發用 Opus,QA 用 Codex mini,無共享上下文,就一次 MCP 呼叫。
代理委派在底層實際做什麼
代理委派建在 AgentsRoom MCP 棧之上。開發代理在它自己的 CLI 裡執行 (Claude Code、Codex、Antigravity、OpenCode、Aider、Grok Build、Mistral Vibe、Kimi Code)。AgentsRoom 把 Test Runner MCP 伺服器注入到那個代理。Test Runner 暴露一個工具 : run_qa_test。那是每一次代理委派呼叫的入口。
當 run_qa_test 觸發時,AgentsRoom 在同一個專案裡 spawn 一個新的 CLI 程序,配置不同。那個配置掛著 Browser MCP,掛著 QA 系統提示,模型換成你在 QA 端設的那個。新程序是一個臨時 QA 代理 : 它在測試期間活著,在 submit_verdict 之後死亡。
QA 代理執行期間,開發代理在 run_qa_test 呼叫上暫停。AgentsRoom 把 QA 代理顯示在同一個代理列表裡,縮排在開發代理下面 (上圖可見)。QA 代理完成時,它的判定作為 run_qa_test 的結果返回,開發代理恢復。從開發代理的視角看,代理委派就是一次 MCP 往返。
開發代理永遠拿不到瀏覽器工具。AgentsRoom 在 spawn 時從開發代理的允許列表裡剝掉 browser_* 工具。這就是讓代理委派可靠的部分 : 即使開發代理本能想截一張圖,它也無法回退到自己測試。唯一的前進路徑是 run_qa_test。靠移除而不是請求實現的代理委派。
代理委派今天跑在哪裡,下一步去哪裡
AgentsRoom 的代理委派今天優先支援瀏覽器。同樣的形狀,更多平面在路上。
今天 : 瀏覽器測試委派
QA 代理透過 Browser MCP 驅動 AgentsRoom 內嵌瀏覽器。本地開發伺服器、公開預覽隧道、staging URL,Chromium 能渲染的一切。表單、模態框、拖放、對話方塊、console log、網路錯誤。代理委派覆蓋一個 Web QA 工程師會覆蓋的全部表面。
Electron 應用測試委派
如果你自己交付 Electron 應用,你可以在你的專案裡安裝 AgentsRoom Electron MCP 庫。QA 代理連線你的 Electron 應用的方式和連線 Chromium 分頁一樣。代理委派跨入桌面應用測試,開發端完全不變。
React Native 應用測試委派 (路線圖)
同樣的代理委派形狀即將到來 React Native。QA 代理將透過 AgentsRoom React Native MCP 驅動 iOS 或 Android 模擬器。開發代理交付一個螢幕,QA 代理在上面點選操作。同樣的 run_qa_test 呼叫,同樣的開發到 QA 的交接,移動目標。
沒有代理委派 vs 有代理委派
同樣的功能,同樣的 QA 透過。不同的賬單、不同的上下文、不同的可靠性。
沒有代理委派
- : 開發代理 (貴的) 自己開瀏覽器。
- : 每張截圖、每個 DOM dump、每條 console log 都落進開發代理的上下文。
- : 20 分鐘點選在更便宜的模型本可以做的活上燒 Opus 的 token。
- : 開發代理截到第二張圖就忘了自己在幹什麼。
- : 你為瀏覽器點選付全價,地球也付全價。
有代理委派
- : 開發代理呼叫 run_qa_test 然後等。
- : 便宜的 QA 代理做點選、做斷言、抓截圖。
- : 只有判定 (透過、失敗、摘要) 到達開發代理。
- : QA 代理是臨時的 : submit_verdict 後消亡,上下文不膨脹。
- : token 賬單下降,開發代理保持專注,迴圈自動閉合。
代理委派是你能接入編碼代理配置裡最便宜的可靠性勝利。
一次代理委派呼叫長什麼樣
這是一次開發到 QA 代理委派的完整形狀。開發代理透過 Test Runner MCP 發起這個呼叫,然後等響應。
MCP 工具呼叫 (開發代理)
run_qa_test({
scenario: "Open http://localhost:3000/login.\n Type the seeded test user in the email field.\n Submit the form.\n Assert the dashboard URL is reached and the user's name is shown in the header.\n Capture a screenshot on success, capture console logs on failure."
})FAQ
AgentsRoom 裡的代理委派是什麼 ?
代理委派是兩個 AI 編碼代理之間的開發到 QA 的交接。開發代理完成一個功能,呼叫一個 MCP 工具 (run_qa_test),一個臨時 QA 代理在不同的模型上跑測試。開發代理讀取判定,繼續前進。整個代理委派流程透過 AgentsRoom MCP 伺服器進行。
為什麼我會想要代理委派 ?
三個原因。錢 : QA 代理跑在更便宜的模型上,所以一次測試透過的成本只是在開發模型上的一小部分。上下文 : 開發代理保持乾淨,所有截圖和 DOM dump 都和 QA 代理一起消亡。可靠性 : QA 代理只有一個任務,所以它測得比一個一邊點瀏覽器一邊多工的開發代理更好。
哪些模型能用於代理委派 ?
AgentsRoom 支援的任何模型 : Claude (Opus、Sonnet、Haiku)、Codex (high、mini)、Antigravity (Pro、Flash)、OpenCode、Aider、Grok Build、Mistral Vibe、Kimi Code。代理委派是跨提供商的。常見分工是開發端用 Claude Opus 或 Codex,QA 端用 Claude Haiku 或 Codex mini,但由你來選。
代理委派只用於瀏覽器測試嗎 ?
今天是的,QA 代理驅動 AgentsRoom 內嵌的 Chromium 瀏覽器。明天,同樣的代理委派形狀覆蓋 Electron 應用 (在你的 Electron 專案裡安裝 AgentsRoom Electron MCP 庫) 和 React Native 應用 (路線圖,iOS 和 Android 模擬器)。
代理委派怎麼防止開發代理自己做測試 ?
AgentsRoom 在 spawn 時從開發代理上剝掉 browser_* 工具。開發代理字面上無法呼叫 browser_navigate 或 browser_screenshot。唯一的瀏覽器路徑是 run_qa_test,它會觸發代理委派。這個約束是機械的,不是提示裡禮貌的請求。
代理委派是雲的還是本地的 ?
本地優先。開發代理、臨時 QA 代理、MCP 橋接和瀏覽器全都在你的機器上執行。代理委派只在底層模型 (Claude、Codex、Antigravity) 與它自己的提供商通訊時才使用雲,和普通的代理執行完全一樣。
代理委派真的省錢嗎 ?
是的,在 QA 重的日子裡省得很有意義。在 Opus 或 Codex high 上的一個複雜端到端測試 vs 在 Haiku 或 Codex mini 上的同一個測試,成本差大約是 10 倍。在整個團隊的一個開發日裡做代理委派,這個差距會快速放大。
開發代理從代理委派那裡拿回什麼 ?
一段簡短的結構化判定 : 透過、失敗或無法判定,附摘要、可選的截圖路徑和可選的 console log。上下文裡沒有原始截圖,沒有 DOM dump。這正是代理委派的全部要點 : 把 QA 的噪音隔離在 QA 代理裡。
QA 代理失敗時可以建一張 backlog 工單嗎 ?
可以。代理委派給 QA 代理配備了 Backlog MCP。一次失敗可以作為專案上的一張 backlog 工單落地,附帶場景、截圖和 console log。開發代理讀取判定,backlog 工單承載長篇細節。
代理委派相對於 AgentsRoom 其他功能位於什麼位置 ?
代理委派建立在 Browser Automation (給 QA 代理瀏覽器) 和 AgentsRoom MCP 伺服器 (給每個代理它的工具表面) 之上。Agent Teams 是更廣的多代理工作流程編輯器 : 代理委派是那種工作流程的開發到 QA 口味的版本,但以一次 MCP 呼叫的形式暴露出來,所以任何提供商的任何代理都可以使用,不用配置一張圖。
搭配使用
Browser Automation
代理委派的 QA 端驅動的 Chromium 和 Browser MCP 層。每個專案一個真實持久的瀏覽器。
Agent Teams
視覺化多代理工作流程編輯器。代理委派是開發到 QA 的口味,Agent Teams 是帶 N 個節點和反饋迴圈的完整圖版本。
AgentsRoom MCP
讓代理委派成為可能的 MCP 伺服器 : Test Runner、Browser、Backlog、Terminal Commands、Prompt Library。
Multi-Provider
Claude、Codex、Antigravity、OpenCode、Aider、Grok Build、Mistral Vibe 和 Kimi Code 並排執行。代理委派是同一個想法的跨提供商角度。
Claude Code Token Usage
每個會話的實時 token 表。確認代理委派在實際中給你的美元節省最快的方法。
Public Backlog
當 QA 代理在一次代理委派透過中失敗時,bug 落在這裡。客戶和隊友看到迴歸,開發代理接手。
別再為 QA 點選付 Opus 價格
下載 AgentsRoom 試試代理委派。把開發代理接到你信任的模型上,把 QA 代理接到更便宜的模型上,讓開發到 QA 的交接透過 MCP 自動發生。
配套應用:隨時隨地監控你的 Agent
使用 Claude、Codex、Antigravity CLI 或其他 AI 提供商。
把 Bug 和需求直接傳送到您的公開待辦清單。
AgentsRoom 實際執行一瞥。