別再盯著終端讀了。
直接跟你的代理說話。
Voice Mode 是與一個正在執行的 AI 程式設計代理進行的雙向語音對話。點一下,說出你的那一輪,代理就用自然的聲音出聲回答。不用打字提示,也不用滾動一牆的終端輸出去弄清發生了什麼。
開啟擴音,它就在每次回覆之間繼續聆聽,於是你可以一邊踱步、一邊看建置、一邊喝咖啡,一邊把方案講清楚。問一句重構進展到哪了,它告訴你。說一句跑一下測試再彙報,它就去跑,然後把結果念出來。

Voice Mode 實際執行:代理正在聆聽,擴音已開啟,回覆聲音已設定,代理在你的每輪之間出聲回答。
Voice Mode 回應的正是這樣一種轉變。你的代理執行得更久、自己做得更多:它編輯檔案、執行命令、寫測試、修復自己弄壞的東西。瓶頸不再是寫程式碼,而是在代理工作時跟上節奏。一行又一行地讀終端輸出,或者再敲一句提示去問到底怎麼了,每一輪都把你拽回鍵盤前。
Voice Mode 把這個迴圈變成一場對話。你出聲說出你的那一輪,代理出聲回答。你提問、給出糾正、批准一個方案,全都靠聲音完成,而且你聽到的是用自然聲音念出來的回覆,而不是在螢幕上費勁解讀。這就是監督一個程序和與一位隊友交談之間的區別。
這和語音聽寫不是一回事。聽寫是單向的:你說話,它把你的話轉寫進 composer,你還是要去讀代理的回覆。Voice Mode 是雙向的:語音進,語音出,一來一回的實時往返。聽寫幫你更快寫出一段提示。Voice Mode 讓你在保持代理運轉的同時徹底甩開鍵盤和螢幕。
為什麼要跟代理說話,而不是打字和螢幕報讀
擴音待在迴圈裡。一個能幹的代理可以為一條指令執行好幾分鐘。有了擴音的 Voice Mode,你全程保持聯絡,不用守在鍵盤上。問個狀態、引導下一步、確認一個決定,全都可以在你站在白板前或看著 app 過載時完成。
一來一回的自然往返。打一句提示、等待、讀輸出、再打一句,是一個磕磕絆絆的迴圈。說出你的那一輪再聽到答案,則是一場對話。對短回合(一個快速的好、一處小糾正、再問一個問題)它更快,也比每次更新都去讀一牆終端文字省力得多。
解放眼睛,解放螢幕。聽到代理的回覆,意味著你不必盯著終端就知道它做了什麼。瞥一眼建置、你的測試、你的設計,或者什麼都不看,讓念出來的更新告訴你進展如何。代理在旁白,你把眼睛留在真正幹活的地方。
用同一份語音額度。Voice Mode 使用 AgentsRoom 的語音後端,進來時做語音轉文字、出去時做文字轉語音,從與聽寫相同的語音額度餘額里扣。一份餘額同時支撐提示的聽寫和完整的語音對話,所以沒有額外的東西要去配置。
Voice Mode 怎麼用
在一個正在執行的代理上開啟它,說、聽、再來一遍。用一個語音迴圈代替打字加螢幕報讀。
在正在執行的代理上開啟 Voice Mode
Voice Mode 是為一個已經在它的終端裡執行的代理啟動的,從那個代理的 composer 裡開啟。它需要一個活動會話,因為這場對話是和那個特定代理、在它當前的上下文裡進行的,而不是一個全新的對話。
點一下開口說
點一下並說出你的那一輪:一個問題、一條指令、一處糾正。狀態切換到聆聽並帶一個實時指示,讓你看到麥克風正在採集。選擴音讓它在各輪之間繼續聆聽,或選點按說話一次只說一輪。
它轉寫併發給代理
你說完後,你的語音會被轉寫並作為你的訊息發進正在執行的代理,就好像你親手打出來的一樣。狀態會經過轉寫和傳送,讓你隨時知道你的這一輪走到了流程的哪一步。
代理開始工作
代理在它自己的會話裡處理你的這一輪:它可以讀檔案、執行命令、編輯程式碼、跑測試,凡是你訊息裡要求的都行。Voice Mode 在它幹活時顯示一個帶代理名字的工作狀態,就像終端裡普通的一輪。
聽它把回覆出聲念出來
代理回答時,它的回覆會用你挑的聲音出聲念出來。你聽到狀態、結果、下一個問題,都不用去讀終端。一個可選的提示音標出各輪之間的分界,讓你知道什麼時候又輪到你了。
接著說你的下一輪
在擴音下,它已經又在聆聽了,你只管繼續說。在點按說話下,你點一下來開始你的下一輪。對話可以想持續多久就持續多久,然後你關掉 Voice Mode,代理就停在你在它終端裡離開它的那個地方。
擴音,讓你不靠鍵盤也待在迴圈裡
Voice Mode 的意義不在於新鮮。它在於不被拴在桌前也能跟上一個快速的代理。
一個現代程式設計代理每一輪都做很多事,而你各輪之間的間隙正是你平時會丟掉上下文的地方:你走開,代理做完,你回來面對滿版現在得去讀的輸出。擴音的 Voice Mode 補上了這個缺口。代理做完時出聲告訴你它做了什麼,你不用重新坐下就能回答。
擴音在各輪之間保持麥克風開啟,於是對話像打電話一樣流暢:你說、它做、它說、你再說。想控制每一輪?點按說話一次只說一輪,在嘈雜的房間裡、或者你只想偶爾插一句話時很方便。
提示音是個小東西,但在實際中很重要。當你沒看螢幕時,一聲短促的提示音告訴你代理已經說完、輪到你了,這樣你既不會搶著它說話,也不會在沉默裡乾等、琢磨它是不是說完了。
這正是讓 Voice Mode 對真實工作有用、而不只是一個演示的地方。它是為這樣的時刻打造的:代理在挑大樑,而你想去引導、確認、批准,同時你的手和眼睛都騰出來做別的一切。
挑你的聲音,跟住這場對話
Voice Mode 給你那些讓語音對話舒服的控制項,並清楚地告訴你每一輪走到了哪裡。
聲音與提示
- 回覆聲音:alloy 以及其他自然聲音
- 擴音:在各輪之間繼續聆聽
- 點按說話:一次只說一輪
- 提示音:一聲短促的音標出每輪的分界
- 自動語言:用你自己的話說,它識別語言
對話狀態
- 聆聽:麥克風正在採集你的這一輪
- 轉寫:你的語音正被轉成文字
- 傳送:你的訊息正發往代理
- 工作:代理正在幹活
- 說話:代理的回覆正被出聲念出來
自動語言識別意味著你不用先挑一種語言就能開口說,而可見的狀態意味著你永遠不用去猜代理是聽到了你、在工作、還是即將回答。
Voice Mode 在底層到底做了什麼
Voice Mode 是疊在一個普通代理會話之上的全雙工層。輪到你時,它錄下你的聲音並把音訊發到 AgentsRoom 後端,後端做語音轉文字並返回轉寫。這段轉寫作為你的訊息被注入正在執行的代理,所以從代理的角度看,這只是它早已在和你進行的對話裡又多出的一輪。
輪到代理時,它的文字回覆被送回 AgentsRoom 後端,用你選的聲音做文字轉語音,生成的音訊再放給你聽。語音轉文字進,文字轉語音出,中間是代理真正的工作。這正是 Voice Mode 需要一個帳戶和一個正在執行的代理的原因:語音後端代理那些語音模型,而這場對話繫結在一個活動會話上。
因為代理永遠只看到文字,Voice Mode 從構造上就對供應商保持中立。無論代理是 Claude Code、Codex、Antigravity CLI、OpenCode、Aider、Grok Build、Mistral Vibe 還是 Kimi Code,你轉寫出來的那一輪都作為一條訊息抵達,而它的回覆也以同樣的方式被念出來。語音層裡沒有任何東西取決於底下跑的是哪個 CLI。
Voice Mode 和語音聽寫共用同一份語音額度餘額,因為兩者都依賴同一個語音後端。聽寫花額度做單向轉寫;Voice Mode 把額度花在轉寫加念出回覆的一來一回上,這本質上是開放式的,因為一場對話只要你一直說就能一直進行下去。
Voice Mode 在哪裡用
與一個正在執行的桌面代理進行的雙向語音對話,語音進、語音出。
桌面版,在一個活動代理上
Voice Mode 在 macOS 上執行,從一個已經在執行的代理的 composer 裡啟動。它和那個特定代理在它當前的會話裡交談,所以這場對話擁有代理積累起來的全部上下文,而不是一張白紙。
語音進
你的這一輪由麥克風採集、由 AgentsRoom 語音後端轉寫,然後作為你的訊息發給代理。擴音在各輪之間保持麥克風開啟;點按說話一次只說一輪。語言會自動識別。
語音出
代理的回覆會用你選的聲音(alloy 等)透過文字轉語音出聲念出來。一個可選的提示音標出每段念出回覆的結尾,讓你即使沒看螢幕也知道輪到你了。
語音聽寫 vs Voice Mode
兩者都用你的聲音。一個替你寫提示,另一個跟你對話。
語音聽寫(單向)
- : 你說話,它把你的話轉寫進 composer。
- : 你還是得自己在螢幕上讀代理的回覆。
- : 很適合快速寫出一段又長又精確的提示。
- : 你守在鍵盤前去傳送、去讀結果。
- : 只有一個方向:語音進,文字進草稿,接下來由你來。
Voice Mode(雙向)
- : 你說出你的那一輪,代理出聲回答。
- : 你聽到回覆,不必去讀終端。
- : 很適合在代理工作時引導和確認。
- : 擴音讓對話不靠鍵盤也能繼續下去。
- : 兩個方向都有:語音進,代理工作,語音出。
用聽寫在幾秒內寫出一段好提示,用 Voice Mode 在代理執行它時跟它對話。
一輪口頭交流聽起來是什麼樣
這些你一個字都不用打。你出聲說出你的那一輪,代理去幹活,然後它把回覆念回給你。這是一輪 Voice Mode 對話。
一輪對話
你:登入重構進展到哪了?
代理:限流器已經接上,成功路徑沒動。還有兩個測試是紅的。
你:把那兩個失敗的測試修好,然後跑整個測試套件,告訴我數量。
代理:搞定。兩個現在都透過了。完整套件:142 個透過,0 個失敗。
你:好。用一條簡短的訊息提交,就停在這。FAQ
AgentsRoom 裡的 Voice Mode 是什麼?
Voice Mode 是與一個正在執行的 AI 程式設計代理進行的雙向語音對話。你點一下並說出你的那一輪,你的語音被轉寫併發給代理,代理去幹活,它的回覆再用自然的聲音念回給你。它讓你跟代理對話、聽它的回答,而不必打字提示、讀終端輸出。
Voice Mode 和語音聽寫有什麼不同?
語音聽寫是單向的:你說話,你的話作為提示被轉寫進 composer,然後你在螢幕上讀代理的回覆。Voice Mode 是雙向的:你說出你的那一輪,代理出聲回答,一來一回的實時口頭往返。聽寫幫你更快寫出一段提示;Voice Mode 讓你在代理工作時進行一場擴音對話。
代理真的會回話嗎?
會。代理的回覆會透過文字轉語音轉成聲音,並用你挑的聲音出聲播放。你聽到狀態、結果和下一個問題,所以不用去讀終端就知道代理做了什麼。
擴音模式是什麼?
擴音在各輪之間保持麥克風開啟,於是對話像打電話一樣流暢:你說、代理工作、它說,然後它已經在聆聽你的下一輪。如果你更想控制每一輪,點按說話一次只說一輪,在嘈雜的房間裡很方便。
我能選聲音嗎?
能。你挑選用於代理口頭回答的回覆聲音(alloy 及其他聲音)。你還可以開啟一個可選的提示音,它會在各輪的分界處發一聲短促的音,讓你知道代理什麼時候說完、什麼時候輪到你。
Voice Mode 支援哪些語言?
Voice Mode 自動識別你說的語言,所以你可以用自己的話說話,不必先挑一種語言。轉寫由 AgentsRoom 語音後端處理,和聽寫用的是同一套語音棧。
我需要帳戶和一個正在執行的代理嗎?
兩個都需要。Voice Mode 需要一個登入的帳戶,因為語音後端代理那些語音模型並扣你的語音額度;它也需要一個已經在執行的代理,因為這場對話繫結在那個活動會話上、並使用它當前的上下文。
Voice Mode 會消耗額度嗎?
會。Voice Mode 跑在和聽寫相同的語音額度餘額上。聽寫花額度做單向轉寫;Voice Mode 把額度花在轉寫加念出回覆的完整一來一回上,這是開放式的,因為一場對話只要你一直說就能一直進行下去。
線上網頁演示裡能用嗎?
不能。公開的網頁演示模擬了後端,所以實時語音對話在那裡跑不起來。在演示裡點 Voice Mode 會顯示一條提示,邀請你下載 AgentsRoom,在那裡 Voice Mode 才會跟你真正的代理對話。
Voice Mode 能配合 Claude Code、Codex 和 Antigravity 用嗎?
能,全都可以,還有 OpenCode、Aider、Grok Build、Mistral Vibe 和 Kimi Code。代理永遠只看到文字,所以你口頭的那一輪作為一條訊息抵達,它的回覆也以同樣的方式被念出來,無論底下跑的是哪個代理 CLI。
搭配使用更佳
語音聽寫
Voice Mode 的單向同伴。用聲音把一段又長又精確的提示口述進 composer,然後在代理執行它時跟它對話。
遠端代理控制
用手機驅動你的桌面代理。當你離開鍵盤時,聲音是跟上一個代理最自然的方式。
行動版-桌面版同步
你手機和桌面代理之間端到端加密的連線,讓你與 Mac 上正在執行的東西保持相連。
代理狀態
一眼看清誰在工作、誰完成了、誰卡住了。Voice Mode 讓你出聲向一個正在工作的代理問這個狀態。
多供應商
讓 Claude、Codex、Antigravity、OpenCode、Aider、Grok Build、Mistral Vibe 和 Kimi Code 並排執行。Voice Mode 以同樣的方式跟它們中的任何一個對話。
Scratchpad
頁尾裡一個更大的編輯器,用於筆記和更長的簡報。當一輪太長或太精確而不便口述時,把它和語音搭配起來用。
對你的代理說話,聽它們回話
下載 AgentsRoom,在一個正在執行的代理上開啟 Voice Mode。說出你的那一輪,聽到回覆,在代理幹活時擴音待在迴圈裡。一場內建在你 AI 程式設計 IDE 裡的雙向語音對話。
配套應用:隨時隨地監控你的 Agent
使用 Claude、Codex、Antigravity CLI 或其他 AI 提供商。
把 Bug 和需求直接傳送到您的公開待辦清單。
AgentsRoom 實際執行一瞥。