別再手打 prompt。
口述就好。
語音聽寫就住在代理 composer 裡。點麥克風,說出你的 prompt,語音轉文字的結果就落進草稿的游標處。這是為你的 AI 程式設計代理準備的語音轉文字,沒有要單獨伺候的聽寫 app,也不用在兩個視窗之間複製貼上。
手打一段又長又精確的 prompt 要花上幾分鐘,口述同一段只要幾秒。給代理更多上下文,更少的澄清往返,更少被浪費的 token。價值已經從程式碼轉移到了 prompt 上,而語音聽寫是寫出一個好 prompt 最快的方式。
語音聽寫實戰:點麥克風,說出 prompt,看實時聲波動畫,語音轉文字的轉寫就落進 composer,隨手編輯後即可傳送。
語音聽寫回應的正是這樣一個轉變。與 AI 程式設計代理協作時,最難的已經不再是寫程式碼,程式碼由代理來寫。最難的是寫 prompt:描述你想要什麼、有哪些約束、邊界情況、要改哪個檔案、要避免哪些行為。一個精確的 prompt,決定了你是一次命中還是十次令人沮喪的往返。而精確的 prompt往往很長,所以手打很慢。
語音聽寫去掉了打字這道稅。你點 composer 裡的麥克風按鈕,把本來要打的內容全說出來,往往比你願意手打的還要多,語音轉文字的轉寫就出現在草稿裡。你能以每分鐘 150 個詞說話,卻不能以每分鐘 150 個詞打字。口述就是更快,而更快的通道意味著你能為每個任務給代理更多上下文。
這不是外掛附件。麥克風是 AgentsRoom composer 的一部分,就在 prompt 庫和草圖工具旁邊。轉寫會插入到你的游標處,所以你可以在同一份草稿裡把手打和口述混著用。什麼都不會自動發出去:文字落進草稿,你讀一遍,改掉模型聽錯的那一個詞,準備好了再按 Enter。這裡的語音聽寫是寫作的助手,不是自動駕駛。

麥克風按鈕就在 composer 工具欄裡。錄音時,實時聲波顯示輸入音量,然後轉寫好的 prompt 出現在草稿中。
為什麼要口述 prompt 而不是手打
速度。你說話比打字快好幾倍,也不會因為找按鍵而打斷思路。一段兩個段落、手打要三分鐘的 prompt,口述只要三十秒。在為代理寫 prompt 的一整天裡,省下的時間會累積成實打實的好幾個小時。
精確。因為口述幾乎不費力,你會說得更多。你會描述本來會跳過的邊界情況、本來不會點名的檔案、想要避免的行為。更豐富的 prompt 就是更精確的 prompt,而這正是讓 AI 程式設計代理第一次就把任務做對的關鍵。
token 經濟。與代理的每一次澄清往返都要花 token:代理發問,你回答,它再重讀上下文。一開始就給出精確的口述 prompt,能把這些往返壓扁。更少的來回意味著達到同樣結果花更少的 token,直接省下你的 AI 程式設計賬單。
解放雙手,移動可用。在桌面版,你可以在代理執行時騰出雙手,把下一個 prompt 用語音口述出來。在手機上,語音聽寫是餵給代理最快的方式,不必和移動鍵盤較勁。把想法說出來,它就落進你 Mac 上的代理裡。
語音聽寫怎麼用
點麥克風、說話、檢查、傳送。四步搞定,無需單獨 app,不用複製貼上。
點 composer 裡的麥克風
把游標放進代理 composer,點工具欄裡的麥克風按鈕。第一次時,macOS 會請求麥克風許可權,AgentsRoom 把這個請求轉交給系統,你只需授權一次。
說出你的 prompt
按鈕切換為錄音狀態:一個帶實時語音聲波的脈動狀態,實時顯示你的輸入音量,讓你知道麥克風確實在採集聲音。用你自己的語言,把你想讓代理知道的都說出來。
停止,它就開始轉寫
再點一次停止。音訊被送到你選的轉寫模型(預設 GPT-4o Transcribe,也可選 GPT-4o mini Transcribe 或 OpenAI Whisper)。在語音轉文字執行時,按鈕顯示轉寫中的狀態。
轉寫落到你的游標處
轉寫好的文字插入到草稿的游標位置,需要時會自動補一個分隔空格。游標位置會被還原,所以你可以繼續打字或再口述一段。在同一個 prompt 裡,手打和口述可以自由混合。
檢查並編輯
現在什麼都還沒發出去。prompt 停在草稿裡。讀一遍,改掉模型偶爾聽錯的詞,用鍵盤加一行,調整一下句序。代理究竟收到什麼,完全由你掌控。
準備好就傳送
按 Enter 把 prompt 發給代理,和手打的訊息完全一樣。在代理看來這只是文字,所以語音聽寫在 Claude Code、Codex、Antigravity CLI、OpenCode、Aider、Grok Build、Mistral Vibe 和 Kimi Code 上的表現都一樣。
prompt 更快,token 更少
為什麼一開始就口述一個更好的 prompt,比手打一個單薄的再反覆迭代更划算。
一個單薄的 prompt,貴在一種不顯示在時鐘上的地方。代理沒有足夠的依據,於是它猜,你糾正,它重讀整個上下文,你再糾正。每一輪都是輸入 token、輸出 token 和快取讀取。為了澄清一個功能而來回三次,可能比這個功能本身還貴。
語音聽寫把這筆賬翻了過來。因為說話很快,你會把上下文前置:約束、檔案路徑、要避免的行為、你心裡那個例子。代理更接近一次就做對。你用三十秒的口述,換掉兩三個被避免的澄清迴圈。
而且會複利累積。普通的一天就是幾十個 prompt。如果語音聽寫在其中相當一部分上各省下一次往返,省下的 token 就會在一天、一個團隊、一個月裡不斷疊加。最便宜的 token,是你壓根不必花在重新解釋自己上的那一個。
它也單純就是更少摩擦。更少摩擦意味著你真的會去寫那個更長、更好的 prompt,而不是因為覺得手打完整版太費勁而打出一句懶散的單行。語音聽寫讓好 prompt 成為最省事的 prompt。
選擇你的轉寫模型和語言
桌面版的語音聽寫讓你在設定裡選擇語音轉文字模型和口述語言。
轉寫模型(桌面版)
- GPT-4o Transcribe(預設,多語言品質最佳)
- GPT-4o mini Transcribe(幾乎同樣準確,更便宜)
- OpenAI Whisper,whisper-1(按分鐘簡單計費,多語言基線紮實)
口述語言
- 自動檢測(預設,模型會識別語言)
- English, Français, Español, Deutsch, Italiano, Português, Nederlands
- Русский, Українська, 中文, 日本語, 한국어
- العربية, हिन्दी, Bahasa Indonesia, Polski, Türkçe, ไทย, Tiếng Việt
自動檢測是預設設定,適用於大多數情況。當短錄音被錯誤檢測時,可以強制指定語言,但只能強制你實際在說的語言。支援十九種語言和自動檢測,因此你可以用自己的語言口述,代理獲得乾淨的文字。
語音聽寫在底層究竟做了什麼
在桌面版,composer 用瀏覽器的 MediaRecorder API 錄下你的聲音,並把音訊傳送到 AgentsRoom 的轉寫後端。轉寫在服務端用你選的模型執行,所以繁重的語音轉文字工作不依賴你的機器,轉寫結果以純文字返回並插入到你的游標處。麥克風、錄音和插入都屬於你本來就在打字的同一個 composer。
在行動版,語音聽寫有意採用不同的方式。配套 app 使用本地語音識別,所以音訊永遠不會離開你的手機。識別出的文字隨後透過 AgentsRoom 端到端加密連線被中繼到桌面版,落進你在 Mac 上聚焦的那個代理的輸入框。按住麥克風按鈕,說話,鬆手,文字就出現在你的桌面代理裡。
兩端共享同一條規則:語音聽寫絕不自行傳送。在桌面版,轉寫落進草稿供你檢查。在行動版,文字被貼上進聚焦的代理輸入框,且不帶回車,所以仍由你自己按 Enter。口述是寫 prompt 的方式,不是盲發它的方式。
配置與 provider 無關。轉寫模型 id 對應的是語音轉文字後端,而非你的代理 CLI。無論你的代理是 Claude Code、Codex、Antigravity CLI、OpenCode、Aider、Grok Build、Mistral Vibe 還是 Kimi Code,口述出的文字在 composer 裡都只是文字,所以語音聽寫在 AgentsRoom 支援的每一個 provider 上表現完全一致。
語音聽寫在哪裡可用
內建於桌面 composer 和移動配套應用中,支援十九種語言。
桌面 composer
macOS 上代理 composer 裡的一個麥克風按鈕。在 GPT-4o Transcribe、GPT-4o mini Transcribe 或 Whisper 上做服務端轉寫。錄音時有實時語音聲波,轉寫插入到游標處,可與手打自由混合。在設定裡選你的模型和語言。
移動配套 app
在 iOS 和 Android 配套 app 上,按住麥克風即可口述。語音識別在本地執行,音訊留在手機上,識別出的文字以端到端加密中繼到聚焦的桌面代理。這是從口袋裡餵給代理最快的方式。
多語言
十九種口語語言加上自動檢測:英語,法語,西班牙語,德語,義大利語,葡萄牙語,荷蘭語,俄語,烏克蘭語,中文,日語,韓語,阿拉伯語,印地語,印度尼西亞語,波蘭語,土耳其語,泰語和越南語。用你的母語口述,代理接收到乾淨的轉寫文字。
手打 prompt 對比口述 prompt
同一個代理,同一個任務。速度不同,上下文不同,token 賬單也不同。
每個 prompt 都手打
- : 你打字的速度只是說話速度的一小部分,所以 prompt 總是很短。
- : 短 prompt 省略了上下文,於是代理靠猜,你再去糾正它。
- : 每一次糾正都是又一次往返,更多的輸入和輸出 token。
- : 單獨的聽寫 app 或系統聽寫意味著要在視窗之間複製貼上。
- : 在手機上,移動鍵盤讓長 prompt 變得痛苦,於是你幾乎不怎麼寫 prompt 了。
用語音聽寫來口述
- : 你幾秒就說完整個 prompt,自然就說得更多。
- : 更多前置上下文意味著代理更接近一次就把任務做對。
- : 更少的澄清往返意味著達到同樣結果花更少的 token。
- : 麥克風就在 composer 裡,轉寫落進草稿,無需複製貼上。
- : 在手機上,按住麥克風,文字就透過加密中繼出現在你的桌面代理裡。
語音聽寫是同時讓每個 prompt 更長、更精確、寫起來更快的最便宜方式。
一個口述出來的 prompt 聽起來是什麼樣
這些你都不用手打。你把它說出來,語音轉文字就把它變成下面這個 prompt,然後你按 Enter。試著手打一個這麼詳細的 prompt,感受一下要花多長時間。
對著麥克風說出來
給登入 endpoint 加一個限流器。
使用滑動視窗,每個 IP 每分鐘五次嘗試。
觸達上限時返回 429,並帶上 Retry-After header。
保持現有的成功路徑不變。
加一個單元測試覆蓋觸達上限的情況,再加一個覆蓋一分鐘後重置的情況。
不要動註冊 endpoint。FAQ
AgentsRoom 裡的語音聽寫是什麼?
語音聽寫是代理 composer 裡的一個麥克風按鈕,把你的語音轉成文字。你點麥克風,說出你的 prompt,轉寫好的文字就插入到草稿的游標處。這是為向 AI 程式設計代理寫 prompt 而內建的語音轉文字,無需單獨的聽寫 app,也不用在視窗之間複製貼上。
為什麼要口述 prompt 而不是手打?
速度、精確和 token 經濟。你說話比打字快好幾倍,所以 prompt 花幾秒而不是幾分鐘。因為口述幾乎不費力,你自然會說得更多,從而讓 prompt 更精確。精確的 prompt 意味著與代理更少的澄清往返,也就意味著達到同樣結果花更少的 token。
我可以用哪些轉寫模型?
在桌面版,你可以在設定裡從三個語音轉文字模型中選擇:GPT-4o Transcribe(預設,多語言品質最佳)、GPT-4o mini Transcribe(幾乎同樣準確且更便宜),以及 OpenAI Whisper,即 whisper-1 模型,按分鐘簡單計費,多語言基線紮實。
這不就是 OpenAI Whisper 嗎?
Whisper 是你可以選的模型之一,它直接內建在 composer 裡,而不是作為旁邊單獨的 app 執行。你也可以選 GPT-4o Transcribe 或 GPT-4o mini Transcribe。AgentsRoom 語音聽寫的要點在於,口述直接對準代理的 prompt 輸入框,所以你不必在一個視窗口述再複製貼上到另一個視窗。
語音聽寫支援哪些語言?
十九種口語語言加上自動檢測:英語,法語,西班牙語,德語,義大利語,葡萄牙語,荷蘭語,俄語,烏克蘭語,中文,日語,韓語,阿拉伯語,印地語,印度尼西亞語,波蘭語,土耳其語,泰語和越南語。自動檢測是預設設定。你可以在設定中強制指定語言,當短錄音被錯誤檢測時。
我的聲音會被髮到伺服器嗎?
這取決於在哪一端。在桌面版,音訊會被髮送到 AgentsRoom 轉寫後端,由它用你選的模型執行語音轉文字並返回文字。在行動版,語音識別在本地執行,所以音訊永遠不會離開你的手機,只有識別出的文字透過端到端加密連線被中繼到桌面版。
口述完之後 prompt 會自動傳送嗎?
不會。語音聽寫總是把文字落進草稿,絕不替你傳送。你讀轉寫,改掉偶爾聽錯的詞,需要的話用鍵盤新增或調整順序,準備好了再按 Enter。代理究竟收到什麼,始終由你掌控。
我能在同一個 prompt 裡混用手打和口述嗎?
可以。轉寫插入到你的游標處,而不是替換整份草稿。所以你可以先打前半段,在中間口述一個長段落,再打最後一行。語音聽寫是更快填滿 composer 的方式,與鍵盤完全相容。
我能從手機口述給 Mac 上的代理嗎?
可以。移動配套 app 有一個麥克風按鈕:按住它,說話,鬆手。語音在本地被識別,文字以端到端加密中繼到你在桌面版聚焦的那個代理。這是不用移動鍵盤就把 prompt 餵給 Mac 代理最快的方式。
語音聽寫能配合 Claude Code、Codex 和 Antigravity 用嗎?
可以,全都能,還有 OpenCode、Aider、Grok Build、Mistral Vibe 和 Kimi Code。口述出的文字在 composer 裡只是文字,而轉寫配置與 provider 無關,所以無論你執行的是哪個代理 CLI,語音聽寫的表現都完全一致。
搭配使用更好
Scratchpad
footer 裡一個更大的 prompt 編輯器。口述一段長簡報,在 scratchpad 裡打磨它,然後發給你的代理。
Prompt 庫
把你口述的 prompt 存成可複用的模板。語音寫出第一稿,prompt 庫把好的留下來。
行動版與桌面版同步
把你口述的文字從手機送到 Mac 上聚焦代理的端到端加密鏈路。
遠端代理控制
從手機駕駛你的桌面代理。離開鍵盤時,口述是給它們發 prompt 最快的方式。
多 provider
把 Claude、Codex、Antigravity、OpenCode、Aider、Grok Build、Mistral Vibe 和 Kimi Code 並排執行。語音聽寫在它們每一個上的表現都一樣。
Sketch
在 composer 裡畫圖和標註。把口述的 prompt 配上一張速寫,同時給代理文字和影象。
對你的代理說話,別再手打 prompt
下載 AgentsRoom,把 prompt 直介面述進 composer。寫起來更快,上下文更豐富,token 更省。把語音聽寫內建進你的 AI 程式設計 IDE,桌面版和行動版都能用。
配套應用:隨時隨地監控你的 Agent
使用 Claude、Codex、Antigravity CLI 或其他 AI 提供商。
把 Bug 和需求直接傳送到您的公開待辦清單。
AgentsRoom 實際執行一瞥。