Голосове введення: диктуйте підказки, ваш агент кодує

Припиніть набирати підказки.
Диктуйте їх.

Голосове введення знаходиться прямо в композиторі агента. Натисніть на мікрофон, скажіть вашу підказку, і транскрибований текст з'явиться в чернетці на вашому курсорі. Перетворення мови в текст для ваших AI-кодувальних агентів, без окремого додатку для диктування та без копіювання-вставки між вікнами.

Набір довгої, точної підказки займає хвилини. Диктування тієї ж підказки займає секунди. Більше контексту для вашого агента, менше уточнюючих зворотних зв'язків, менше витрачених токенів. Цінність перемістилася з коду до підказки, і голосове введення - найшвидший спосіб написати хорошу.

Голосове введення в дії: натисніть на мікрофон, скажіть підказку, спостерігайте за живою хвильовою формою, і транскрипція мови в текст потрапляє в композитор, готова до редагування та відправки.

Ось зміна, на яку відповідає голосове введення. Складна частина роботи з AI-кодувальним агентом більше не полягає в написанні коду, агент це робить. Складна частина - це написання підказки: опис того, що ви хочете, обмежень, крайових випадків, файлу, який потрібно торкнутися, поведінки, якої слід уникати. Точна підказка - це різниця між одним пострілом і десятьма розчаровуючими зворотними зв'язками. І точна підказка довга, що робить її повільною для набору.

Голосове введення усуває податок на набір. Ви натискаєте кнопку мікрофона в композиторі, говорите все, що б ви набрали, часто більше, ніж ви б потрудилися набрати, і транскрипція мови в текст з'являється в чернетці. Ви говорите зі швидкістю 150 слів на хвилину, ви не набираєте зі швидкістю 150 слів на хвилину. Диктування просто швидше, а швидший канал означає, що ви надаєте вашому агенту більше контексту на завдання.

Це не додаток. Мікрофон є частиною композитора AgentsRoom, поруч з бібліотекою підказок та інструментами для ескізів. Транскрипція вставляється на ваш курсор, тому ви можете змішувати набір і диктування в одній чернетці. Нічого не відправляється автоматично: текст потрапляє в чернетку, ви його читаєте, виправляєте одне слово, яке модель неправильно почула, і натискаєте Enter, коли готові. Голосове введення тут - це допомога у написанні, а не автопілот.

Голосове введення в композиторі AgentsRoom: кнопка мікрофона записує голос користувача, а транскрипція мови в текст вставляється в чернетку підказки агента з візуалізатором живої голосової хвильової форми

Кнопка мікрофона знаходиться на панелі інструментів композитора. Під час запису жива голосова хвильова форма показує рівень вхідного сигналу, потім транскрибована підказка з'являється в чернетці.

Чому диктувати ваші підказки замість набору тексту

Швидкість. Ви говорите в кілька разів швидше, ніж набираєте, і не втрачаєте хід думок, шукаючи клавіші. Двопараграфна підказка, яка зайняла б три хвилини для набору, є тридцятисекундним голосовим введенням. Протягом цілого дня підказок вашим агентам цей час додається до реальних годин назад.

Точність. Оскільки диктування дешеве, ви говорите більше. Ви описуєте крайовий випадок, який би пропустили, файл, який би не назвали, поведінку, якої хочете уникнути. Багатша підказка - це точніша підказка, а точніша підказка - це саме те, що дозволяє AI-кодувальному агенту виконати завдання з першої спроби.

Економія токенів. Кожен уточнюючий зворотний зв'язок з агентом коштує токенів: агент запитує, ви відповідаєте, він перечитує контекст. Точна продиктована підказка з самого початку скорочує ці зворотні зв'язки. Менше зворотних зв'язків означає менше витрачених токенів для досягнення того ж результату, що є прямою економією на вашому рахунку AI-кодування.

Без рук і мобільність. На робочому столі ви тримаєте руки вільними, поки агент працює, і диктуєте наступну підказку вголос. На телефоні голосове введення - це найшвидший спосіб подати агенту без боротьби з мобільною клавіатурою. Скажіть ідею, вона потрапляє у вашого агента на Mac.

Як працює голосове введення

Натисніть на мікрофон, говоріть, перевірте, відправте. Чотири кроки, без окремого додатку, без копіювання-вставки.

01

Натисніть на мікрофон у композиторі

Розмістіть курсор у композиторі агента і натисніть кнопку мікрофона на панелі інструментів. Вперше macOS запитує дозвіл на використання мікрофона, AgentsRoom направляє цей запит до системи, щоб ви надали його один раз.

02

Говоріть вашу підказку

Кнопка переключається на запис: пульсуючий стан з живою голосовою хвильовою формою, яка показує рівень вашого вхідного сигналу в реальному часі, щоб ви знали, що мікрофон дійсно захоплює аудіо. Скажіть все, що ви хочете, щоб ваш агент знав, вашою мовою.

03

Зупиніться, і воно транскрибує

Натисніть ще раз, щоб зупинити. Аудіо відправляється до моделі транскрипції, яку ви обрали (за замовчуванням GPT-4o Transcribe, GPT-4o mini Transcribe або OpenAI Whisper). Кнопка показує стан транскрибування, поки працює перетворення мови в текст.

04

Транскрипт з'являється на вашому курсорі

Транскрибований текст вставляється в чернетку на місці каретки, з розділовим пробілом, якщо це необхідно. Позиція курсора відновлюється, щоб ви могли продовжувати друкувати або диктувати інший фрагмент. Друк і диктування вільно змішуються в одному запиті.

05

Перегляньте та відредагуйте

Нічого ще не відправлено. Запит знаходиться в чернетці. Прочитайте його, виправте рідкісне слово, яке модель неправильно почула, додайте рядок за допомогою клавіатури, змініть порядок речень. Ви повністю контролюєте, що ваш агент фактично отримує.

06

Відправте, коли будете готові

Натисніть Enter, щоб відправити запит вашому агенту, точно так само, як і надруковане повідомлення. З точки зору агента це просто текст, тому голосове диктування працює так само з Claude Code, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe та Kimi Code.

Швидші запити, менше токенів

Чому диктування кращого запиту з самого початку дешевше, ніж друкування тонкого ітераційного.

Тонкий запит дорогий у спосіб, який не відображається на годиннику. Агенту недостатньо інформації, тому він вгадує, ви виправляєте, він перечитує весь контекст, ви знову виправляєте. Кожен з цих кроків - це вхідні токени, вихідні токени та читання кешу. Три раунди для уточнення функції можуть коштувати більше, ніж сама функція.

Голосове диктування змінює економіку. Оскільки говорити швидко, ви завантажуєте контекст наперед: обмеження, шляхи до файлів, поведінку, якої слід уникати, приклад, який ви маєте на увазі. Агент розуміє це ближче до першої спроби. Ви обмінюєте тридцятисекундне диктування на два або три уникнуті цикли уточнення.

Це накопичується. Звичайний день - це десятки запитів. Якщо голосове диктування економить один раунд на добрій частині з них, економія токенів накопичується протягом дня, команди, місяця. Найдешевший токен - це той, який ви ніколи не витратили на повторне пояснення.

Це також просто менше тертя. Менше тертя означає, що ви насправді пишете довший, кращий запит замість ледачого однорядкового, який ви б надрукували, тому що друкування повної версії здавалося занадто важкою роботою. Голосове диктування робить хороший запит легким запитом.

Виберіть свою модель транскрипції та мову

Голосове диктування на робочому столі дозволяє вибрати модель перетворення мови в текст та розмовну мову в налаштуваннях.

Моделі транскрипції (робочий стіл)

  • GPT-4o Transcribe (за замовчуванням, найкраща багатомовна якість)
  • GPT-4o mini Transcribe (майже така ж точність, дешевше)
  • OpenAI Whisper, whisper-1 (проста погодинна ціна, надійна багатомовна база)

Розмовні мови

  • Автовизначення (за замовчуванням, модель визначає мову)
  • English, Français, Español, Deutsch, Italiano, Português, Nederlands
  • Русский, Українська, 中文, 日本語, 한국어
  • العربية, हिन्दी, Bahasa Indonesia, Polski, Türkçe, ไทย, Tiếng Việt

Автовизначення є за замовчуванням і обробляє більшість випадків. Примусьте конкретну мову, коли короткі записи неправильно визначаються, але примусьте лише ту мову, якою ви насправді говорите. Дев'ятнадцять мов плюс автовизначення, тому ви диктуєте своїми словами, а ваш агент отримує чистий текст.

Що насправді робить голосове диктування під капотом

На робочому столі композитор записує ваш голос за допомогою API MediaRecorder браузера і відправляє аудіо на бекенд транскрипції AgentsRoom. Транскрипція виконується на сервері на обраній вами моделі, тому важка робота з перетворення мови в текст не залежить від вашої машини, і транскрипт повертається як простий текст, вставлений на місці каретки. Мікрофон, запис і вставка є частинами того ж композитора, в якому ви вже друкуєте.

На мобільних пристроях голосове диктування працює інакше навмисно. Супутній додаток використовує розпізнавання мови на пристрої, тому аудіо ніколи не залишає ваш телефон. Розпізнаний текст потім передається на робочий стіл через зашифроване з'єднання AgentsRoom і вставляється у вхід агента, на якому ви зосереджені на Mac. Утримуйте кнопку мікрофона, говоріть, відпустіть, і текст з'явиться у вашому агенті на робочому столі.

Обидві поверхні дотримуються одного правила: голосове диктування ніколи не відправляє самостійно. На робочому столі транскрипт потрапляє в чернетку для перегляду. На мобільному текст вставляється у вхід сфокусованого агента без переносу рядка, тому ви все ще натискаєте Enter самостійно. Диктування - це спосіб написати запит, а не спосіб відправити його всліпу.

Конфігурація нейтральна до постачальника. Ідентифікатори моделі транскрипції відповідають бекенду перетворення мови в текст, а не вашому агенту CLI. Незалежно від того, чи ваш агент Claude Code, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe або Kimi Code, продиктований текст - це просто текст у композиторі, тому голосове диктування поводиться однаково у всіх постачальників, які підтримує AgentsRoom.

Де працює голосове введення

Вбудовано в настільний композитор і мобільний додаток, на дев'ятнадцяти мовах.

Настільний композитор

Кнопка мікрофона в композиторі агента на macOS. Серверна транскрипція на GPT-4o Transcribe, GPT-4o mini Transcribe або Whisper. Живий звуковий сигнал під час запису, транскрипт вставляється в курсор, можна вільно змішувати з набором тексту. Виберіть свою модель і мову в налаштуваннях.

Мобільний додаток

На iOS і Android додатку, утримуйте мікрофон для диктування. Розпізнавання мови працює на пристрої, тому аудіо залишається на телефоні, а розпізнаний текст передається з кінця в кінець зашифрованим до настільного агента. Найшвидший спосіб передати агенту з вашої кишені.

Багатомовний

Дев'ятнадцять розмовних мов плюс автоматичне визначення: англійська, французька, іспанська, німецька, італійська, португальська, нідерландська, російська, українська, китайська, японська, корейська, арабська, хінді, індонезійська, польська, турецька, тайська та в'єтнамська. Диктуйте рідною мовою, ваш агент отримує чистий транскрибований текст.

Набір підказок проти їх диктування

Той самий агент, те саме завдання. Різна швидкість, різний контекст, різна вартість токенів.

Набір кожної підказки

  • : Ви набираєте текст зі швидкістю, яка є часткою швидкості вашої мови, тому підказки залишаються короткими.
  • : Короткі підказки пропускають контекст, тому агент здогадується, а ви його виправляєте.
  • : Кожне виправлення: це ще одна поїздка туди й назад, більше вхідних і вихідних токенів.
  • : Окремий додаток для диктування або системне диктування означає копіювання-вставку між вікнами.
  • : На телефоні мобільна клавіатура робить довгі підказки болючими, тому ви майже не вводите підказки.

Диктування з голосовим введенням

  • : Ви говорите повну підказку за секунди, тому природно говорите більше.
  • : Більше контексту на початку означає, що агент виконує завдання ближче до першої спроби.
  • : Менше поїздок для уточнення означає менше витрачених токенів на той самий результат.
  • : Мікрофон у композиторі, транскрипт потрапляє в чернетку, без копіювання-вставки.
  • : На телефоні утримуйте мікрофон, і текст з'явиться у вашому настільному агенті через зашифрований релей.

Голосове введення: це найдешевший спосіб зробити кожну підказку довшою, точнішою і швидшою для написання одночасно.

Як звучить продиктована підказка

Вам не потрібно писати жодного з цього. Ви говорите це вголос, перетворення мови в текст перетворює це в підказку нижче, і ви натискаєте Enter. Спробуйте сказати таку детальну підказку, набираючи її, і відчуйте, скільки часу це займає.

Продиктовано в мікрофон

Додайте обмежувач швидкості до кінцевої точки входу.
Використовуйте ковзне вікно з п'ятьма спробами на хвилину на IP.
Поверніть 429 з заголовком Retry-After, коли досягнуто межі.
Залиште існуючий шлях успіху недоторканим.
Додайте модульний тест для досягнення межі та один для її скидання через хвилину.
Не чіпайте кінцеву точку реєстрації.
Нічого не відправляється автоматично
Голосове введення пише в чернетку, ніколи не відправляє. Ви завжди читаєте транскрипт, редагуєте його і натискаєте Enter самостійно. Диктування: це швидша клавіатура, а не автопілот.
На пристрої на мобільному
На телефоні розпізнавання мови працює на пристрої: аудіо ніколи не залишає ваш пристрій. Розпізнаний текст передається на ваш Mac через наскрізно зашифрований ретранслятор AgentsRoom.
Працює з кожним агентом
Диктований текст: це просто текст у композиторі, тому голосове диктування працює однаково з Claude Code, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe і Kimi Code. Нейтральний до постачальника за дизайном.

FAQ

Що таке голосове диктування в AgentsRoom?

Голосове диктування: це кнопка мікрофона в композиторі агента, яка перетворює вашу мову в текст. Ви натискаєте на мікрофон, говорите свій запит, і транскрибований текст вставляється в чернетку на вашому курсорі. Це вбудоване перетворення мови в текст для написання запитів до ваших AI агентів кодування, без окремого додатку для диктування і без копіювання-вставки між вікнами.

Чому я повинен диктувати запити замість того, щоб їх набирати?

Швидкість, точність і економія токенів. Ви говорите в кілька разів швидше, ніж набираєте, тому запити займають секунди замість хвилин. Оскільки диктування дешеве, ви природно говорите більше, що робить запит більш точним. Точний запит означає менше уточнюючих зворотних зв'язків з агентом, що означає менше витрачених токенів для досягнення того ж результату.

Які моделі транскрипції я можу використовувати?

На робочому столі ви обираєте з трьох моделей перетворення мови в текст у налаштуваннях: GPT-4o Transcribe (за замовчуванням, найкраща багатомовна якість), GPT-4o mini Transcribe (майже така ж точна і дешевша) і OpenAI Whisper, модель whisper-1 з простою погодинною ціною і надійною багатомовною базою.

Це просто OpenAI Whisper?

Whisper: це одна з моделей, яку ви можете обрати, вбудована безпосередньо в композитор, а не працює як окремий додаток збоку. Ви також можете обрати GPT-4o Transcribe або GPT-4o mini Transcribe. Суть голосового диктування в AgentsRoom полягає в тому, що диктування безпосередньо націлене на введення запиту вашого агента, тому ви не диктуєте в одне вікно і не копіюєте-вставляєте в інше.

Які мови підтримує голосове диктування?

Дев'ятнадцять розмовних мов плюс автоматичне визначення: англійська, французька, іспанська, німецька, італійська, португальська, нідерландська, російська, українська, китайська, японська, корейська, арабська, хінді, індонезійська, польська, турецька, тайська і в'єтнамська. Автоматичне визначення за замовчуванням. Ви можете примусово обрати конкретну мову в налаштуваннях, коли короткі записи неправильно визначаються.

Чи відправляється мій голос на сервер?

Це залежить від платформи. На робочому столі аудіо відправляється на бекенд транскрипції AgentsRoom, який виконує перетворення мови в текст на обраній вами моделі і повертає текст. На мобільному пристрої розпізнавання мови працює на пристрої, тому аудіо ніколи не залишає ваш телефон, і лише розпізнаний текст передається на робочий стіл через наскрізно зашифроване з'єднання.

Чи відправляється запит автоматично після диктування?

Ні. Голосове диктування завжди розміщує текст у чернетці, ніколи не відправляє. Ви читаєте транскрипт, виправляєте рідкісні неправильно почуті слова, додаєте або змінюєте порядок за допомогою клавіатури, якщо хочете, і натискаєте Enter, коли готові. Ви контролюєте, що саме отримує ваш агент.

Чи можу я змішувати набір тексту і диктування в одному запиті?

Так. Транскрипт вставляється на вашому курсорі, а не замість всієї чернетки. Тому ви можете набрати першу половину, продиктувати довгий абзац посередині, а потім набрати фінальну лінію. Голосове диктування: це швидший спосіб заповнити композитор, повністю сумісний з клавіатурою.

Чи можу я диктувати з телефону агенту на моєму Mac?

Так. Мобільний додаток-компаньйон має кнопку мікрофона: утримуйте її, говоріть, відпустіть. Мова розпізнається на пристрої, і текст передається наскрізно зашифрованим способом агенту, на якому ви зосереджені на робочому столі. Це найшвидший спосіб передати запит вашому агенту на Mac без використання мобільної клавіатури.

Чи працює голосове диктування з Claude Code, Codex і Antigravity?

Так, з усіма ними, а також з OpenCode, Aider, Grok Build, Mistral Vibe і Kimi Code. Диктований текст: це просто текст у композиторі, і конфігурація транскрипції нейтральна до постачальника, тому голосове диктування поводиться однаково, незалежно від того, який агент CLI ви використовуєте.

Добре поєднується з

Чернетка

Більший редактор запитів у нижньому колонтитулі. Продиктуйте довгий бриф, вдоскональте його в чернетці, а потім відправте його своєму агенту.

Бібліотека запитів

Збережіть запити, які ви диктуєте, як шаблони для повторного використання. Голос пише перший чернетку, бібліотека зберігає хороші.

Синхронізація мобільного і робочого столу

Наскрізно зашифроване посилання, яке переносить ваш продиктований текст з телефону до зосередженого агента на вашому Mac.

Віддалене керування агентами

Керуйте своїми агентами на робочому столі з телефону. Диктування: це найшвидший спосіб надіслати їм підказку, коли ви далеко від клавіатури.

Багатопровайдерність

Запускайте Claude, Codex, Antigravity, OpenCode, Aider, Grok Build, Mistral Vibe та Kimi Code поруч. Голосове диктування працює однаково у всіх них.

Ескіз

Малюйте та робіть анотації в композиторі. Поєднайте продиктовану підказку з швидким ескізом, щоб дати вашому агенту і слова, і зображення.

Говоріть зі своїми агентами, припиніть вводити підказки

Завантажте AgentsRoom і диктуйте свої підказки прямо в композитор. Швидше писати, багатше на контекст, менше витрат на токени. Голосове диктування вбудоване у ваш IDE для AI-кодування, на робочому столі та на мобільному пристрої.

БезкоштовноЗавантажити AgentsRoom

Додаток-компаньйон: контролюйте своїх агентів на ходу

Використовуйте свого: Claude, Codex, Antigravity CLI або іншого AI-провайдера.

Отримати розширення
Chrome Web Store

Надсилайте баги та запити прямо у свій публічний беклог.

Погляд на AgentsRoom в дії.

Кілька проектів
Багато постачальників
Кілька агентів
Статус в реальному часі
Різниця файлів і коміт
Мобільний компаньйон
Попередній перегляд в реальному часі
Команди агентів
Автоматизація браузера
Розробка, орієнтована на беклог
Бібліотека підказок
Бібліотека навичок
Переглянути всі функції