การพิมพ์เสียง: สั่งการข้อความ, agent ของคุณเขียนโค้ด

หยุดพิมพ์ข้อความ.
สั่งการมัน.

การพิมพ์เสียงอยู่ใน agent composer คลิกไมโครโฟน พูดข้อความของคุณ และข้อความที่ถอดเสียงจะปรากฏในร่างที่เคอร์เซอร์ของคุณ การเปลี่ยนเสียงเป็นข้อความสำหรับ AI coding agents ของคุณ โดยไม่ต้องมีแอปการพิมพ์เสียงแยกต่างหากและไม่มีการคัดลอก-วางระหว่างหน้าต่าง

การพิมพ์ข้อความยาวและแม่นยำใช้เวลาหลาย นาที การสั่งการข้อความเดียวกันใช้เวลาไม่กี่วินาที บริบทเพิ่มเติมให้กับ agent ของคุณ การเดินทางเพื่อขอคำชี้แจงน้อยลง โทเคนน้อยลง มูลค่าได้ย้ายจากโค้ดไปยังข้อความ และการพิมพ์เสียงคือวิธีที่เร็วที่สุดในการเขียนข้อความที่ดี

การพิมพ์เสียงในทางปฏิบัติ: คลิกไมโครโฟน พูดข้อความ ดูคลื่นเสียงสด และข้อความถอดเสียงจะลงใน composer พร้อมสำหรับการแก้ไขและส่ง

นี่คือการเปลี่ยนแปลงที่การพิมพ์เสียงตอบสนองต่อ ส่วนที่ยากของการทำงานกับ AI coding agent ไม่ใช่การเขียนโค้ดอีกต่อไป agent ทำสิ่งนั้น ส่วนที่ยากคือการเขียนข้อความ: การอธิบายสิ่งที่คุณต้องการ ข้อจำกัด กรณีขอบ ไฟล์ที่ต้องสัมผัส พฤติกรรมที่ต้องหลีกเลี่ยง ข้อความที่แม่นยำคือความแตกต่างระหว่างการยิงครั้งเดียวและการเดินทางที่น่าผิดหวังสิบครั้ง และข้อความที่แม่นยำยาว ซึ่งทำให้พิมพ์ช้า

การพิมพ์เสียงช่วยลดภาษีการพิมพ์ คุณคลิกปุ่มไมโครโฟนใน composer คุณพูดทุกอย่างที่คุณจะพิมพ์ บ่อยกว่าที่คุณจะพิมพ์ และการถอดเสียงเสียงจะปรากฏในร่าง คุณพูดที่ 150 คำต่อนาที คุณไม่พิมพ์ที่ 150 คำต่อนาที การสั่งการเร็วกว่าจริงๆ และช่องทางที่เร็วขึ้นหมายความว่าคุณให้บริบทเพิ่มเติมกับ agent ของคุณต่อแต่ละงาน

นี่ไม่ใช่การเสริมเพิ่มเติม ไมโครโฟนเป็นส่วนหนึ่งของ AgentsRoom composer อยู่ถัดจากห้องสมุดข้อความและเครื่องมือสเก็ตช์ ข้อความที่ถอดเสียงจะถูกแทรกที่เคอร์เซอร์ของคุณ ดังนั้นคุณสามารถผสมผสานการพิมพ์และการสั่งการในร่างเดียวกัน ไม่มีอะไรถูกส่งโดยอัตโนมัติ: ข้อความจะลงในร่าง คุณอ่านมัน แก้ไขคำเดียวที่โมเดลได้ยินผิด และกด Enter เมื่อคุณพร้อม การพิมพ์เสียงที่นี่เป็นเครื่องมือช่วยการเขียน ไม่ใช่ระบบอัตโนมัติ

การพิมพ์เสียงใน AgentsRoom composer: ปุ่มไมโครโฟนบันทึกเสียงของผู้ใช้และข้อความถอดเสียงจะถูกแทรกลงในร่างข้อความของ agent พร้อมกับตัวแสดงคลื่นเสียงสด

ปุ่มไมโครโฟนอยู่ในแถบเครื่องมือ composer ขณะบันทึก คลื่นเสียงสดจะแสดงระดับการป้อนข้อมูล จากนั้นข้อความที่ถอดเสียงจะปรากฏในร่าง

ทำไมต้องสั่งการข้อความของคุณแทนที่จะพิมพ์

ความเร็ว คุณพูดได้เร็วหลายเท่าที่คุณพิมพ์ และคุณไม่สูญเสียแนวคิดของคุณในการค้นหาปุ่ม ข้อความสองย่อหน้าที่ใช้เวลาสามนาทีในการพิมพ์คือการสั่งการเสียงที่ใช้เวลาเพียงสามสิบวินาที ตลอดทั้งวันในการสั่งการให้ agent ของคุณ เวลานั้นสะสมเป็นชั่วโมงจริงๆ

ความแม่นยำ เนื่องจากการสั่งการมีค่าใช้จ่ายต่ำ คุณจึงพูดมากขึ้น คุณอธิบายกรณีขอบที่คุณจะข้ามไป ไฟล์ที่คุณจะไม่ตั้งชื่อ พฤติกรรมที่คุณต้องการหลีกเลี่ยง ข้อความที่มีความหลากหลายคือข้อความที่แม่นยำมากขึ้น และข้อความที่แม่นยำมากขึ้นคือสิ่งที่ทำให้ AI coding agent ทำงานได้ในครั้งแรก

เศรษฐกิจโทเคน ทุกการเดินทางเพื่อขอคำชี้แจงกับ agent มีค่าใช้จ่ายโทเคน: agent ถาม คุณตอบ มันอ่านบริบทอีกครั้ง ข้อความที่ถูกสั่งการอย่างแม่นยำล่วงหน้าช่วยลดการเดินทางเหล่านั้น การเดินทางไปกลับที่น้อยลงหมายถึงการใช้โทเคนน้อยลงในการไปถึงผลลัพธ์เดียวกัน ซึ่งเป็นการประหยัดโดยตรงในค่าใช้จ่าย AI coding ของคุณ

ไม่ต้องใช้มือและมือถือ บนเดสก์ท็อปคุณสามารถเก็บมือของคุณให้ว่างในขณะที่ agent ทำงานและสั่งการข้อความถัดไปออกเสียง บนโทรศัพท์ การพิมพ์เสียงเป็นวิธีที่เร็วที่สุดในการป้อนข้อมูลให้ agent โดยไม่ต้องต่อสู้กับคีย์บอร์ดมือถือ พูดไอเดีย มันจะลงใน agent ของคุณบน Mac

การทำงานของการพิมพ์เสียง

คลิกไมโครโฟน พูด ตรวจสอบ ส่ง สี่ขั้นตอน ไม่มีแอปแยก ไม่มีการคัดลอก-วาง

01

คลิกไมโครโฟนใน composer

วางเคอร์เซอร์ของคุณใน agent composer และคลิกปุ่มไมโครโฟนในแถบเครื่องมือ ครั้งแรก macOS จะขออนุญาตไมโครโฟน AgentsRoom จะส่งคำขอนั้นไปยังระบบเพื่อให้คุณอนุญาตเพียงครั้งเดียว

02

พูดข้อความของคุณ

ปุ่มจะเปลี่ยนเป็นการบันทึก: สถานะที่เต้นเป็นจังหวะพร้อมคลื่นเสียงสดที่แสดงระดับการป้อนข้อมูลของคุณในเวลาจริง ดังนั้นคุณจึงรู้ว่าไมโครโฟนกำลังจับเสียงจริงๆ พูดทุกอย่างที่คุณต้องการให้ agent ของคุณรู้ในภาษาของคุณเอง

03

หยุด และมันจะถอดเสียง

คลิกอีกครั้งเพื่อหยุด เสียงจะถูกส่งไปยังโมเดลการถอดความที่คุณเลือก (GPT-4o Transcribe โดยค่าเริ่มต้น, GPT-4o mini Transcribe, หรือ OpenAI Whisper) ปุ่มจะแสดงสถานะการถอดความในขณะที่การแปลงเสียงเป็นข้อความกำลังทำงานอยู่

04

การถอดความจะไปถึงเคอร์เซอร์ของคุณ

ข้อความที่ถอดความจะถูกแทรกลงในร่างที่ตำแหน่งเคอร์เซอร์ โดยมีช่องว่างแยกเมื่อจำเป็น ตำแหน่งเคอร์เซอร์ของคุณจะถูกกู้คืน ดังนั้นคุณสามารถพิมพ์ต่อหรือบอกข้อความอีกส่วนได้ การพิมพ์และการบอกสามารถผสมกันได้อย่างอิสระในคำสั่งเดียว

05

ตรวจสอบและแก้ไข

ยังไม่มีอะไรถูกส่ง คำสั่งนั่งอยู่ในร่าง อ่านมัน แก้ไขคำที่โมเดลได้ยินผิด เพิ่มบรรทัดด้วยแป้นพิมพ์ หรือจัดเรียงประโยคใหม่ คุณยังคงควบคุมสิ่งที่ตัวแทนของคุณได้รับอย่างเต็มที่

06

ส่งเมื่อพร้อม

กด Enter เพื่อส่งคำสั่งไปยังตัวแทนของคุณ เหมือนกับข้อความที่พิมพ์ จากมุมมองของตัวแทน มันเป็นเพียงข้อความ ดังนั้นการบอกเสียงจึงทำงานเหมือนกันกับ Claude Code, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe และ Kimi Code

คำสั่งที่เร็วขึ้น ใช้โทเคนที่น้อยลง

ทำไมการบอกคำสั่งที่ดีกว่าล่วงหน้าถึงถูกกว่าเมื่อพิมพ์คำสั่งที่บางและทำซ้ำ

คำสั่งที่บางนั้นมีค่าใช้จ่ายสูงในลักษณะที่ไม่แสดงบนเวลา ตัวแทนไม่มีข้อมูลเพียงพอในการทำงาน ดังนั้นมันจึงเดา คุณแก้ไข มันอ่านบริบททั้งหมดใหม่ คุณแก้ไขอีกครั้ง ทุกครั้งที่ทำเช่นนี้คือโทเคนที่นำเข้า โทเคนที่ส่งออก และการอ่านแคช สามรอบการเดินทางเพื่อชี้แจงฟีเจอร์อาจมีค่าใช้จ่ายมากกว่าฟีเจอร์เอง

การบอกเสียงเปลี่ยนเศรษฐศาสตร์ เพราะการพูดนั้นรวดเร็ว คุณจึงโหลดบริบทล่วงหน้า: ข้อกำหนด เส้นทางไฟล์ พฤติกรรมที่ต้องหลีกเลี่ยง ตัวอย่างที่คุณมีในใจ ตัวแทนจะเข้าใจได้ถูกต้องใกล้เคียงกับครั้งแรก คุณแลกเปลี่ยนการบอกเสียงสามสิบวินาทีเพื่อหลีกเลี่ยงสองหรือสามรอบการชี้แจง

สิ่งนี้สะสม วันปกติคือคำสั่งหลายสิบคำ หากการบอกเสียงช่วยประหยัดรอบการเดินทางหนึ่งในคำสั่งที่ดีจำนวนมาก การประหยัดโทเคนจะสะสมตลอดทั้งวัน ตลอดทั้งทีม ตลอดทั้งเดือน โทเคนที่ถูกที่สุดคือโทเคนที่คุณไม่ต้องใช้ในการอธิบายตัวเองซ้ำ

มันยังหมายถึงการมีแรงเสียดทานน้อยลง แรงเสียดทานน้อยลงหมายความว่าคุณสามารถเขียนคำสั่งที่ยาวขึ้นและดีกว่าแทนที่จะเป็นบรรทัดเดียวที่ขี้เกียจที่คุณจะพิมพ์เพราะการพิมพ์เวอร์ชันเต็มรู้สึกเหมือนเป็นงานมากเกินไป การบอกเสียงทำให้คำสั่งที่ดีเป็นคำสั่งที่ง่าย

เลือกโมเดลการถอดความและภาษา

การบอกเสียงบนเดสก์ท็อปให้คุณเลือกโมเดลการแปลงเสียงเป็นข้อความและภาษาที่พูดในการตั้งค่า

โมเดลการถอดความ (เดสก์ท็อป)

  • GPT-4o Transcribe (ค่าเริ่มต้น, คุณภาพหลายภาษาที่ดีที่สุด)
  • GPT-4o mini Transcribe (เกือบจะแม่นยำ, ราคาถูกกว่า)
  • OpenAI Whisper, whisper-1 (การกำหนดราคาแบบง่ายต่อหนึ่งนาที, ฐานหลายภาษาที่มั่นคง)

ภาษาที่พูด

  • ตรวจจับอัตโนมัติ (ค่าเริ่มต้น, โมเดลจะระบุภาษาที่ใช้)
  • อังกฤษ, Français, Español, Deutsch, Italiano, Português
  • Русский, 中文, 日本語, 한국어
  • العربية, हिन्दी, Bahasa Indonesia, Polski, Türkçe, Tiếng Việt

การตรวจจับอัตโนมัติเป็นค่าเริ่มต้นและจัดการกรณีส่วนใหญ่ บังคับให้ใช้ภาษาที่เฉพาะเจาะจงเมื่อการบันทึกสั้น ๆ ถูกตรวจจับผิด แต่ให้บังคับเฉพาะภาษาที่คุณพูดจริง ๆ สิบหกภาษาและการตรวจจับอัตโนมัติ ดังนั้นคุณจึงสามารถบอกในคำของคุณเองและตัวแทนของคุณจะได้รับข้อความที่ชัดเจน

สิ่งที่การบอกเสียงทำจริง ๆ ภายใต้ผิว

บนเดสก์ท็อป คอมโพเซอร์จะบันทึกเสียงของคุณด้วย API MediaRecorder ของเบราว์เซอร์และโพสต์เสียงไปยังแบ็กเอนด์การถอดความของ AgentsRoom การถอดความทำงานที่ฝั่งเซิร์ฟเวอร์บนโมเดลที่คุณเลือก ดังนั้นการทำงานหนักในการแปลงเสียงเป็นข้อความจึงไม่ขึ้นอยู่กับเครื่องของคุณ และการถอดความจะกลับมาเป็นข้อความธรรมดาที่แทรกที่เคอร์เซอร์ของคุณ ไมโครโฟน การบันทึก และการแทรกทั้งหมดเป็นส่วนหนึ่งของคอมโพเซอร์เดียวกันที่คุณพิมพ์อยู่แล้ว

บนมือถือ การบอกเสียงทำงานแตกต่างกันโดยตั้งใจ แอปคู่หูใช้การรู้จำเสียงบนอุปกรณ์ ดังนั้นเสียงจะไม่ออกจากโทรศัพท์ของคุณ ข้อความที่รู้จำได้จะถูกส่งไปยังเดสก์ท็อปผ่านการเชื่อมต่อที่เข้ารหัสแบบ end-to-end ของ AgentsRoom และถูกวางลงในอินพุตของตัวแทนที่คุณมุ่งเน้นบน Mac กดปุ่มไมโครโฟน พูด ปล่อย และข้อความจะปรากฏในตัวแทนเดสก์ท็อปของคุณ

ทั้งสองพื้นผิวมีหนึ่งกฎ: การบอกเสียงจะไม่ส่งด้วยตัวเอง บนเดสก์ท็อป การถอดความจะไปถึงร่างเพื่อการตรวจสอบ บนมือถือ ข้อความจะถูกวางลงในอินพุตของตัวแทนที่มุ่งเน้นโดยไม่มีการขึ้นบรรทัดใหม่ ดังนั้นคุณยังต้องกด Enter เอง การบอกเสียงเป็นวิธีการเขียนคำสั่ง ไม่ใช่วิธีการส่งโดยไม่มอง

การกำหนดค่ามีความเป็นกลางต่อผู้ให้บริการ รหัสโมเดลการถอดความจะเชื่อมโยงกับแบ็กเอนด์การแปลงเสียงเป็นข้อความ ไม่ใช่กับ CLI ของตัวแทนของคุณ ไม่ว่าตัวแทนของคุณจะเป็น Claude Code, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe หรือ Kimi Code ข้อความที่บอกจะเป็นเพียงข้อความในคอมโพเซอร์ ดังนั้นการบอกเสียงจึงทำงานเหมือนกันกับผู้ให้บริการทุกคนที่ AgentsRoom สนับสนุน

ที่ซึ่งการถอดเสียงด้วยเสียงทำงาน

สร้างขึ้นในคอมโพสเซอร์เดสก์ท็อปและคู่มือมือถือ รองรับสิบหกภาษา

คอมโพสเซอร์เดสก์ท็อป

ปุ่มไมโครโฟนในคอมโพสเซอร์ของเอเจนต์บน macOS การถอดเสียงฝั่งเซิร์ฟเวอร์บน GPT-4o Transcribe, GPT-4o mini Transcribe หรือ Whisper คลื่นเสียงสดขณะบันทึก ข้อความถอดเสียงจะแทรกที่เคอร์เซอร์ สามารถผสมกับการพิมพ์ได้อย่างอิสระ เลือกรูปแบบและภาษาของคุณในการตั้งค่า

คู่มือมือถือ

บนคู่มือ iOS และ Android ให้กดไมโครโฟนเพื่อถอดเสียง การรู้จำเสียงทำงานบนอุปกรณ์ ดังนั้นเสียงจะอยู่บนโทรศัพท์ และข้อความที่รู้จำได้จะถูกส่งแบบเข้ารหัสจากจุดหนึ่งไปยังอีกจุดหนึ่งไปยังเอเจนต์เดสก์ท็อปที่โฟกัส วิธีที่เร็วที่สุดในการป้อนข้อมูลให้กับเอเจนต์จากกระเป๋าของคุณ

หลายภาษา

สิบหกภาษาที่พูดได้พร้อมการตรวจจับอัตโนมัติ: อังกฤษ, ฝรั่งเศส, สเปน, เยอรมัน, อิตาลี, โปรตุเกส, รัสเซีย, จีน, ญี่ปุ่น, เกาหลี, อาหรับ, ฮินดี, อินโดนีเซีย, โปแลนด์, ตุรกี และเวียดนาม ถอดเสียงในภาษาของคุณ เอเจนต์ของคุณจะได้รับข้อความที่ถอดเสียงอย่างชัดเจน

การพิมพ์คำสั่งเทียบกับการถอดเสียงคำสั่ง

เอเจนต์เดียวกัน งานเดียวกัน ความเร็วต่างกัน บริบทต่างกัน ค่าใช้จ่ายโทเคนต่างกัน

การพิมพ์ทุกคำสั่ง

  • : คุณพิมพ์ในความเร็วที่ต่ำกว่าที่คุณพูด ดังนั้นคำสั่งจึงสั้นลง
  • : คำสั่งสั้นข้ามบริบท ดังนั้นเอเจนต์จึงเดาและคุณต้องแก้ไขมัน
  • : การแก้ไขแต่ละครั้งคือการเดินทางรอบใหม่ ค่าใช้จ่ายโทเคนในการป้อนข้อมูลและส่งออกมากขึ้น
  • : แอปถอดเสียงแยกต่างหากหรือการถอดเสียงระบบหมายถึงการคัดลอกและวางระหว่างหน้าต่าง
  • : บนโทรศัพท์ คีย์บอร์ดมือถือทำให้คำสั่งยาวเจ็บปวด ดังนั้นคุณแทบจะไม่ตั้งคำสั่งเลย

การถอดเสียงด้วยการถอดเสียงด้วยเสียง

  • : คุณพูดคำสั่งทั้งหมดในไม่กี่วินาที ดังนั้นคุณจึงพูดได้มากขึ้นตามธรรมชาติ
  • : บริบทที่มากขึ้นในตอนแรกหมายความว่าเอเจนต์ทำงานได้ใกล้เคียงกับการลองครั้งแรก
  • : การเดินทางรอบการชี้แจงที่น้อยลงหมายถึงการใช้โทเคนที่น้อยลงสำหรับผลลัพธ์เดียวกัน
  • : ไมโครโฟนอยู่ในคอมโพสเซอร์ ข้อความถอดเสียงจะไปอยู่ในร่าง ไม่มีการคัดลอกและวาง
  • : บนโทรศัพท์ ให้กดไมโครโฟนและข้อความจะปรากฏในเอเจนต์เดสก์ท็อปของคุณผ่านการส่งข้อมูลที่เข้ารหัส

การถอดเสียงด้วยเสียงเป็นวิธีที่ถูกที่สุดในการทำให้ทุกคำสั่งยาวขึ้น แม่นยำขึ้น และเขียนได้เร็วขึ้นในเวลาเดียวกัน

เสียงของคำสั่งที่ถอดเสียง

คุณไม่ต้องเขียนสิ่งนี้เลย คุณพูดออกมาดัง ๆ การแปลงเสียงเป็นข้อความจะเปลี่ยนมันเป็นคำสั่งด้านล่าง และคุณกด Enter ลองพูดคำสั่งที่ละเอียดขนาดนี้โดยการพิมพ์มันและรู้สึกว่ามันใช้เวลานานแค่ไหน

พูดลงไมโครโฟน

เพิ่มตัวจำกัดอัตราที่จุดสิ้นสุดการเข้าสู่ระบบ
ใช้หน้าต่างเลื่อนของห้าความพยายามต่อนาทีต่อต่อ IP
ส่งกลับ 429 พร้อมส่วนหัว Retry-After เมื่อถึงขีดจำกัด
เก็บเส้นทางความสำเร็จที่มีอยู่ไว้ไม่เปลี่ยนแปลง
เพิ่มการทดสอบหน่วยสำหรับการถึงขีดจำกัดและอีกหนึ่งสำหรับการรีเซ็ตหลังจากหนึ่งนาที
อย่าทำอะไรกับจุดสิ้นสุดการลงทะเบียน
ไม่มีการส่งอัตโนมัติ
การถอดเสียงด้วยเสียงเขียนลงในร่าง ไม่เคยส่ง คุณจะอ่านข้อความถอดเสียง แก้ไขมัน และกด Enter เอง การถอดเสียงคือคีย์บอร์ดที่เร็วขึ้น ไม่ใช่ระบบอัตโนมัติ
บนอุปกรณ์มือถือ
บนโทรศัพท์ การรู้จำเสียงทำงานบนอุปกรณ์ : เสียงจะไม่ออกจากอุปกรณ์ของคุณ ข้อความที่รู้จำได้จะถูกส่งไปยัง Mac ของคุณผ่านการส่งสัญญาณที่เข้ารหัสแบบ end-to-end ของ AgentsRoom
ทำงานร่วมกับทุกตัวแทน
ข้อความที่บันทึกเสียงเป็นเพียงข้อความในผู้สร้าง ดังนั้นการบันทึกเสียงจึงทำงานเหมือนกันกับ Claude Code, Codex, Antigravity CLI, OpenCode, Aider, Grok Build, Mistral Vibe และ Kimi Code ออกแบบมาให้เป็นกลางต่อผู้ให้บริการ

FAQ

การบันทึกเสียงใน AgentsRoom คืออะไร ?

การบันทึกเสียงคือปุ่มไมโครโฟนในผู้สร้างตัวแทนที่เปลี่ยนคำพูดของคุณเป็นข้อความ คุณคลิกที่ไมค์ พูดคำสั่งของคุณ และข้อความที่ถอดความจะถูกแทรกลงในร่างที่เคอร์เซอร์ของคุณ มันคือการแปลงเสียงเป็นข้อความในตัวสำหรับการเขียนคำสั่งให้กับตัวแทนการเขียนโค้ด AI ของคุณ โดยไม่ต้องใช้แอปการบันทึกเสียงแยกต่างหากและไม่มีการคัดลอกและวางระหว่างหน้าต่าง

ทำไมฉันถึงควรบันทึกคำสั่งแทนที่จะพิมพ์ ?

ความเร็ว ความแม่นยำ และเศรษฐกิจของโทเค็น คุณพูดได้เร็วกว่าเมื่อพิมพ์หลายเท่า ดังนั้นคำสั่งใช้เวลาเพียงไม่กี่วินาทีแทนที่จะเป็นนาที เนื่องจากการบันทึกเสียงมีค่าใช้จ่ายต่ำ คุณจึงพูดมากขึ้นตามธรรมชาติ ซึ่งทำให้คำสั่งมีความแม่นยำมากขึ้น คำสั่งที่แม่นยำหมายถึงการเดินทางกลับไปกลับมาที่ชัดเจนน้อยลงกับตัวแทน ซึ่งหมายถึงการใช้โทเค็นน้อยลงในการไปถึงผลลัพธ์เดียวกัน

ฉันสามารถใช้โมเดลการถอดความใดได้บ้าง ?

บนเดสก์ท็อปคุณเลือกจากสามโมเดลการแปลงเสียงเป็นข้อความในการตั้งค่า : GPT-4o Transcribe (ค่าเริ่มต้น คุณภาพหลายภาษาเยี่ยม), GPT-4o mini Transcribe (เกือบจะแม่นยำและราคาถูกกว่า), และ OpenAI Whisper โมเดล whisper-1 ที่มีการตั้งราคาแบบง่ายต่อการนับต่อหนึ่งนาทีและฐานหลายภาษาที่มั่นคง

นี่คือ OpenAI Whisper ใช่ไหม ?

Whisper เป็นหนึ่งในโมเดลที่คุณสามารถเลือกได้ ซึ่งสร้างขึ้นโดยตรงในผู้สร้างแทนที่จะทำงานเป็นแอปแยกต่างหาก คุณยังสามารถเลือก GPT-4o Transcribe หรือ GPT-4o mini Transcribe จุดประสงค์ของการบันทึกเสียงใน AgentsRoom คือการที่การบันทึกจะมุ่งเป้าไปที่การป้อนคำสั่งของตัวแทนของคุณโดยตรง ดังนั้นคุณจึงไม่ต้องบันทึกในหน้าต่างหนึ่งแล้วคัดลอกและวางในอีกหน้าต่างหนึ่ง

การบันทึกเสียงรองรับภาษาใดบ้าง ?

สิบหกภาษาที่พูดได้บวกกับการตรวจจับอัตโนมัติ : อังกฤษ, ฝรั่งเศส, สเปน, เยอรมัน, อิตาลี, โปรตุเกส, รัสเซีย, จีน, ญี่ปุ่น, เกาหลี, อาหรับ, ฮินดี, อินโดนีเซีย, โปแลนด์, ตุรกี และเวียดนาม การตรวจจับอัตโนมัติเป็นค่าเริ่มต้น คุณสามารถบังคับให้ใช้ภาษาที่เฉพาะเจาะจงในการตั้งค่าเมื่อการบันทึกสั้น ๆ ถูกตรวจจับผิด

เสียงของฉันถูกส่งไปยังเซิร์ฟเวอร์หรือไม่ ?

ขึ้นอยู่กับพื้นผิว บนเดสก์ท็อป เสียงจะถูกส่งไปยังแบ็กเอนด์การถอดความของ AgentsRoom ซึ่งทำการแปลงเสียงเป็นข้อความตามโมเดลที่คุณเลือกและส่งกลับข้อความ ในมือถือ การรู้จำเสียงทำงานบนอุปกรณ์ ดังนั้นเสียงจะไม่ออกจากโทรศัพท์ของคุณและมีเพียงข้อความที่รู้จำได้เท่านั้นที่ถูกส่งไปยังเดสก์ท็อปผ่านการเชื่อมต่อที่เข้ารหัสแบบ end-to-end

ข้อความจะถูกส่งโดยอัตโนมัติหลังจากที่ฉันบันทึกหรือไม่ ?

ไม่ การบันทึกเสียงจะส่งข้อความไปยังร่างเสมอ ไม่เคยส่ง การอ่านถอดความ แก้ไขคำที่ได้ยินผิดอย่างหายาก เพิ่มหรือลำดับใหม่ด้วยแป้นพิมพ์หากคุณต้องการ และกด Enter เมื่อคุณพร้อม คุณจะควบคุมสิ่งที่ตัวแทนของคุณได้รับอย่างแม่นยำ

ฉันสามารถผสมการพิมพ์และการบันทึกในคำสั่งเดียวกันได้หรือไม่ ?

ใช่ ถอดความจะถูกแทรกที่เคอร์เซอร์ของคุณ ไม่ใช่แทนที่ทั้งร่าง ดังนั้นคุณสามารถพิมพ์ครึ่งแรก บันทึกย่อยาวในกลาง แล้วพิมพ์บรรทัดสุดท้าย การบันทึกเสียงเป็นวิธีที่เร็วกว่าในการเติมผู้สร้าง ซึ่งเข้ากันได้อย่างสมบูรณ์กับแป้นพิมพ์

ฉันสามารถบันทึกจากโทรศัพท์ไปยังตัวแทนบน Mac ของฉันได้หรือไม่ ?

ใช่ แอปคู่มือมือถือมีปุ่มไมโครโฟน : กดค้างไว้ พูด ปล่อย เสียงจะถูกตรวจจับบนอุปกรณ์และข้อความจะถูกส่งผ่านการเข้ารหัสแบบ end-to-end ไปยังตัวแทนที่คุณมุ่งเน้นบนเดสก์ท็อป นี่คือวิธีที่เร็วที่สุดในการส่งคำสั่งไปยังตัวแทน Mac ของคุณโดยไม่ต้องใช้แป้นพิมพ์มือถือ

การบันทึกเสียงทำงานร่วมกับ Claude Code, Codex และ Antigravity หรือไม่ ?

ใช่ กับทั้งหมด รวมถึง OpenCode, Aider, Grok Build, Mistral Vibe และ Kimi Code ข้อความที่บันทึกเสียงเป็นเพียงข้อความในผู้สร้าง และการกำหนดค่าการถอดความเป็นกลางต่อผู้ให้บริการ ดังนั้นการบันทึกเสียงจึงทำงานเหมือนกันไม่ว่าคุณจะใช้ตัวแทน CLI ใด

เข้ากันได้ดีด้วย

Scratchpad

โปรแกรมแก้ไขคำสั่งที่ใหญ่ขึ้นในส่วนท้าย บันทึกย่อยาว ปรับปรุงใน scratchpad แล้วส่งไปยังตัวแทนของคุณ

Prompt Library

บันทึกคำสั่งที่คุณบันทึกเสียงเป็นแม่แบบที่นำกลับมาใช้ใหม่ได้ การบันทึกเสียงเขียนร่างแรก ห้องสมุดเก็บของดี ๆ ไว้

Mobile-Desktop Sync

ลิงก์ที่เข้ารหัสแบบ end-to-end ที่ส่งข้อความที่คุณบันทึกจากโทรศัพท์ไปยังตัวแทนที่คุณมุ่งเน้นบน Mac ของคุณ

การควบคุมตัวแทนระยะไกล

ควบคุมตัวแทนบนเดสก์ท็อปของคุณจากโทรศัพท์ของคุณ การพูดเป็นวิธีที่เร็วที่สุดในการส่งคำสั่งให้พวกเขาในขณะที่คุณอยู่ห่างจากแป้นพิมพ์

ผู้ให้บริการหลายราย

เรียกใช้ Claude, Codex, Antigravity, OpenCode, Aider, Grok Build, Mistral Vibe และ Kimi Code ข้างกัน การพูดด้วยเสียงทำงานเหมือนกันในทุกตัว

สเก็ตช์

วาดและทำเครื่องหมายในคอมโพเซอร์ จับคู่คำสั่งที่พูดกับสเก็ตช์ด่วนเพื่อให้ตัวแทนของคุณมีทั้งคำและภาพ

พูดคุยกับตัวแทนของคุณ หยุดพิมพ์คำสั่ง

ดาวน์โหลด AgentsRoom และพูดคำสั่งของคุณตรงเข้าสู่คอมโพเซอร์ เขียนได้เร็วขึ้น มีบริบทมากขึ้น และใช้โทเคนเบาลง การพูดด้วยเสียงที่สร้างขึ้นใน IDE การเขียนโค้ด AI ของคุณ ทั้งบนเดสก์ท็อปและมือถือ

ฟรีดาวน์โหลด AgentsRoom

แอปคู่หู: ตรวจสอบตัวแทนของคุณได้ทุกที่

นำของคุณเอง: Claude, Codex, Antigravity CLI, หรือผู้ให้บริการ AI อื่น ๆ

รับส่วนขยาย
Chrome Web Store

ส่งข้อบกพร่องและคำขอไปยังแบ็คล็อกสาธารณะของคุณโดยตรง

มองเห็น AgentsRoom ในการทำงาน

หลายโปรเจกต์
ผู้ให้บริการหลายราย
หลาย agents
สถานะสด
ไฟล์ diff & commit
คู่หูมือถือ
ตัวอย่างสด
ทีมตัวแทน
การทำงานอัตโนมัติในเบราว์เซอร์
การพัฒนาที่ขับเคลื่อนด้วย backlog
ห้องสมุดคำสั่ง
ห้องสมุดทักษะ
ดูฟีเจอร์ทั้งหมด