หยุดพิมพ์ข้อความ.
สั่งการมัน.
การพิมพ์เสียงอยู่ใน agent composer คลิกไมโครโฟน พูดข้อความของคุณ และข้อความที่ถอดเสียงจะปรากฏในร่างที่เคอร์เซอร์ของคุณ การเปลี่ยนเสียงเป็นข้อความสำหรับ AI coding agents ของคุณ โดยไม่ต้องมีแอปการพิมพ์เสียงแยกต่างหากและไม่มีการคัดลอก-วางระหว่างหน้าต่าง
การพิมพ์ข้อความยาวและแม่นยำใช้เวลาหลาย นาที การสั่งการข้อความเดียวกันใช้เวลาไม่กี่วินาที บริบทเพิ่มเติมให้กับ agent ของคุณ การเดินทางเพื่อขอคำชี้แจงน้อยลง โทเคนน้อยลง มูลค่าได้ย้ายจากโค้ดไปยังข้อความ และการพิมพ์เสียงคือวิธีที่เร็วที่สุดในการเขียนข้อความที่ดี
การพิมพ์เสียงในทางปฏิบัติ: คลิกไมโครโฟน พูดข้อความ ดูคลื่นเสียงสด และข้อความถอดเสียงจะลงใน composer พร้อมสำหรับการแก้ไขและส่ง
นี่คือการเปลี่ยนแปลงที่การพิมพ์เสียงตอบสนองต่อ ส่วนที่ยากของการทำงานกับ AI coding agent ไม่ใช่การเขียนโค้ดอีกต่อไป agent ทำสิ่งนั้น ส่วนที่ยากคือการเขียนข้อความ: การอธิบายสิ่งที่คุณต้องการ ข้อจำกัด กรณีขอบ ไฟล์ที่ต้องสัมผัส พฤติกรรมที่ต้องหลีกเลี่ยง ข้อความที่แม่นยำคือความแตกต่างระหว่างการยิงครั้งเดียวและการเดินทางที่น่าผิดหวังสิบครั้ง และข้อความที่แม่นยำยาว ซึ่งทำให้พิมพ์ช้า
การพิมพ์เสียงช่วยลดภาษีการพิมพ์ คุณคลิกปุ่มไมโครโฟนใน composer คุณพูดทุกอย่างที่คุณจะพิมพ์ บ่อยกว่าที่คุณจะพิมพ์ และการถอดเสียงเสียงจะปรากฏในร่าง คุณพูดที่ 150 คำต่อนาที คุณไม่พิมพ์ที่ 150 คำต่อนาที การสั่งการเร็วกว่าจริงๆ และช่องทางที่เร็วขึ้นหมายความว่าคุณให้บริบทเพิ่มเติมกับ agent ของคุณต่อแต่ละงาน
นี่ไม่ใช่การเสริมเพิ่มเติม ไมโครโฟนเป็นส่วนหนึ่งของ AgentsRoom composer อยู่ถัดจากห้องสมุดข้อความและเครื่องมือสเก็ตช์ ข้อความที่ถอดเสียงจะถูกแทรกที่เคอร์เซอร์ของคุณ ดังนั้นคุณสามารถผสมผสานการพิมพ์และการสั่งการในร่างเดียวกัน ไม่มีอะไรถูกส่งโดยอัตโนมัติ: ข้อความจะลงในร่าง คุณอ่านมัน แก้ไขคำเดียวที่โมเดลได้ยินผิด และกด Enter เมื่อคุณพร้อม การพิมพ์เสียงที่นี่เป็นเครื่องมือช่วยการเขียน ไม่ใช่ระบบอัตโนมัติ

ปุ่มไมโครโฟนอยู่ในแถบเครื่องมือ composer ขณะบันทึก คลื่นเสียงสดจะแสดงระดับการป้อนข้อมูล จากนั้นข้อความที่ถอดเสียงจะปรากฏในร่าง
ทำไมต้องสั่งการข้อความของคุณแทนที่จะพิมพ์
ความเร็ว คุณพูดได้เร็วหลายเท่าที่คุณพิมพ์ และคุณไม่สูญเสียแนวคิดของคุณในการค้นหาปุ่ม ข้อความสองย่อหน้าที่ใช้เวลาสามนาทีในการพิมพ์คือการสั่งการเสียงที่ใช้เวลาเพียงสามสิบวินาที ตลอดทั้งวันในการสั่งการให้ agent ของคุณ เวลานั้นสะสมเป็นชั่วโมงจริงๆ
ความแม่นยำ เนื่องจากการสั่งการมีค่าใช้จ่ายต่ำ คุณจึงพูดมากขึ้น คุณอธิบายกรณีขอบที่คุณจะข้ามไป ไฟล์ที่คุณจะไม่ตั้งชื่อ พฤติกรรมที่คุณต้องการหลีกเลี่ยง ข้อความที่มีความหลากหลายคือข้อความที่แม่นยำมากขึ้น และข้อความที่แม่นยำมากขึ้นคือสิ่งที่ทำให้ AI coding agent ทำงานได้ในครั้งแรก
เศรษฐกิจโทเคน ทุกการเดินทางเพื่อขอคำชี้แจงกับ agent มีค่าใช้จ่ายโทเคน: agent ถาม คุณตอบ มันอ่านบริบทอีกครั้ง ข้อความที่ถูกสั่งการอย่างแม่นยำล่วงหน้าช่วยลดการเดินทางเหล่านั้น การเดินทางไปกลับที่น้อยลงหมายถึงการใช้โทเคนน้อยลงในการไปถึงผลลัพธ์เดียวกัน ซึ่งเป็นการประหยัดโดยตรงในค่าใช้จ่าย AI coding ของคุณ
ไม่ต้องใช้มือและมือถือ บนเดสก์ท็อปคุณสามารถเก็บมือของคุณให้ว่างในขณะที่ agent ทำงานและสั่งการข้อความถัดไปออกเสียง บนโทรศัพท์ การพิมพ์เสียงเป็นวิธีที่เร็วที่สุดในการป้อนข้อมูลให้ agent โดยไม่ต้องต่อสู้กับคีย์บอร์ดมือถือ พูดไอเดีย มันจะลงใน agent ของคุณบนเดสก์ท็อป
การทำงานของการพิมพ์เสียง
คลิกไมโครโฟน พูด ตรวจสอบ ส่ง สี่ขั้นตอน ไม่มีแอปแยก ไม่มีการคัดลอก-วาง
คลิกไมโครโฟนใน composer
วางเคอร์เซอร์ของคุณใน agent composer และคลิกปุ่มไมโครโฟนในแถบเครื่องมือ ครั้งแรก macOS จะขออนุญาตไมโครโฟน AgentsRoom จะส่งคำขอนั้นไปยังระบบเพื่อให้คุณอนุญาตเพียงครั้งเดียว
พูดข้อความของคุณ
ปุ่มจะเปลี่ยนเป็นการบันทึก: สถานะที่เต้นเป็นจังหวะพร้อมคลื่นเสียงสดที่แสดงระดับการป้อนข้อมูลของคุณในเวลาจริง ดังนั้นคุณจึงรู้ว่าไมโครโฟนกำลังจับเสียงจริงๆ พูดทุกอย่างที่คุณต้องการให้ agent ของคุณรู้ในภาษาของคุณเอง
หยุด และมันจะถอดเสียง
คลิกอีกครั้งเพื่อหยุด เสียงจะถูกส่งไปถอดความ และปุ่มจะแสดงสถานะการถอดความในขณะที่การแปลงเสียงเป็นข้อความกำลังทำงานอยู่ คุณไม่ต้องเลือกโมเดล: AgentsRoom ใช้โมเดลค่าเริ่มต้นที่แม่นยำกับคลิปปกติ และสลับไปใช้โมเดลที่ทนต่อการวนซ้ำเมื่อบันทึกเกินเก้าสิบวินาที ซึ่งเป็นจุดที่โมเดลแม่นยำเริ่มพูดซ้ำกับเสียงที่ยาวหรือมีเสียงรบกวน
การถอดความจะไปถึงเคอร์เซอร์ของคุณ
ข้อความที่ถอดความจะถูกแทรกลงในร่างที่ตำแหน่งเคอร์เซอร์ โดยมีช่องว่างแยกเมื่อจำเป็น ตำแหน่งเคอร์เซอร์ของคุณจะถูกกู้คืน ดังนั้นคุณสามารถพิมพ์ต่อหรือบอกข้อความอีกส่วนได้ การพิมพ์และการบอกสามารถผสมกันได้อย่างอิสระในคำสั่งเดียว
ตรวจสอบและแก้ไข
ยังไม่มีอะไรถูกส่ง คำสั่งนั่งอยู่ในร่าง อ่านมัน แก้ไขคำที่โมเดลได้ยินผิด เพิ่มบรรทัดด้วยแป้นพิมพ์ หรือจัดเรียงประโยคใหม่ คุณยังคงควบคุมสิ่งที่เอเจนต์ของคุณได้รับอย่างเต็มที่
ส่งเมื่อพร้อม
กด Enter เพื่อส่งคำสั่งไปยังเอเจนต์ของคุณ เหมือนกับข้อความที่พิมพ์ จากมุมมองของเอเจนต์ มันเป็นเพียงข้อความ ดังนั้นการบอกเสียงจึงทำงานเหมือนกันกับ Claude, Codex, GitHub Copilot CLI, Cursor และ CLI ของเอเจนต์อีก 10 ตัว
คำสั่งที่เร็วขึ้น ใช้โทเคนที่น้อยลง
ทำไมการบอกคำสั่งที่ดีกว่าล่วงหน้าถึงถูกกว่าเมื่อพิมพ์คำสั่งที่บางและทำซ้ำ
คำสั่งที่บางนั้นมีค่าใช้จ่ายสูงในลักษณะที่ไม่แสดงบนเวลา เอเจนต์ไม่มีข้อมูลเพียงพอในการทำงาน ดังนั้นมันจึงเดา คุณแก้ไข มันอ่านบริบททั้งหมดใหม่ คุณแก้ไขอีกครั้ง ทุกครั้งที่ทำเช่นนี้คือโทเคนที่นำเข้า โทเคนที่ส่งออก และการอ่านแคช สามรอบการเดินทางเพื่อชี้แจงฟีเจอร์อาจมีค่าใช้จ่ายมากกว่าฟีเจอร์เอง
การบอกเสียงเปลี่ยนเศรษฐศาสตร์ เพราะการพูดนั้นรวดเร็ว คุณจึงโหลดบริบทล่วงหน้า: ข้อกำหนด เส้นทางไฟล์ พฤติกรรมที่ต้องหลีกเลี่ยง ตัวอย่างที่คุณมีในใจ เอเจนต์จะเข้าใจได้ถูกต้องใกล้เคียงกับครั้งแรก คุณแลกเปลี่ยนการบอกเสียงสามสิบวินาทีเพื่อหลีกเลี่ยงสองหรือสามรอบการชี้แจง
สิ่งนี้สะสม วันปกติคือคำสั่งหลายสิบคำ หากการบอกเสียงช่วยประหยัดรอบการเดินทางหนึ่งในคำสั่งที่ดีจำนวนมาก การประหยัดโทเคนจะสะสมตลอดทั้งวัน ตลอดทั้งทีม ตลอดทั้งเดือน โทเคนที่ถูกที่สุดคือโทเคนที่คุณไม่ต้องใช้ในการอธิบายตัวเองซ้ำ
มันยังหมายถึงการมีแรงเสียดทานน้อยลง แรงเสียดทานน้อยลงหมายความว่าคุณสามารถเขียนคำสั่งที่ยาวขึ้นและดีกว่าแทนที่จะเป็นบรรทัดเดียวที่ขี้เกียจที่คุณจะพิมพ์เพราะการพิมพ์เวอร์ชันเต็มรู้สึกเหมือนเป็นงานมากเกินไป การบอกเสียงทำให้คำสั่งที่ดีเป็นคำสั่งที่ง่าย
เลือกภาษาที่คุณพูด
การบอกเสียงบนเดสก์ท็อปให้คุณตั้งภาษาที่พูดในการตั้งค่า โมเดลการถอดความไม่ใช่การตั้งค่า: มันถูกเลือกจากความยาวของการบันทึกของคุณ
โมเดลถูกเลือกอย่างไร (เดสก์ท็อป)
- คลิปสั้น ไม่เกินเก้าสิบวินาที: โมเดลค่าเริ่มต้นที่แม่นยำ
- การบันทึกที่ยาวกว่านั้น: โมเดลที่ทนต่อการวนซ้ำ ซึ่งจะไม่พูดซ้ำกับเสียงที่ยาวหรือมีเสียงรบกวน
- โหมดออฟไลน์ ถ้าคุณเปิดใช้งาน: โมเดลในเครื่องของคุณเอง ไม่ใช้เครือข่ายและไม่ใช้เครดิต
ภาษาที่พูด
- ตรวจจับอัตโนมัติ (ค่าเริ่มต้น, โมเดลจะระบุภาษา)
- English, Français, Español, Deutsch, Italiano, Português, Nederlands
- Русский, Українська, 中文, 日本語, 한국어
- العربية, हिन्दी, Bahasa Indonesia, Polski, Türkçe, ไทย, Tiếng Việt
การตรวจจับอัตโนมัติเป็นค่าเริ่มต้นและจัดการกรณีส่วนใหญ่ บังคับใช้ภาษาที่เฉพาะเจาะจงเมื่อการบันทึกสั้น ๆ ถูกตรวจจับผิด แต่บังคับใช้เฉพาะภาษาที่คุณพูดจริง ๆ รองรับ 19 ภาษาและการตรวจจับอัตโนมัติ ดังนั้นคุณสามารถสั่งการในคำพูดของคุณเองและ agent ของคุณจะได้รับข้อความที่ชัดเจน
สิ่งที่การบอกเสียงทำจริง ๆ ภายใต้ผิว
บนเดสก์ท็อป คอมโพเซอร์จะบันทึกเสียงของคุณด้วย API MediaRecorder ของเบราว์เซอร์และโพสต์เสียงไปยังแบ็กเอนด์การถอดความของ AgentsRoom การถอดความทำงานที่ฝั่งเซิร์ฟเวอร์ ดังนั้นการทำงานหนักในการแปลงเสียงเป็นข้อความจึงไม่ขึ้นอยู่กับเครื่องของคุณ และการถอดความจะกลับมาเป็นข้อความธรรมดาที่แทรกที่เคอร์เซอร์ของคุณ ไมโครโฟน การบันทึก และการแทรกทั้งหมดเป็นส่วนหนึ่งของคอมโพเซอร์เดียวกันที่คุณพิมพ์อยู่แล้ว
บนมือถือ การบอกเสียงทำงานแตกต่างกันโดยตั้งใจ แอปคู่หูใช้การรู้จำเสียงบนอุปกรณ์ ดังนั้นเสียงจะไม่ออกจากโทรศัพท์ของคุณ ข้อความที่รู้จำได้จะถูกส่งไปยังเดสก์ท็อปผ่านการเชื่อมต่อที่เข้ารหัสแบบ end-to-end ของ AgentsRoom และถูกวางลงในอินพุตของเอเจนต์ที่คุณมุ่งเน้นบนเดสก์ท็อป กดปุ่มไมโครโฟน พูด ปล่อย และข้อความจะปรากฏในเอเจนต์เดสก์ท็อปของคุณ
ทั้งสองพื้นผิวมีหนึ่งกฎ: การบอกเสียงจะไม่ส่งด้วยตัวเอง บนเดสก์ท็อป การถอดความจะไปถึงร่างเพื่อการตรวจสอบ บนมือถือ ข้อความจะถูกวางลงในอินพุตของเอเจนต์ที่มุ่งเน้นโดยไม่มีการขึ้นบรรทัดใหม่ ดังนั้นคุณยังต้องกด Enter เอง การบอกเสียงเป็นวิธีการเขียนคำสั่ง ไม่ใช่วิธีการส่งโดยไม่มอง
การกำหนดค่ามีความเป็นกลางต่อผู้ให้บริการ การถอดความทำงานบนแบ็กเอนด์การแปลงเสียงเป็นข้อความ ไม่ใช่บน CLI ของเอเจนต์ของคุณ ไม่ว่าเอเจนต์ของคุณจะเป็น Claude, Codex, GitHub Copilot CLI, Cursor หรือ CLI ของเอเจนต์อีก 10 ตัวที่ AgentsRoom รองรับ ข้อความที่บอกจะเป็นเพียงข้อความในคอมโพเซอร์ ดังนั้นการบอกเสียงจึงทำงานเหมือนกันกับผู้ให้บริการทุกคนที่ AgentsRoom สนับสนุน
ที่ซึ่งการถอดเสียงด้วยเสียงทำงาน
รวมอยู่ใน desktop composer และ mobile companion รองรับ 19 ภาษา
คอมโพสเซอร์เดสก์ท็อป
ปุ่มไมโครโฟนในคอมโพสเซอร์ของเอเจนต์ บน macOS, Windows และ Linux การถอดเสียงฝั่งเซิร์ฟเวอร์ โดยเลือกโมเดลจากความยาวของการบันทึกของคุณ คลื่นเสียงสดขณะบันทึก ข้อความถอดเสียงจะแทรกที่เคอร์เซอร์ สามารถผสมกับการพิมพ์ได้อย่างอิสระ เลือกภาษาที่คุณพูดในการตั้งค่า
คู่หูมือถือ
บนคู่มือ iOS และ Android ให้กดไมโครโฟนเพื่อถอดเสียง การรู้จำเสียงทำงานบนอุปกรณ์ ดังนั้นเสียงจะอยู่บนโทรศัพท์ และข้อความที่รู้จำได้จะถูกส่งแบบเข้ารหัสจากจุดหนึ่งไปยังอีกจุดหนึ่งไปยังเอเจนต์เดสก์ท็อปที่โฟกัส วิธีที่เร็วที่สุดในการป้อนข้อมูลให้กับเอเจนต์จากกระเป๋าของคุณ
หลายภาษา
19 ภาษาพูด พร้อมการตรวจจับอัตโนมัติ: อังกฤษ, ฝรั่งเศส, สเปน, เยอรมัน, อิตาลี, โปรตุเกส, ดัตช์, รัสเซีย, ยูเครน, จีน, ญี่ปุ่น, เกาหลี, อาหรับ, ฮินดี, อินโดนีเซีย, โปแลนด์, ตุรกี, ไทย และเวียดนาม พูดในภาษาแม่ของคุณ แล้วเอเจนต์ของคุณจะได้รับข้อความที่ถอดเสียงมาอย่างสะอาด
การพิมพ์คำสั่งเทียบกับการถอดเสียงคำสั่ง
เอเจนต์เดียวกัน งานเดียวกัน ความเร็วต่างกัน บริบทต่างกัน ค่าใช้จ่ายโทเคนต่างกัน
การพิมพ์ทุกคำสั่ง
- : คุณพิมพ์ในความเร็วที่ต่ำกว่าที่คุณพูด ดังนั้นคำสั่งจึงสั้นลง
- : คำสั่งสั้นข้ามบริบท ดังนั้นเอเจนต์จึงเดาและคุณต้องแก้ไขมัน
- : การแก้ไขแต่ละครั้งคือการเดินทางรอบใหม่ ค่าใช้จ่ายโทเคนในการป้อนข้อมูลและส่งออกมากขึ้น
- : แอปถอดเสียงแยกต่างหากหรือการถอดเสียงระบบหมายถึงการคัดลอกและวางระหว่างหน้าต่าง
- : บนโทรศัพท์ คีย์บอร์ดมือถือทำให้คำสั่งยาวเจ็บปวด ดังนั้นคุณแทบจะไม่ตั้งคำสั่งเลย
การถอดเสียงด้วยการถอดเสียงด้วยเสียง
- : คุณพูดคำสั่งทั้งหมดในไม่กี่วินาที ดังนั้นคุณจึงพูดได้มากขึ้นตามธรรมชาติ
- : บริบทที่มากขึ้นในตอนแรกหมายความว่าเอเจนต์ทำงานได้ใกล้เคียงกับการลองครั้งแรก
- : การเดินทางรอบการชี้แจงที่น้อยลงหมายถึงการใช้โทเคนที่น้อยลงสำหรับผลลัพธ์เดียวกัน
- : ไมโครโฟนอยู่ในคอมโพสเซอร์ ข้อความถอดเสียงจะไปอยู่ในร่าง ไม่มีการคัดลอกและวาง
- : บนโทรศัพท์ ให้กดไมโครโฟนและข้อความจะปรากฏในเอเจนต์เดสก์ท็อปของคุณผ่านการส่งข้อมูลที่เข้ารหัส
การถอดเสียงด้วยเสียงเป็นวิธีที่ถูกที่สุดในการทำให้ทุกคำสั่งยาวขึ้น แม่นยำขึ้น และเขียนได้เร็วขึ้นในเวลาเดียวกัน
เสียงของคำสั่งที่ถอดเสียง
คุณไม่ต้องเขียนสิ่งนี้เลย คุณพูดออกมาดัง ๆ การแปลงเสียงเป็นข้อความจะเปลี่ยนมันเป็นคำสั่งด้านล่าง และคุณกด Enter ลองพูดคำสั่งที่ละเอียดขนาดนี้โดยการพิมพ์มันและรู้สึกว่ามันใช้เวลานานแค่ไหน
พูดลงไมโครโฟน
เพิ่มตัวจำกัดอัตราที่จุดสิ้นสุดการเข้าสู่ระบบ
ใช้หน้าต่างเลื่อนของห้าความพยายามต่อนาทีต่อต่อ IP
ส่งกลับ 429 พร้อมส่วนหัว Retry-After เมื่อถึงขีดจำกัด
เก็บเส้นทางความสำเร็จที่มีอยู่ไว้ไม่เปลี่ยนแปลง
เพิ่มการทดสอบหน่วยสำหรับการถึงขีดจำกัดและอีกหนึ่งสำหรับการรีเซ็ตหลังจากหนึ่งนาที
อย่าทำอะไรกับจุดสิ้นสุดการลงทะเบียนFAQ
การบันทึกเสียงใน AgentsRoom คืออะไร ?
การบันทึกเสียงคือปุ่มไมโครโฟนในผู้สร้างเอเจนต์ที่เปลี่ยนคำพูดของคุณเป็นข้อความ คุณคลิกที่ไมค์ พูดคำสั่งของคุณ และข้อความที่ถอดความจะถูกแทรกลงในร่างที่เคอร์เซอร์ของคุณ มันคือการแปลงเสียงเป็นข้อความในตัวสำหรับการเขียนคำสั่งให้กับเอเจนต์การเขียนโค้ด AI ของคุณ โดยไม่ต้องใช้แอปการบันทึกเสียงแยกต่างหากและไม่มีการคัดลอกและวางระหว่างหน้าต่าง
ทำไมฉันถึงควรบันทึกคำสั่งแทนที่จะพิมพ์ ?
ความเร็ว ความแม่นยำ และเศรษฐกิจของโทเค็น คุณพูดได้เร็วกว่าเมื่อพิมพ์หลายเท่า ดังนั้นคำสั่งใช้เวลาเพียงไม่กี่วินาทีแทนที่จะเป็นนาที เนื่องจากการบันทึกเสียงมีค่าใช้จ่ายต่ำ คุณจึงพูดมากขึ้นตามธรรมชาติ ซึ่งทำให้คำสั่งมีความแม่นยำมากขึ้น คำสั่งที่แม่นยำหมายถึงการเดินทางกลับไปกลับมาที่ชัดเจนน้อยลงกับเอเจนต์ ซึ่งหมายถึงการใช้โทเค็นน้อยลงในการไปถึงผลลัพธ์เดียวกัน
ฉันสามารถใช้โมเดลการถอดความใดได้บ้าง ?
ไม่มีอะไรให้เลือก AgentsRoom ถอดความคลิปปกติด้วยโมเดลค่าเริ่มต้นที่แม่นยำ และสลับไปใช้โมเดลที่ทนต่อการวนซ้ำเมื่อบันทึกเกินเก้าสิบวินาที เพราะโมเดลที่แม่นยำไม่มีตัวกันการพูดซ้ำ และจะเริ่มวนกับเสียงที่ยาวหรือมีเสียงรบกวน สิ่งที่คุณเลือกได้ในการตั้งค่าคือภาษาที่คุณพูด และจะดาวน์โหลดโมเดลออฟไลน์หรือไม่
นี่คือ OpenAI Whisper ใช่ไหม ?
อยู่เบื้องหลัง บางส่วน Whisper คือสิ่งที่ AgentsRoom ย้อนไปใช้กับการบันทึกที่ยาว ซึ่งตัวตรวจจับการวนซ้ำในตัวของมันทำให้การบอกเสียงสิบนาทียังอ่านรู้เรื่อง และมันยังเป็นโมเดลของโหมดออฟไลน์ที่เป็นตัวเลือกด้วย แต่มันไม่ใช่การตั้งค่าที่คุณต้องดูแล: จุดประสงค์ของการบอกเสียงใน AgentsRoom คือการที่การบอกเสียงมุ่งเป้าไปที่ช่องป้อนคำสั่งของเอเจนต์ของคุณโดยตรง ดังนั้นคุณจึงไม่ต้องบอกเสียงในหน้าต่างหนึ่งแล้วคัดลอกและวางในอีกหน้าต่างหนึ่ง
การบันทึกเสียงรองรับภาษาใดบ้าง ?
19 ภาษาพูด พร้อมการตรวจจับอัตโนมัติ: อังกฤษ, ฝรั่งเศส, สเปน, เยอรมัน, อิตาลี, โปรตุเกส, ดัตช์, รัสเซีย, ยูเครน, จีน, ญี่ปุ่น, เกาหลี, อาหรับ, ฮินดี, อินโดนีเซีย, โปแลนด์, ตุรกี, ไทย และเวียดนาม ระบบตรวจจับอัตโนมัติเป็นค่าเริ่มต้น และคุณบังคับเลือกภาษาที่ต้องการได้ในหน้าตั้งค่า เมื่อคลิปเสียงสั้น ๆ ถูกตรวจจับผิด
เสียงของฉันถูกส่งไปยังเซิร์ฟเวอร์หรือไม่ ?
ขึ้นอยู่กับพื้นผิว บนเดสก์ท็อป เสียงจะถูกส่งไปยังแบ็กเอนด์การถอดความของ AgentsRoom ซึ่งทำการแปลงเสียงเป็นข้อความและส่งกลับข้อความ คุณยังดาวน์โหลดโมเดลออฟไลน์เพื่อเก็บทุกอย่างไว้ในเครื่องของคุณได้ ในมือถือ การรู้จำเสียงทำงานบนอุปกรณ์ ดังนั้นเสียงจะไม่ออกจากโทรศัพท์ของคุณและมีเพียงข้อความที่รู้จำได้เท่านั้นที่ถูกส่งไปยังเดสก์ท็อปผ่านการเชื่อมต่อที่เข้ารหัสแบบ end-to-end
ข้อความจะถูกส่งโดยอัตโนมัติหลังจากที่ฉันบันทึกหรือไม่ ?
ไม่ การบันทึกเสียงจะส่งข้อความไปยังร่างเสมอ ไม่เคยส่ง การอ่านถอดความ แก้ไขคำที่ได้ยินผิดอย่างหายาก เพิ่มหรือลำดับใหม่ด้วยแป้นพิมพ์หากคุณต้องการ และกด Enter เมื่อคุณพร้อม คุณจะควบคุมสิ่งที่เอเจนต์ของคุณได้รับอย่างแม่นยำ
ฉันสามารถผสมการพิมพ์และการบันทึกในคำสั่งเดียวกันได้หรือไม่ ?
ใช่ ถอดความจะถูกแทรกที่เคอร์เซอร์ของคุณ ไม่ใช่แทนที่ทั้งร่าง ดังนั้นคุณสามารถพิมพ์ครึ่งแรก บันทึกย่อยาวในกลาง แล้วพิมพ์บรรทัดสุดท้าย การบันทึกเสียงเป็นวิธีที่เร็วกว่าในการเติมผู้สร้าง ซึ่งเข้ากันได้อย่างสมบูรณ์กับแป้นพิมพ์
ฉันสามารถบันทึกจากโทรศัพท์ไปยังเอเจนต์บนคอมพิวเตอร์ของฉันได้หรือไม่ ?
ใช่ แอปคู่หูมือถือมีปุ่มไมโครโฟน : กดค้างไว้ พูด ปล่อย เสียงจะถูกตรวจจับบนอุปกรณ์และข้อความจะถูกส่งผ่านการเข้ารหัสแบบ end-to-end ไปยังเอเจนต์ที่คุณมุ่งเน้นบนเดสก์ท็อป นี่คือวิธีที่เร็วที่สุดในการส่งคำสั่งไปยังเอเจนต์เดสก์ท็อปของคุณโดยไม่ต้องใช้แป้นพิมพ์มือถือ
การบันทึกเสียงทำงานร่วมกับ Claude Code, Codex และ Antigravity หรือไม่ ?
ใช่ กับทั้งสามตัว และกับ CLI ของเอเจนต์อื่นทุกตัวที่ AgentsRoom รองรับ: รวมทั้งหมด 14 ตัว รวมถึง GitHub Copilot CLI และ Cursor ข้อความที่บันทึกเสียงเป็นเพียงข้อความในผู้สร้าง และการกำหนดค่าการถอดความเป็นกลางต่อผู้ให้บริการ ดังนั้นการบันทึกเสียงจึงทำงานเหมือนกันไม่ว่าคุณจะใช้เอเจนต์ CLI ใด
เข้ากันได้ดีด้วย
Scratchpad
โปรแกรมแก้ไขคำสั่งที่ใหญ่ขึ้น ห่างออกไปแค่ปุ่ม "ขยาย" ใน composer พูดบรีฟยาว ๆ ปรับแต่งตรงนั้น แล้วส่งไปยังเอเจนต์ของคุณ
Prompt Library
บันทึกคำสั่งที่คุณบันทึกเสียงเป็นแม่แบบที่นำกลับมาใช้ใหม่ได้ การบันทึกเสียงเขียนร่างแรก ห้องสมุดเก็บของดี ๆ ไว้
Mobile-Desktop Sync
ลิงก์ที่เข้ารหัสแบบ end-to-end ที่ส่งข้อความที่คุณบันทึกจากโทรศัพท์ไปยังเอเจนต์ที่คุณมุ่งเน้นบนคอมพิวเตอร์ของคุณ
การควบคุมเอเจนต์ระยะไกล
ควบคุมเอเจนต์บนเดสก์ท็อปของคุณจากโทรศัพท์ของคุณ การพูดเป็นวิธีที่เร็วที่สุดในการส่งคำสั่งให้พวกเขาในขณะที่คุณอยู่ห่างจากแป้นพิมพ์
ผู้ให้บริการหลายราย
เรียกใช้ Claude, Codex, Antigravity, OpenCode, Aider, Grok Build, Mistral Vibe และ Kimi Code ข้างกัน การพูดด้วยเสียงทำงานเหมือนกันในทุกตัว
สเก็ตช์
วาดและทำเครื่องหมายในคอมโพเซอร์ จับคู่คำสั่งที่พูดกับสเก็ตช์ด่วนเพื่อให้เอเจนต์ของคุณมีทั้งคำและภาพ
พูดคุยกับเอเจนต์ของคุณ หยุดพิมพ์คำสั่ง
ดาวน์โหลด AgentsRoom และพูดคำสั่งของคุณตรงเข้าสู่คอมโพเซอร์ เขียนได้เร็วขึ้น มีบริบทมากขึ้น และใช้โทเคนเบาลง การพูดด้วยเสียงที่สร้างขึ้นใน IDE การเขียนโค้ด AI ของคุณ ทั้งบนเดสก์ท็อปและมือถือ
แอปคู่หู: ตรวจสอบเอเจนต์ของคุณได้ทุกที่
นำของคุณเอง: Claude, Codex, Antigravity CLI, หรือผู้ให้บริการ AI อื่น ๆ
ส่งข้อบกพร่องและคำขอไปยังแบ็คล็อกสาธารณะของคุณโดยตรง
มองเห็น AgentsRoom ในการทำงาน