सब कुछ पढ़ना बंद करें।
उसे सुनें।
Read Aloud AgentsRoom में बनी टेक्स्ट-टू-स्पीच है। स्पीकर पर एक क्लिक और एक markdown फाइल, टर्मिनल का चुना हुआ हिस्सा या आपके एजेंट का आखिरी जवाब एक प्राकृतिक सिंथेटिक आवाज़ में पढ़कर सुनाया जाता है: प्रोग्रेस बार, पॉज़, स्टॉप।
पूरा दस्तावेज़ सुनने का मन नहीं? वही बटन आपको उसका छोटा संस्करण पढ़कर सुना देता है, और आप तय करते हैं कि वह कितनी देर बोले: दस सेकंड, तीस, या एक मिनट। चालीस मिनट का changelog दस सेकंड में निपट जाता है।
आवाज़ चालू रखें: एजेंट का उत्तर चुनें, सुनें पर क्लिक करें, और एक सिंथेटिक आवाज़ उसे पढ़ देगी। स्टेटस बार का चिप प्रगति और बचा हुआ समय दिखाता है, रोकने और बंद करने के साथ।
डेवलपमेंट पढ़ने का काम है। एक README जो आपने नहीं लिखा, तीन सौ लाइन का एक changelog, इनबॉक्स में आ गिरी एक स्पेक, एक एजेंट का जवाब जो चार पैराग्राफ़ में एक माइग्रेशन समझाता है। यह सब आपकी आंखें करती हैं, पूरे दिन, और शाम छह बजे तक वे थक चुकी होती हैं। Read Aloud उनसे यह बोझ उतार लेता है।
यह एक यूज़र से आया। वह डिस्लेक्सिक है, वह रोज़ AgentsRoom इस्तेमाल करता है, और डॉक्युमेंटेशन पढ़ने के लिए markdown प्रीव्यू को कॉपी करके एक अलग टेक्स्ट-टू-स्पीच टूल में चिपकाता था। कॉपी करो, ऐप बदलो, पेस्ट करो, सुनो, वापस आओ, फिर से अपनी जगह ढूंढो। तो आवाज़ ऐप के अंदर आ गई: फाइल प्रीव्यू में स्पीकर बटन Source बटन के ठीक बगल में है, और दस्तावेज़ वहीं पढ़ा जाता है जहां वह पहले से है।
यह स्क्रीन रीडर नहीं है और यह एक्सेसिबिलिटी सर्टिफिकेशन नहीं है। यह आपके चुने हुए एक टेक्स्ट को ज़ोर से पढ़ता है, प्रोग्रेस बार और पॉज़ के साथ। यही सीमित वादा पूरी बात है: यही एक चीज़ है जिस पर आप भरोसा कर सकते हैं।
वॉइस क्रेडिट अब डिक्टेशन, Voice Mode और Read Aloud के बीच साझा होते हैं।
टर्मिनल के सिलेक्शन पैनल को हर हाइलाइट किए हिस्से के लिए एक सुनें बटन मिलता है।
जब तक कोई रीडिंग चल रही है, स्टेटस बार में एक कंट्रोल चिप बनी रहती है।
markdown प्रीव्यू एक changelog को ज़ोर से पढ़ता हुआ, और फिर वही दस्तावेज़ एक बोले हुए सारांश में सिमटा हुआ।
प्ले दबाने की चार जगहें
हर जगह वही रीडर, एक बार में एक ही रीडिंग। दूसरी शुरू करने पर पहली रुक जाती है, क्योंकि दो आवाज़ों का एक-दूसरे के ऊपर बोलना किसी को कभी नहीं चाहिए था।
एक पूरी markdown फाइल
प्रीव्यू में कोई भी markdown फाइल खोलें और Source के बगल में एक स्पीकर बटन दिखता है। उस पर क्लिक करें और दस्तावेज़ शुरू से पढ़ा जाता है। एक README, एक CLAUDE.md, एक स्पेक, एक changelog, एक आर्किटेक्चर नोट। यही वह एंट्री पॉइंट है जिसके लिए यह फीचर बना था।
टर्मिनल में आपने जो हाइलाइट किया
एजेंट टर्मिनल में टेक्स्ट चुनें और सिलेक्शन पैनल एक सुनें बटन के साथ खुलता है। यह ठीक वही पढ़ता है जो आपने हाइलाइट किया: किसी जवाब का एक पैराग्राफ़, एक एरर की व्याख्या, लंबे आउटपुट का वह हिस्सा जिसकी आपको सचमुच परवाह है। पैनल खुद बंद हो जाता है और रीडिंग चलती रहती है।
आपके एजेंट का आखिरी जवाब
एजेंट टर्मिनल में राइट-क्लिक करें और पढ़ने वाला विकल्प चुनें। जवाब एजेंट के डिस्क पर पड़े कन्वर्सेशन ट्रांसक्रिप्ट से आता है, टर्मिनल को खुरचकर नहीं, इसलिए आपको असली संदेश मिलता है, CLI की सजावट से भरी एक स्क्रीन नहीं। एजेंट ने तब काम पूरा किया जब आप किसी दूसरी विंडो में थे: स्क्रॉल करके पीछे जाने के बजाय उसे सुन लें।
एक AI सारांश या व्याख्या
सिलेक्शन पैनल पहले से ही हाइलाइट किए हिस्से का सारांश दे सकता है या उसे समझा सकता है। जब जवाब आता है, नतीजे के बबल पर एक स्पीकर बटन उसे पढ़कर सुना देता है। पूछें कि एक उलझी हुई स्टैक ट्रेस का मतलब क्या है, फिर टाइप करते रहते हुए व्याख्या सुनें।

यह गद्य पढ़ता है, विराम चिह्न नहीं
टेक्स्ट-टू-स्पीच इंजन को कच्चा markdown भेजना सुनने लायक नहीं होता। Read Aloud पहले उसे साफ करता है।
Release 1.14.
The reader now shares its credits.
Pause and resume anytime.
आवाज़ तक क्या पहुंचता है: सिर्फ गद्य। कोड, टेबल और अकेले पड़े फाइल पाथ एक भी शब्द बोले जाने से पहले हटा दिए जाते हैं।
एक तकनीकी दस्तावेज़ सीधे स्पीच इंजन को भेजिए और आपको मिलता है "बैकटिक स्लैश src स्लैश services स्लैश foo डॉट ts बैकटिक", फिर एक markdown टेबल जो सेल दर सेल पढ़ी जाती है, फिर एक सेपरेटर लाइन जो डैश की एक झड़ी की तरह बोली जाती है। इसे कोई दूसरी बार नहीं सुनता। इसलिए कुछ भी बोले जाने से पहले टेक्स्ट सफाई के एक दौर से गुज़रता है।
बैकटिक वाले कोड ब्लॉक पूरी तरह हटा दिए जाते हैं। markdown टेबल, हॉरिज़ॉन्टल रूल और वे लाइनें जो सिर्फ एक फाइल पाथ हैं, वे भी जाती हैं। बोल्ड, इटैलिक और इनलाइन कोड के मार्कर हट जाते हैं पर उनके शब्द रह जाते हैं। एक लिंक अपना लेबल बन जाता है, एक इमेज गायब हो जाती है। हेडिंग और लिस्ट आइटम को पूर्ण विराम मिलता है जब उनमें नहीं होता, वरना आवाज़ पूरी बुलेट लिस्ट को बिना सांस लिए एक ही वाक्य में पढ़ जाती है।
- पैराग्राफ़ और गद्य
- हेडिंग और लिस्ट आइटम, असली वाक्यों की तरह
- लिंक के लेबल, URL के बिना
- बोल्ड और इटैलिक शब्द, मार्कर के बिना
- बैकटिक वाले कोड ब्लॉक
- markdown टेबल
- वे लाइनें जो सिर्फ एक फाइल पाथ हैं
- हॉरिज़ॉन्टल रूल और सेपरेटर
या छोटा संस्करण सुनें
वही बटन, दूसरा विकल्प: एक AI सारांश आपकी चुनी हुई बोलने की अवधि के नाप का लिखा जाता है, और वही सारांश बोला जाता है।
कुछ दस्तावेज़ पूरे पढ़े जाने के लायक नहीं होते। एक changelog जिसका आपको बस आकार चाहिए। एक स्पेक जिसका सार आपको मीटिंग से पहले चाहिए। एक एजेंट का जवाब जिसने एक बात कहने में चार पैराग्राफ़ लिए। छोटा संस्करण इन्हीं के लिए है: AgentsRoom टेक्स्ट को आपकी मांगी हुई अवधि में समेटता है, फिर वही सारांश ज़ोर से पढ़ता है।
आप सेकंड खरीदते हैं, शब्द नहीं। सुनने वाले के लिए बोलने की अवधि ही इकलौती इकाई है जो मायने रखती है, और संयोग से आप भी उसी में चुकाते हैं, क्योंकि आवाज़ का बिल हर अक्षर पर बनता है। बाईस मिनट के दस्तावेज़ की जगह दस सेकंड का सार आपके क्रेडिट पर लगभग कुछ खर्च ही नहीं करता।
तीन अवधियां, एक क्लिक
दस सेकंड। सुर्खी: दस्तावेज़ किस बारे में है और क्या बदला। यही डिफ़ॉल्ट है।
तीस सेकंड। सार अपनी वजहों के साथ, इतना कि आप तय कर सकें कि पूरी रीडिंग आपके समय के लायक है या नहीं।
एक मिनट। एक असली ब्रीफिंग: दस्तावेज़ का ढांचा, उसके मुख्य बिंदु और उसकी शर्तें।
एक क्लिक वाला छोटा संस्करण वही अवधि इस्तेमाल करता है जो आपने AgentsRoom सेटिंग्स में तय की है। इंस्टॉल करने पर दस सेकंड।
- ·सारांश आपके इंटरफ़ेस की भाषा में लिखा जाता है, इसलिए एक हिंदी यूज़र को अंग्रेज़ी दस्तावेज़ का हिंदी रीकैप मिलता है।
- ·टेक्स्ट के लिए यह आपके मासिक AI सारांश कोटे से लेता है, फिर ऑडियो के लिए वॉइस क्रेडिट से।
- ·सारांश लिखे जाने से पहले markdown हटा दिया जाता है, ताकि सारांश बनाने वाला अपना बजट गद्य पर खर्च करे, कोड ब्लॉक पर नहीं।
एक प्लेयर जो ढंग से चलता है
बीस मिनट तक बोलने वाली किसी चीज़ से जो कुछ आप उम्मीद करते हैं।
यह असल में किसके लिए है
कोई बड़े दावे नहीं। चार हालात जहां लोग बटन दबाते हैं।
डिस्लेक्सिक डेवलपर, और वे सब जो धीरे पढ़ते हैं। लिखी हुई तकनीकी अंग्रेज़ी को समझना सबसे मुश्किल होता है, और एक सिंथेटिक आवाज़ अक्षर जोड़ने का वह कदम हटा देती है। फीचर यहीं से आया और यही वह मामला है जिसे यह सबसे अच्छे से संभालता है।
थक चुकी आंखें। दोपहर बाद का वक्त, डॉक्युमेंटेशन की तीसरी स्क्रीन, ध्यान गायब। खड़े होकर अंगड़ाई लेते हुए एक स्पेक सुनना कोई प्रोडक्टिविटी ट्रिक नहीं है, यह बस कम तकलीफ़देह है।
लंबा चलने वाला एजेंट। वह ग्यारह मिनट से काम कर रहा था, आखिरकार उसने जवाब दिया, और जवाब चार पैराग्राफ़ का है। राइट-क्लिक, सुनें, और जो कर रहे थे वह करते रहें।
अपना ही लिखा हुआ दोबारा देखना। एक README, एक रिलीज़ नोट, सपोर्ट का एक जवाब: उसे पढ़ा जाता सुनना उस बेढंगे वाक्य को पकड़ लेता है जिसे आपकी आंखें अब देखना बंद कर चुकी हैं।
यह क्या नहीं करता
ईमानदार सूची, ताकि इंस्टॉल करने के बाद कुछ भी आपको चौंकाए नहीं।
- यह स्क्रीन रीडर नहीं है। यह इंटरफ़ेस नहीं सुनाता, आपके कीबोर्ड फोकस के पीछे नहीं चलता, और एक्सेसिबिलिटी अनुरूपता का कोई दावा नहीं करता। यह वह टेक्स्ट पढ़ता है जो आपने चुना।
- एक रीडिंग की सीमा 20,000 अक्षर है, करीब बाईस मिनट की बोली। उससे आगे रीडिंग काट दी जाती है और इंटरफ़ेस यह बता देता है, क्योंकि आवाज़ का बिल हर अक्षर पर बनता है और एक बड़ी फाइल पर एक क्लिक को चुपचाप एक महीने के क्रेडिट खाली नहीं करने चाहिए।
- एक फाइल, एक सिलेक्शन या एक सारांश पढ़ना हर एजेंट प्रोवाइडर के साथ काम करता है। एजेंट का आखिरी जवाब पढ़ने के लिए एक पता लगाने लायक कन्वर्सेशन ट्रांसक्रिप्ट चाहिए, जिसका मतलब आज Claude Code और Codex है; बाकी प्रोवाइडर अंदाज़ा लगाने के बजाय बता देते हैं कि पढ़ने को कुछ नहीं है।
- इसे कनेक्शन चाहिए। आवाज़ सर्वर पर बनाई जाती है, इसलिए ऑफ़लाइन आवाज़ नहीं है, और जिस दस्तावेज़ में सिर्फ कोड या सिर्फ फाइल पाथ हैं, उसमें सफाई के बाद बोलने को कुछ नहीं बचता।
Pro, आपके वॉइस क्रेडिट पर
वही बटुआ जो Voice Mode और डिक्टेशन का है, ट्रैक करने के लिए कोई नया कोटा नहीं।
Read Aloud एक Pro फीचर है। Voice Mode और डिक्टेशन हर साइन-इन किए अकाउंट के लिए खुले हैं क्योंकि एक बोला हुआ जवाब छोटा होता है, करीब नौ सौ अक्षर। एक दस्तावेज़ में दसियों हज़ार होते हैं। खपत का यही फ़र्क प्लान की शर्त की पूरी वजह है, और Free/Plus/Pro तुलना टेबल में इसकी अपनी लाइन है।
बिलिंग आपके अकाउंट में पहले से मौजूद वॉइस क्रेडिट पर चलती है, जो Voice Mode और डिक्टेशन के साथ साझा हैं और हर महीने की शुरुआत में भर जाते हैं। स्पीच रिक्वेस्ट भेजने से पहले क्रेडिट जांचे जाते हैं, इसलिए खाली बैलेंस पर कोई कॉल नहीं होती। आप अपनी खुद की OpenAI API key भी जोड़ सकते हैं: तब रीडिंग आपके अकाउंट पर चलती है और शून्य क्रेडिट खर्च करती है।
वॉइस क्रेडिट Read Aloud, Voice Mode और वॉइस डिक्टेशन के बीच साझा होते हैं।
FAQ
Read Aloud असल में क्या है?
AgentsRoom के अंदर एक टेक्स्ट-टू-स्पीच रीडर। आप एक लिखा हुआ टेक्स्ट चुनते हैं (एक markdown फाइल, टर्मिनल का एक सिलेक्शन, आपके एजेंट का आखिरी जवाब) और वह एक प्राकृतिक सिंथेटिक आवाज़ में पढ़कर सुनाया जाता है, प्रोग्रेस बार, पॉज़ और स्टॉप के साथ। यह वॉइस डिक्टेशन की उल्टी दिशा है, जो आपकी बोली को टेक्स्ट में बदलता है।
क्या मैं एक markdown फाइल सुन सकता हूं, जैसे कोई README?
हां, यही मुख्य एंट्री पॉइंट है। फाइल को AgentsRoom प्रीव्यू में खोलें और Source के बगल वाले स्पीकर बटन पर क्लिक करें। पूरा दस्तावेज़ शुरू से पढ़ा जाता है: README, CLAUDE.md, changelog, आर्किटेक्चर नोट, स्पेक। markdown सिंटैक्स पहले साफ किया जाता है, तो आप टेक्स्ट सुनते हैं, मार्कअप नहीं।
क्या यह कोड भी ज़ोर से पढ़ता है?
नहीं, और यह जानबूझकर है। कुछ भी बोले जाने से पहले कोड ब्लॉक हटा दिए जाते हैं, साथ में markdown टेबल, हॉरिज़ॉन्टल रूल और वे लाइनें जो सिर्फ एक फाइल पाथ हैं। बोला हुआ कोड सुनने लायक नहीं होता, इसलिए Read Aloud गद्य रखता है और बाकी छोड़ देता है।
क्या मैं पूरे दस्तावेज़ के बजाय एक सारांश सुन सकता हूं?
हां। हर एंट्री पॉइंट छोटा संस्करण देता है: पहले एक AI सारांश लिखा जाता है, आपकी चुनी हुई बोलने की अवधि के नाप का, और वही सारांश बोला जाता है। तीन अवधियां हैं, करीब दस सेकंड, तीस सेकंड और एक मिनट, और दस सेकंड डिफ़ॉल्ट है। यह एक लंबे changelog को एक छोटे ऑडियो रीकैप में बदल देता है और पूरा टेक्स्ट पढ़ने से कहीं कम वॉइस क्रेडिट खर्च करता है। सारांश आपके इंटरफ़ेस की भाषा में लिखा जाता है।
अगर मुझे डिस्लेक्सिया है तो क्या यह काम का है?
फीचर वहीं से आया। एक डिस्लेक्सिक यूज़र AgentsRoom के markdown प्रीव्यू को कॉपी करके एक बाहरी टेक्स्ट-टू-स्पीच टूल में चिपकाता था, इसलिए आवाज़ को ऐप के अंदर लाया गया। यह तकनीकी डॉक्युमेंटेशन पर अक्षर जोड़ने का कदम हटा देता है। यह स्क्रीन रीडर नहीं है और यह किसी अनुरूपता का दावा नहीं करता, लेकिन दस्तावेज़ पढ़ने का जो काम इससे मांगा गया, वह यह पूरा करता है।
यह कितना लंबा दस्तावेज़ पढ़ सकता है?
एक रीडिंग की सीमा 20,000 बोले जा सकने वाले अक्षर है, करीब बाईस मिनट। उससे आगे रीडिंग काट दी जाती है और इंटरफ़ेस आपको बता देता है कि उसे छोटा किया गया। यह सीमा इसलिए है क्योंकि आवाज़ का बिल हर अक्षर पर बनता है: इसके बिना, एक बड़ी फाइल पर एक क्लिक आपके प्रतिक्रिया देने से पहले एक महीने के क्रेडिट खाली कर सकता था।
अगर पढ़ते समय मैं फाइल बंद कर दूं तो क्या होगा?
रीडिंग चलती रहती है। प्लेयर उस विंडो के बाहर रहता है जिसने उसे शुरू किया, और स्टेटस बार में एक कंट्रोल चिप दिखती है जिसमें प्रोग्रेस, बचा हुआ समय, पॉज़ और स्टॉप होते हैं। यही वह कंट्रोल है जो हमेशा उपलब्ध रहता है, और रीडिंग खत्म होने पर गायब हो जाता है।
क्या यह हर एजेंट के साथ काम करता है?
एक फाइल, एक सिलेक्शन या एक AI सारांश पढ़ना किसी भी प्रोवाइडर के साथ काम करता है, क्योंकि टेक्स्ट आपकी स्क्रीन से आता है। एजेंट का आखिरी जवाब पढ़ने के लिए डिस्क पर एक पता लगाने लायक कन्वर्सेशन ट्रांसक्रिप्ट चाहिए, जिसका मतलब आज Claude Code और Codex है। बाकी प्रोवाइडर के साथ वह एंट्री पॉइंट बता देता है कि पढ़ने को कुछ नहीं है।
इसकी कीमत क्या है?
Read Aloud एक Pro फीचर है, जिसका बिल उन्हीं वॉइस क्रेडिट पर बनता है जो Voice Mode और डिक्टेशन के साथ साझा हैं और हर महीने भर जाते हैं। कोई अलग कोटा नहीं है। रिक्वेस्ट से पहले क्रेडिट जांचे जाते हैं, इसलिए खाली बैलेंस पर कुछ खर्च नहीं होता, और आप अपनी खुद की OpenAI API key जोड़कर रीडिंग अपने अकाउंट पर शून्य क्रेडिट में चला सकते हैं।
यह किस भाषा में पढ़ता है?
दस्तावेज़ की भाषा में। आवाज़ का मॉडल वही पढ़ता है जो उसके सामने है, इसलिए एक अंग्रेज़ी README अंग्रेज़ी ही रहता है, भले ही आपका AgentsRoom इंटरफ़ेस हिंदी में हो। छोटा संस्करण अपवाद है: सारांश आपके इंटरफ़ेस की भाषा में लिखा जाता है, फिर बोला जाता है।
क्या मैं आवाज़ चुन सकता हूं?
हां। Read Aloud वही आवाज़ इस्तेमाल करता है जो आपने AgentsRoom सेटिंग्स में Voice Mode के लिए पहले से चुनी है, तो आप उसे एक बार सेट करते हैं और दोनों फीचर उसी को इस्तेमाल करते हैं।
क्या दो चीज़ें एक साथ पढ़ी जा सकती हैं?
नहीं, और यह जानबूझकर है। पूरे ऐप के लिए एक ही रीडर है: नई रीडिंग शुरू करने पर चल रही रीडिंग रुक जाती है। दो सिंथेटिक आवाज़ें एक-दूसरे के ऊपर बोलती रहें, यह किसी ने कभी नहीं चाहा।
यह भी पसंद आ सकता है
Voice Mode
एक चल रहे एजेंट के साथ दोतरफा बोली हुई बातचीत। Read Aloud एक लिखा हुआ टेक्स्ट पढ़ता है, Voice Mode एक लाइव आगे-पीछे चलाता है, हैंड्स-फ्री।
वॉइस डिक्टेशन
दूसरी दिशा: अपना प्रॉम्प्ट बोलिए और ट्रांसक्रिप्शन कंपोज़र में आ जाता है, देखने और भेजने के लिए तैयार।
प्रोजेक्ट मेमोरी
साझा नॉलेज बेस जिसमें आपके एजेंट लिखते हैं और जिससे पढ़ते हैं। बहुत सारे नोट्स जिन्हें पढ़ने के बजाय सुनना बेहतर है।
कमिट संदर्भ
हर कमिट के साथ जुड़ी एजेंट बातचीत का सार, ताकि किसी बदलाव के पीछे की सोच diff के बाद भी बची रहे।
डेव टर्मिनल
आपके डेव सर्वर और लंबे चलने वाले प्रोसेस उसी कॉकपिट में जहां आपके एजेंट हैं, उनके लॉग एक क्लिक दूर।
अपनी आंखों को आराम दें
AgentsRoom डाउनलोड करें और अपना अगला changelog पढ़वाकर सुनें।
कंपेनियन ऐप: चलते-फिरते अपने एजेंट्स मॉनिटर करें
Claude, Codex, Antigravity CLI या किसी अन्य AI प्रदाता का उपयोग करें।
बग और अनुरोध सीधे अपने सार्वजनिक बैकलॉग में भेजें।
AgentsRoom को कार्य करते देखें।