Czytanie na głos

Przestań wszystko czytać.
Posłuchaj tego.

Read Aloud to synteza mowy wbudowana w AgentsRoom. Jedno kliknięcie w głośnik i plik markdown, zaznaczenie z terminala albo ostatnia odpowiedź agenta zostaje przeczytana na głos naturalnym, syntetycznym głosem: pasek postępu, pauza i stop.

Nie masz ochoty na całość? Ten sam przycisk czyta Ci zamiast tego wersję skróconą, a Ty wybierasz, jak długo ma mówić: dziesięć sekund, trzydzieści albo minutę. Czterdziestominutowy changelog załatwiony w dziesięć sekund.

Z dźwiękiem: zaznacz odpowiedź agenta, kliknij Słuchaj, a syntetyczny głos ją przeczyta. Plakietka na pasku stanu pokazuje postęp i pozostały czas, z pauzą i zatrzymaniem.

Programowanie to czytanie. README, którego nie pisałeś, changelog na trzysta linijek, specyfikacja, która wylądowała w skrzynce, odpowiedź agenta tłumacząca migrację w czterech akapitach. Twoje oczy biorą to wszystko na siebie przez cały dzień, a o osiemnastej mają dość. Read Aloud zdejmuje z nich ten ciężar.

Pomysł przyszedł od użytkownika. Ma dysleksję, korzysta z AgentsRoom codziennie i kopiował podgląd markdown do osobnego narzędzia do syntezy mowy, żeby przebrnąć przez dokumentację. Skopiuj, przełącz aplikację, wklej, posłuchaj, wróć, znajdź miejsce, w którym skończyłeś. Więc głos wprowadził się do aplikacji: przycisk głośnika siedzi tuż obok przycisku Source w podglądzie pliku, a dokument jest czytany tam, gdzie już jest.

To nie jest czytnik ekranu ani certyfikat dostępności. To czyta na głos tekst, który wybrałeś, z paskiem postępu i pauzą. Ta wąska obietnica jest tu całym sensem: to jedna rzecz, na której możesz polegać.

CHANGELOG.md
PosłuchajStreszczenie

Kredyty głosowe są teraz wspólne dla dyktowania, Voice Mode i czytania na głos.

Panel zaznaczenia w terminalu dostaje przycisk Posłuchaj dla wszystkiego, co podświetlisz.

Pasek stanu trzyma kontrolkę odtwarzania tak długo, jak trwa czytanie.

3:20

Podgląd markdown czytający changelog na głos, a potem ten sam dokument skrócony do mówionego streszczenia.

Cztery miejsca, w których naciskasz odtwarzanie

Wszędzie ten sam odtwarzacz, jedno czytanie naraz. Uruchomienie drugiego zatrzymuje pierwsze, bo dwa głosy mówiące jeden przez drugi nigdy nie były pomysłem.

Plik markdown, w całości

Otwórz dowolny plik markdown w podglądzie, a obok Source pojawi się przycisk głośnika. Kliknij, a dokument zostanie przeczytany od góry. README, CLAUDE.md, specyfikacja, changelog, notatka o architekturze. To punkt wejścia, dla którego ta funkcja powstała.

To, co podświetliłeś w terminalu

Zaznacz tekst w terminalu agenta, a panel zaznaczenia otworzy się z przyciskiem Posłuchaj. Przeczyta dokładnie to, co podświetliłeś: jeden akapit odpowiedzi, wyjaśnienie błędu, ten fragment długiego wydruku, na którym naprawdę Ci zależy. Panel zamyka się sam, a czytanie leci dalej.

Ostatnia odpowiedź Twojego agenta

Kliknij prawym przyciskiem w terminalu agenta i wybierz pozycję czytania. Odpowiedź pochodzi z zapisu rozmowy leżącego na dysku, a nie ze zgarnięcia zawartości terminala, więc słyszysz prawdziwą wiadomość, a nie ekran ozdobników CLI. Agent skończył, gdy byłeś w innym oknie: posłuchaj go, zamiast przewijać do góry.

Streszczenie albo wyjaśnienie od AI

Panel zaznaczenia już potrafi streścić albo wyjaśnić podświetlony fragment. Kiedy odpowiedź wraca, przycisk głośnika na dymku wyniku czyta ją na głos. Zapytaj, co znaczy paskudny stack trace, a potem słuchaj wyjaśnienia, pisząc dalej.

Czytanie na głos w AgentsRoom: przycisk Słuchaj w panelu zaznaczenia terminala otwiera menu syntezy mowy z czterema poziomami, Przeczytaj wszystko słowo w słowo albo mówione podsumowanie AI trwające około 10, 30 lub 60 sekund, nad odpowiedzią agenta Claude Code.
Jedno kliknięcie w Słuchaj i zaznaczona odpowiedź jest czytana na głos, słowo w słowo. Strzałka obok otwiera trzy skrócone odczyty: podsumowanie napisane przez AI tak, by trwało około dziesięciu, trzydziestu lub sześćdziesięciu sekund, a następnie wypowiedziane.

Czyta prozę, nie znaki interpunkcyjne

Markdown wysłany surowy do silnika syntezy mowy jest nie do słuchania. Read Aloud najpierw go czyści.

Usuwane przed czytaniem
## Release 1.14
The reader now shares its credits.
```ts
export const MAX = 20000;
```
| Plan | Voice |
src/services/readAloud.ts
---
- Pause and **resume** anytime.
Wypowiadane

Release 1.14.

The reader now shares its credits.

Pause and resume anytime.

Co dociera do głosu: sama proza. Kod, tabele i gołe ścieżki plików wypadają, zanim padnie choć jedno słowo.

Wyślij dokument techniczny bez zmian do silnika mowy, a dostaniesz „backtick ukośnik src ukośnik services ukośnik foo kropka ts backtick”, potem tabelę markdown czytaną komórka po komórce, a potem linię oddzielającą zapowiedzianą jako seria myślników. Nikt nie słucha tego dwa razy. Więc zanim padnie pierwsze słowo, tekst przechodzi jedno przejście czyszczące.

Bloki kodu między potrójnymi backtickami znikają w całości. Tabele markdown, linie poziome i wiersze, które są tylko ścieżką pliku, też wypadają. Znaczniki pogrubienia, kursywy i kodu w linii są zdejmowane, a ich słowa zostają. Link staje się swoją etykietą, obrazek znika. Nagłówki i punkty listy dostają kropkę, gdy jej nie mają, bo inaczej głos zlewa całą listę w jedno zdanie bez oddechu.

Wypowiadane
  • Akapity i proza
  • Nagłówki i punkty listy, jako prawdziwe zdania
  • Etykiety linków, bez adresu URL
  • Słowa pogrubione i pisane kursywą, bez znaczników
Usuwane przed czytaniem
  • Bloki kodu
  • Tabele markdown
  • Wiersze będące samą ścieżką pliku
  • Linie poziome i separatory

Albo posłuchaj krótkiej wersji

Ten sam przycisk, druga opcja: AI pisze streszczenie tak, żeby zmieściło się w wybranym przez Ciebie czasie mówienia, i to streszczenie jest czytane.

Nie każdy dokument zasługuje na czytanie w całości. Changelog, z którego chcesz tylko ogólny kształt. Specyfikacja, z której potrzebujesz sedna przed spotkaniem. Odpowiedź agenta, której zajęły cztery akapity, żeby powiedzieć jedną rzecz. Od tego jest wersja skrócona: AgentsRoom streszcza tekst do zamówionej długości, a potem czyta to na głos.

Kupujesz sekundy, nie słowa. Czas mówienia to jedyna jednostka, która obchodzi słuchacza, i przypadkiem jest też tą, w której płacisz, bo synteza mowy jest rozliczana za znak. Dziesięć sekund sedna zamiast dwudziestu dwóch minut dokumentu to na Twoich kredytach błąd zaokrąglenia.

Trzy długości, jedno kliknięcie

10s

Dziesięć sekund. Nagłówek: o czym jest dokument i co się zmieniło. To ustawienie domyślne.

30s

Trzydzieści sekund. Sedno wraz z powodami, tyle, żeby zdecydować, czy pełne czytanie jest warte Twojego czasu.

60s

Minuta. Prawdziwy briefing: budowa dokumentu, jego główne punkty i zastrzeżenia.

Wersja skrócona na jedno kliknięcie używa długości ustawionej w ustawieniach AgentsRoom. Po instalacji jest to dziesięć sekund.

  • ·Streszczenie jest pisane w języku Twojego interfejsu, więc polski użytkownik dostaje polskie podsumowanie angielskiego dokumentu.
  • ·Na tekst zużywa Twój miesięczny limit streszczeń AI, a potem kredyty głosowe na audio.
  • ·Markdown jest usuwany przed napisaniem streszczenia, żeby model wydał swój budżet na prozę, a nie na bloki kodu.

Odtwarzacz, który się zachowuje

Wszystko, czego oczekujesz od czegoś, co mówi przez dwadzieścia minut.

Postęp i pozostały czas
Pasek wypełnia się w miarę czytania, ważony liczbą znaków, obok pozostałego czasu w minutach i sekundach. Wiesz, czy zostały Ci dwie minuty, czy dwanaście.
Pauza, wznowienie, stop
Zatrzymaj w połowie zdania i wróć dokładnie w to miejsce. Stop kończy czytanie natychmiast, razem z pobieranym właśnie fragmentem.
Kontrolka w pasku stanu
Czytanie przeżywa okno, które je uruchomiło. Zamknij podgląd pliku, a głos leci dalej, więc w pasku stanu pojawia się kontrolka z postępem, pauzą i stopem. To jedyne sterowanie, które jest zawsze pod ręką, i znika w chwili, gdy czytanie się kończy.
Czytane w języku, w którym zostało napisane
To dokument decyduje o języku, nie Twój interfejs. Angielskie README zostaje angielskie dla polskiego użytkownika, bo model głosowy czyta to, co ma naprawdę przed sobą.

Komu to naprawdę służy

Bez wielkich deklaracji. Cztery sytuacje, w których ludzie naciskają przycisk.

Programiści z dysleksją i wszyscy, którzy czytają wolno. Pisany angielski techniczny jest najtrudniejszy do rozszyfrowania, a syntetyczny głos usuwa etap rozszyfrowywania. Stąd wzięła się ta funkcja i temu przypadkowi służy najlepiej.

Oczy, które mają dość. Późne popołudnie, trzeci ekran dokumentacji, skupienie gdzieś przepadło. Słuchanie specyfikacji, gdy wstajesz i się rozciągasz, to nie żaden trik na produktywność, po prostu mniej boli.

Agent, który pracuje długo. Robił swoje przez jedenaście minut, w końcu odpowiedział, a odpowiedź ma cztery akapity. Prawy przycisk, słuchasz, robisz dalej to, co robiłeś.

Sprawdzanie własnej prozy. README, nota do wydania, odpowiedź dla wsparcia: usłyszenie tego na głos wyłapuje koślawe zdanie, którego Twoje oczy już nie widzą.

Czego to nie robi

Uczciwa lista, żeby nic Cię nie zaskoczyło po instalacji.

  • To nie jest czytnik ekranu. Nie opowiada interfejsu, nie podąża za fokusem klawiatury i nie rości sobie żadnej zgodności z wymaganiami dostępności. Czyta tekst, który wybrałeś.
  • Jedno czytanie ma limit 20 000 znaków, mniej więcej dwadzieścia dwie minuty mowy. Powyżej czytanie jest przycinane, a interfejs to komunikuje, bo synteza mowy jest rozliczana za znak, a jedno kliknięcie w ogromny plik nie może po cichu opróżnić miesięcznych kredytów.
  • Czytanie pliku, zaznaczenia albo streszczenia działa z każdym dostawcą agentów. Czytanie ostatniej odpowiedzi agenta wymaga adresowalnego zapisu rozmowy, co dziś oznacza Claude Code i Codex; inni dostawcy mówią, że nie ma czego czytać, zamiast zgadywać.
  • Potrzebne jest połączenie. Mowa jest syntetyzowana po stronie serwera, więc nie ma głosu offline, a dokument zawierający wyłącznie kod albo same ścieżki plików nie ma po oczyszczeniu nic do powiedzenia.

Pro, na Twoich kredytach głosowych

Ten sam portfel co Voice Mode i dyktowanie, żadnego nowego limitu do pilnowania.

Read Aloud to funkcja Pro. Voice Mode i dyktowanie są otwarte dla każdego zalogowanego konta, bo wypowiedziana odpowiedź jest krótka, około dziewięciuset znaków. Dokument ma ich dziesiątki tysięcy. Ta różnica w zużyciu jest całym powodem bramki planu, a w tabeli porównania Free/Plus/Pro ma własny wiersz.

Rozliczenie idzie z kredytów głosowych, które już masz na koncie, wspólnych z Voice Mode i dyktowaniem, odnawianych na początku każdego miesiąca. Kredyty są sprawdzane przed wysłaniem żądania mowy, więc nigdy nie leci ono na pusty stan konta. Możesz też podpiąć własny klucz API OpenAI: czytania działają wtedy na Twoim koncie i nie kosztują ani jednego kredytu.

Free
Niedostępne
Plus
Niedostępne
Pro
Miesięczne kredyty głosowe

Kredyty głosowe są wspólne dla czytania na głos, Voice Mode i dyktowania głosowego.

FAQ

Czym dokładnie jest Read Aloud?

Czytnikiem z syntezą mowy wewnątrz AgentsRoom. Wybierasz napisany tekst (plik markdown, zaznaczenie z terminala, ostatnią odpowiedź agenta), a on zostaje przeczytany na głos naturalnym, syntetycznym głosem, z paskiem postępu, pauzą i stopem. To kierunek odwrotny do dyktowania głosowego, które zamienia Twoją mowę w tekst.

Czy mogę posłuchać pliku markdown, na przykład README?

Tak, to główny punkt wejścia. Otwórz plik w podglądzie AgentsRoom i kliknij przycisk głośnika obok Source. Cały dokument jest czytany od góry: README, CLAUDE.md, changelog, notatka o architekturze, specyfikacja. Składnia markdown jest najpierw czyszczona, więc słyszysz tekst, a nie znaczniki.

Czy czyta kod na głos?

Nie, i to celowo. Bloki kodu są usuwane, zanim cokolwiek zostanie wypowiedziane, razem z tabelami markdown, liniami poziomymi i wierszami, które są tylko ścieżką pliku. Wypowiadany kod jest nie do słuchania, więc Read Aloud zostawia prozę, a resztę odrzuca.

Czy mogę posłuchać streszczenia zamiast całego dokumentu?

Tak. Każdy punkt wejścia proponuje wersję skróconą: najpierw powstaje streszczenie napisane przez AI, skrojone na wybrany przez Ciebie czas mówienia, i to właśnie streszczenie jest czytane. Dostępne są trzy długości, mniej więcej dziesięć sekund, trzydzieści sekund i minuta, domyślnie dziesięć sekund. Zamienia długi changelog w krótkie podsumowanie audio i kosztuje znacznie mniej kredytów głosowych niż czytanie całego tekstu. Streszczenie jest pisane w języku Twojego interfejsu.

Czy to się przyda, jeśli mam dysleksję?

Stąd wzięła się ta funkcja. Użytkownik z dysleksją kopiował podgląd markdown z AgentsRoom do zewnętrznego narzędzia do syntezy mowy, więc głos został wciągnięty do aplikacji. Znosi etap rozszyfrowywania przy dokumentacji technicznej. To nie jest czytnik ekranu i nie rości sobie żadnej zgodności, ale przy czytaniu dokumentów robi dokładnie tę robotę, o którą się go prosi.

Jak długi dokument może przeczytać?

Jedno czytanie ma limit 20 000 znaków tekstu możliwego do wypowiedzenia, mniej więcej dwadzieścia dwie minuty. Powyżej czytanie jest przycinane, a interfejs mówi Ci, że zostało skrócone. Ten limit istnieje, bo synteza mowy jest rozliczana za znak: bez niego jedno kliknięcie w ogromny plik mogłoby opróżnić miesięczne kredyty, zanim zdążysz zareagować.

Co się stanie, jeśli zamknę plik w trakcie czytania?

Czytanie leci dalej. Odtwarzacz żyje poza oknem, które go uruchomiło, a w pasku stanu pojawia się kontrolka z postępem, pozostałym czasem, pauzą i stopem. To sterowanie zawsze dostępne, które znika, gdy czytanie się kończy.

Czy działa z każdym agentem?

Czytanie pliku, zaznaczenia albo streszczenia od AI działa z dowolnym dostawcą, bo tekst pochodzi z Twojego ekranu. Czytanie ostatniej odpowiedzi agenta wymaga adresowalnego zapisu rozmowy na dysku, co dziś oznacza Claude Code i Codex. U innych dostawców ten jeden punkt wejścia mówi, że nie ma czego czytać.

Ile to kosztuje?

Read Aloud to funkcja Pro, rozliczana z kredytów głosowych, które już są wspólne z Voice Mode i dyktowaniem, odnawianych co miesiąc. Nie ma osobnego limitu. Kredyty są sprawdzane przed żądaniem, więc nic nie schodzi z pustego stanu konta, a własny klucz API OpenAI możesz podpiąć, by czytania szły na Twoje konto bez kredytów.

W jakim języku czyta?

W języku dokumentu. Model głosowy czyta to, co ma przed sobą, więc angielskie README zostaje angielskie, nawet gdy Twój interfejs AgentsRoom jest po polsku. Wersja skrócona jest wyjątkiem: streszczenie powstaje w języku Twojego interfejsu, a potem jest wypowiadane.

Czy mogę wybrać głos?

Tak. Read Aloud używa głosu, który już wybrałeś dla Voice Mode w ustawieniach AgentsRoom, więc ustawiasz go raz i korzystają z niego obie funkcje.

Czy dwie rzeczy mogą być czytane naraz?

Nie, i to celowo. Na całą aplikację przypada jeden odtwarzacz: uruchomienie nowego czytania zatrzymuje trwające. Dwa syntetyczne głosy mówiące jeden przez drugi to nigdy nie było niczyje marzenie.

Dobrze łączy się z

Daj oczom odpocząć

Pobierz AgentsRoom i każ przeczytać sobie następny changelog.

Za darmoPobierz AgentsRoom

Aplikacja towarzysząca: monitoruj agentów w podróży

Użyj Claude, Codex, Antigravity CLI lub innego dostawcy AI.

Zainstaluj rozszerzenie
Chrome Web Store

Wysyłaj bugi i prośby bezpośrednio do swojego publicznego backlogu.

Spojrzenie na AgentsRoom w akcji.

Wiele projektów
Multi-provider
Wielu agentów
Status na żywo
Diff i commit
Aplikacja mobilna
Podgląd na żywo
Zespoły agentów
Testy w przeglądarce
Dev oparta na backlogu
Biblioteka promptów
Biblioteka umiejętności
Zobacz wszystkie funkcje