Leitura em voz alta

Pare de ler tudo.
Ouça.

O Read Aloud é a síntese de voz integrada ao AgentsRoom. Um clique no alto-falante e um arquivo markdown, uma seleção do terminal ou a última resposta do seu agente é lida em voz alta com uma voz sintética natural, com barra de progresso, pausa e parada.

Sem paciência para o documento inteiro? O mesmo botão lê para você uma versão condensada, e você escolhe quanto tempo ela fala: dez segundos, trinta ou um minuto. Um changelog de quarenta minutos resolvido em dez segundos.

Com som: selecione a resposta do agente, clique em Ouvir e uma voz sintética lê o texto. A pastilha na barra de estado mostra o progresso e o tempo restante, com pausa e paragem.

Programar é ler. Um README que você não escreveu, um changelog de trezentas linhas, uma especificação que caiu na sua caixa de entrada, uma resposta do agente que explica uma migração em quatro parágrafos. Seus olhos engolem tudo, o dia inteiro, e às seis da tarde eles não aguentam mais. O Read Aloud tira esse peso deles.

A ideia veio de um usuário. Ele é disléxico, usa o AgentsRoom todo dia e copiava e colava a pré-visualização markdown em uma ferramenta de texto para voz separada para dar conta da documentação. Copiar, trocar de aplicativo, colar, ouvir, voltar, achar onde você tinha parado. Então a voz entrou no app: o botão do alto-falante fica bem ao lado do botão Source na pré-visualização de arquivo, e o documento é lido onde ele já está.

Não é um leitor de tela e não é uma certificação de acessibilidade. Ele lê em voz alta um texto que você escolheu, com barra de progresso e pausa. Essa promessa estreita é justamente a graça: é a única coisa que ele faz, e você pode contar com ela.

CHANGELOG.md
OuvirResumo

Os créditos de voz agora são compartilhados entre o ditado, o Voice Mode e a leitura em voz alta.

O painel de seleção do terminal ganha um botão Ouvir para tudo o que você marcar.

A barra de status mantém uma pastilha de controle enquanto houver uma leitura rodando.

3:20

A pré-visualização markdown lendo um changelog em voz alta e, depois, o mesmo documento condensado em um resumo falado.

Quatro lugares para apertar o play

O mesmo leitor em todo lugar, uma leitura por vez. Começar uma segunda interrompe a primeira, porque duas vozes falando por cima uma da outra nunca foi a ideia.

Um arquivo markdown, inteiro

Abra qualquer arquivo markdown na pré-visualização e um botão de alto-falante aparece ao lado de Source. Clique e o documento é lido do começo. Um README, um CLAUDE.md, uma especificação, um changelog, uma nota de arquitetura. Este é o ponto de entrada para o qual o recurso foi construído.

O que você marcou no terminal

Selecione texto em um terminal de agente e o painel de seleção abre com um botão Ouvir. Ele lê exatamente o que você marcou: um parágrafo de uma resposta, a explicação de um erro, a parte de uma saída longa que realmente importa para você. O painel se fecha sozinho e a leitura continua.

A última resposta do seu agente

Clique com o botão direito em um terminal de agente e escolha a entrada de leitura. A resposta vem da transcrição de conversa que o agente deixa em disco, não de uma raspagem do terminal, então você ouve a mensagem de verdade e não uma tela cheia de enfeites da CLI. O agente terminou enquanto você estava em outra janela: ouça a resposta em vez de subir o scroll.

Um resumo ou uma explicação da IA

O painel de seleção já sabe resumir ou explicar um trecho marcado. Quando a resposta chega, um botão de alto-falante no balão do resultado lê tudo em voz alta. Pergunte o que significa um stack trace hostil e ouça a explicação enquanto continua digitando.

Leitura em voz alta no AgentsRoom: o botão Ouvir do painel de seleção do terminal abre um menu de conversão de texto em fala com quatro níveis, Ler tudo palavra por palavra, ou um resumo de IA falado de cerca de 10, 30 ou 60 segundos, sobre a resposta de um agente Claude Code.
Um clique em Ouvir e a resposta selecionada é lida em voz alta, palavra por palavra. A seta ao lado abre as três leituras condensadas: um resumo escrito pela IA para durar cerca de dez, trinta ou sessenta segundos, e depois falado.

Ele lê prosa, não pontuação

Markdown mandado cru para um motor de texto para voz é impossível de ouvir. O Read Aloud limpa antes.

Descartado antes da leitura
## Release 1.14
The reader now shares its credits.
```ts
export const MAX = 20000;
```
| Plan | Voice |
src/services/readAloud.ts
---
- Pause and **resume** anytime.
Falado

Release 1.14.

The reader now shares its credits.

Pause and resume anytime.

O que chega até a voz: prosa e nada mais. O código, as tabelas e os caminhos de arquivo soltos são descartados antes de uma única palavra ser pronunciada.

Mande um documento técnico do jeito que ele está para um motor de voz e você recebe «crase barra src barra services barra foo ponto ts crase», depois uma tabela markdown lida célula por célula, e depois uma linha de separação anunciada como uma rajada de traços. Ninguém ouve isso duas vezes. Então, antes de qualquer palavra ser pronunciada, o texto passa por uma limpeza.

Os blocos de código delimitados somem inteiros. As tabelas markdown, as linhas horizontais e as linhas que são só um caminho de arquivo também vão embora. Os marcadores de negrito, itálico e código inline são retirados e as palavras ficam. Um link vira o rótulo dele, uma imagem desaparece. Os títulos e os itens de lista ganham um ponto final quando não têm, senão a voz emenda uma lista inteira em uma frase só, sem respirar.

Falado
  • Os parágrafos e a prosa
  • Os títulos e os itens de lista, como frases de verdade
  • Os rótulos dos links, sem a URL
  • As palavras em negrito e itálico, sem os marcadores
Descartado antes da leitura
  • Os blocos de código
  • As tabelas markdown
  • As linhas que são só um caminho de arquivo
  • As linhas horizontais e os separadores

Ou ouça a versão curta

Mesmo botão, segunda opção: é escrito um resumo com IA que cabe na duração falada que você escolher, e é esse resumo que é lido em voz alta.

Tem documento que não merece uma leitura integral. Um changelog do qual você só quer o formato geral. Uma especificação da qual você precisa do essencial antes de uma reunião. Uma resposta do agente que levou quatro parágrafos para dizer uma coisa só. A leitura condensada serve para isso: o AgentsRoom resume o texto na duração que você pediu e depois lê esse resumo em voz alta.

Você compra segundos, não palavras. A duração falada é a única unidade que importa para quem escuta, e por acaso é também a unidade em que você paga, porque a síntese de voz é cobrada por caractere. Dez segundos do essencial no lugar de vinte e dois minutos de documento é um erro de arredondamento nos seus créditos.

Três durações, um clique

10s

Dez segundos. A manchete: sobre o que é o documento e o que mudou. É o valor padrão.

30s

Trinta segundos. O essencial com os motivos, o suficiente para decidir se a leitura completa vale o seu tempo.

60s

Um minuto. Um briefing de verdade: a estrutura do documento, os pontos principais e as ressalvas.

A leitura condensada em um clique usa a duração que você definiu nas configurações do AgentsRoom. Dez segundos assim que você instala.

  • ·O resumo é escrito no idioma da sua interface: um usuário brasileiro recebe um resumo em português de um documento em inglês.
  • ·Ele usa sua cota mensal de resumos com IA para o texto e depois os créditos de voz para o áudio.
  • ·O markdown é retirado antes de o resumo ser escrito, para que o resumidor gaste o orçamento na prosa e não em blocos de código.

Um player que se comporta

Tudo o que você espera de uma coisa que vai falar por vinte minutos.

Progresso e tempo restante
Uma barra se enche conforme a leitura avança, ponderada por caracteres, ao lado do tempo restante em minutos e segundos. Você sabe se faltam dois minutos ou doze.
Pausar, retomar, parar
Pause no meio de uma frase e retome exatamente de onde parou. Parar mata a leitura na hora, incluindo o pedaço que estava sendo baixado.
Uma pastilha de controle na barra de status
Uma leitura sobrevive à janela que a começou. Feche a pré-visualização do arquivo e a voz continua, então uma pastilha aparece na barra de status com o progresso, a pausa e a parada. É o controle que está sempre ali, e ele some assim que a leitura termina.
Lido no idioma em que está escrito
Quem decide o idioma é o documento, não a sua interface. Um README em inglês continua em inglês para um usuário brasileiro, porque o modelo de voz lê o que está de fato na frente dele.

Para quem isso serve de verdade

Sem grandes declarações. Quatro situações em que as pessoas apertam o botão.

Desenvolvedores disléxicos, e qualquer pessoa que leia devagar. O inglês técnico escrito é o mais difícil de decodificar, e uma voz sintética elimina a etapa da decodificação. Foi daí que o recurso veio e é o caso que ele atende melhor.

Os olhos que já cansaram. Meio da tarde, terceira tela de documentação, concentração perdida. Ouvir uma especificação enquanto você levanta e se espreguiça não é truque de produtividade, só dói menos.

O agente que roda por muito tempo. Ele trabalhou onze minutos, finalmente respondeu, e a resposta tem quatro parágrafos. Botão direito, você ouve, e continua o que estava fazendo.

Revisar a sua própria prosa. Um README, uma nota de versão, uma resposta de suporte: ouvir o texto lido pega a frase torta que seus olhos já pararam de enxergar.

O que ele não faz

A lista honesta, para nada te surpreender depois da instalação.

  • Não é um leitor de tela. Ele não narra a interface, não segue o seu foco de teclado e não reivindica nenhuma conformidade de acessibilidade. Ele lê um texto que você escolheu.
  • Uma leitura é limitada a 20.000 caracteres, mais ou menos vinte e dois minutos de fala. Depois disso a leitura é truncada e a interface avisa, porque a voz é cobrada por caractere e um clique em um arquivo enorme não pode esvaziar um mês de créditos em silêncio.
  • Ler um arquivo, uma seleção ou um resumo funciona com qualquer provedor de agentes. Ler a última resposta do agente precisa de uma transcrição de conversa endereçável, o que hoje significa Claude Code e Codex; os outros provedores avisam que não há nada para ler em vez de adivinhar.
  • Precisa de conexão. A voz é sintetizada no servidor, então não existe leitura offline, e um documento que só tem código ou caminhos de arquivo fica sem nada para dizer depois da limpeza.

Pro, com seus créditos de voz

A mesma carteira do Voice Mode e do ditado, nenhuma cota nova para acompanhar.

O Read Aloud é um recurso Pro. O Voice Mode e o ditado estão abertos para qualquer conta logada porque uma resposta falada é curta, cerca de novecentos caracteres. Um documento tem dezenas de milhares. Essa diferença de consumo é toda a razão da trava de plano, e ela tem a própria linha na tabela comparativa Free/Plus/Pro.

A cobrança usa os créditos de voz que já estão na sua conta, compartilhados com o Voice Mode e o ditado, recarregados no começo de cada mês. Os créditos são conferidos antes de a requisição de voz ser enviada, então nenhuma chamada é feita contra um saldo vazio. Você também pode conectar sua própria chave de API da OpenAI: aí as leituras rodam na sua conta e custam zero crédito.

Free
Não incluído
Plus
Não incluído
Pro
Créditos de voz mensais

Os créditos de voz são compartilhados entre a leitura em voz alta, o Voice Mode e o ditado por voz.

FAQ

O que é exatamente o Read Aloud?

Um leitor de texto para voz dentro do AgentsRoom. Você escolhe um texto escrito (um arquivo markdown, uma seleção do terminal, a última resposta do seu agente) e ele é lido em voz alta com uma voz sintética natural, com barra de progresso, pausa e parada. É o caminho contrário do ditado por voz, que transforma a sua fala em texto.

Dá para ouvir um arquivo markdown, tipo um README?

Dá, e esse é o ponto de entrada principal. Abra o arquivo na pré-visualização do AgentsRoom e clique no botão de alto-falante ao lado de Source. O documento inteiro é lido do começo: README, CLAUDE.md, changelog, nota de arquitetura, especificação. A sintaxe markdown é limpa antes, então você ouve o texto e não a marcação.

Ele lê código em voz alta?

Não, e isso é de propósito. Os blocos de código são retirados antes de qualquer palavra ser pronunciada, junto com as tabelas markdown, as linhas horizontais e as linhas que são só um caminho de arquivo. Código falado é impossível de ouvir, então o Read Aloud fica com a prosa e joga o resto fora.

Dá para ouvir um resumo em vez do documento inteiro?

Dá. Todos os pontos de entrada oferecem uma leitura condensada: primeiro é escrito um resumo com IA, ajustado à duração falada que você escolheu, e é esse resumo que é falado. Existem três durações, mais ou menos dez segundos, trinta segundos e um minuto, com dez segundos como padrão. Isso transforma um changelog longo em um resumo curto em áudio e custa muito menos crédito de voz do que ler o texto completo. O resumo é escrito no idioma da sua interface.

Isso ajuda se eu for disléxico?

Foi daí que o recurso veio. Um usuário disléxico copiava e colava a pré-visualização markdown do AgentsRoom em uma ferramenta de texto para voz externa, então a voz foi trazida para dentro do app. Ele elimina a etapa de decodificação na documentação técnica. Não é um leitor de tela e não reivindica nenhuma conformidade, mas para ler documentos ele faz exatamente o trabalho que foi pedido.

Qual o tamanho de documento que ele consegue ler?

Uma leitura é limitada a 20.000 caracteres de texto pronunciável, mais ou menos vinte e dois minutos. Depois disso a leitura é truncada e a interface avisa que ela foi encurtada. O limite existe porque a voz é cobrada por caractere: sem ele, um clique em um arquivo enorme poderia esvaziar um mês de créditos antes de você reagir.

O que acontece se eu fechar o arquivo durante a leitura?

A leitura continua. O player vive fora da janela que o iniciou, e uma pastilha de controle aparece na barra de status com o progresso, o tempo restante, a pausa e a parada. É o controle sempre disponível, e ele some quando a leitura termina.

Funciona com todos os agentes?

Ler um arquivo, uma seleção ou um resumo com IA funciona com qualquer provedor, porque o texto vem da sua tela. Ler a última resposta do agente precisa de uma transcrição de conversa endereçável em disco, o que hoje significa Claude Code e Codex. Com os outros provedores, esse ponto de entrada avisa que não há nada para ler.

Quanto custa?

O Read Aloud é um recurso Pro, cobrado nos créditos de voz que você já compartilha com o Voice Mode e o ditado, recarregados todo mês. Não existe cota separada. Os créditos são conferidos antes da requisição, então nada é gasto contra um saldo vazio, e você pode conectar sua própria chave de API da OpenAI para rodar as leituras na sua conta sem gastar crédito.

Em que idioma ele lê?

No idioma do documento. O modelo de voz lê o que está na frente dele, então um README em inglês continua em inglês mesmo com a sua interface do AgentsRoom em português. A leitura condensada é a exceção: o resumo é escrito no idioma da sua interface e depois falado.

Dá para escolher a voz?

Dá. O Read Aloud usa a voz que você já escolheu para o Voice Mode nas configurações do AgentsRoom, então você ajusta uma vez e os dois recursos usam a mesma.

Dá para ler duas coisas ao mesmo tempo?

Não, e é de propósito. Existe um único leitor para o app inteiro: começar uma leitura nova interrompe a que está rodando. Duas vozes sintéticas falando por cima uma da outra nunca foi ideia de ninguém.

Você também pode gostar

Dê um descanso para os seus olhos

Baixe o AgentsRoom e mande ler o seu próximo changelog em voz alta.

GrátisBaixar AgentsRoom

App complementar: acompanhe seus agentes em qualquer lugar

Use Claude, Codex, Antigravity CLI ou outro provedor de IA.

Instalar a extensão
Chrome Web Store

Envie bugs e pedidos direto para o seu backlog público.

Uma visão do AgentsRoom em ação.

Multi-projetos
Multi-provedor
Multi-agentes
Status ao vivo
Diff e commit
App mobile
Preview ao vivo
Equipes de agentes
Testes no navegador
Dev guiada por backlog
Biblioteca de prompts
Biblioteca de skills
Ver todas as funcionalidades