朗读

别再什么都用眼睛读。
听就好。

Read Aloud 是内置在 AgentsRoom 里的文字转语音。点一下喇叭,一个 Markdown 文件、终端里选中的一段,或者代理的最后一条回复,就会用自然的合成语音朗读出来,带进度条、暂停和停止。

有时候你不想听完整篇。同一个按钮会改成给你念一份压缩版,念多久由你定:十秒、三十秒,或者一分钟。四十分钟的 changelog,十秒钟讲完。

请打开声音。选中智能体的回答,点击“收听”,合成语音就会念出来。状态栏的小标签显示进度和剩余时间,可以暂停和停止。

写代码就是在读东西。一份不是你写的 README,一份三百行的 changelog,一份掉进收件箱的规格文档,一条用四段话解释迁移的代理回复。这些全靠眼睛,一整天,到傍晚六点它们就撑不住了。Read Aloud 就是把这份负担从眼睛上拿走。

这个功能来自一位用户。他有阅读障碍,每天都在用 AgentsRoom,为了啃完文档,他把 Markdown 预览复制粘贴到另一个文字转语音工具里。复制、切换应用、粘贴、听、回来、再找回自己读到哪。于是声音搬进了应用里:喇叭按钮就在文件预览里 Source 按钮的旁边,文档在它本来就在的地方被念出来。

它不是屏幕阅读器,也不是什么无障碍认证。它把你选中的一段文字念出来,带进度条和暂停。这个承诺窄,而窄正是重点:这是你可以放心交给它的那一件事。

CHANGELOG.md
摘要

语音额度现在由听写、Voice Mode 和朗读共用。

终端的选择面板多了一个「听」按钮,你选中什么它就念什么。

只要还在朗读,状态栏就一直留着一个控制小条。

3:20

Markdown 预览正在朗读一份 changelog,接着把同一份文档压成语音摘要。

四个可以按下播放的地方

到处都是同一个播放器,一次只朗读一段。开第二段会停掉第一段,因为两个声音抢着说话从来不是谁想要的。

一整个 Markdown 文件

在预览里打开任意 Markdown 文件,Source 旁边就会出现一个喇叭按钮。点它,文档从头开始被念出来。README、CLAUDE.md、规格文档、changelog、架构笔记。这个功能当初就是为这个入口做的。

你在终端里选中的那段

在代理终端里选中文字,选择面板就会带着「听」按钮打开。它念的正是你选中的内容:回复里的一段、一处报错解释、长输出里你真正在意的那部分。面板会自己收起来,朗读继续。

代理的最后一条回复

在代理终端里点右键,选朗读那一项。这条回复取自代理写在磁盘上的对话记录,而不是从屏幕上刮下来的,所以你听到的是真正的消息,不是一屏 CLI 的装饰。你在别的窗口忙的时候代理干完了:与其往回滚,不如听一遍。

一段 AI 摘要或解释

选择面板本来就能把选中的一块内容做摘要或解释。回复出来之后,结果气泡上的喇叭按钮会把它念给你听。问问那条难缠的调用栈到底什么意思,然后一边继续打字一边听解释。

AgentsRoom 的朗读功能:终端选择面板中的“收听”按钮会打开一个四档语音合成菜单,可以逐字朗读全文,也可以选择约 10 秒、30 秒或 60 秒的 AI 语音摘要,背景是 Claude Code 智能体的回答。
点击“收听”,选中的回答就会被逐字朗读出来。旁边的箭头可以打开三种精简朗读:AI 会把内容压缩成大约十秒、三十秒或六十秒的摘要,然后朗读出来。

它念的是正文,不是标点

把 Markdown 原样丢给语音合成引擎,根本没法听。Read Aloud 会先把它清干净。

念之前先丢掉
## Release 1.14
The reader now shares its credits.
```ts
export const MAX = 20000;
```
| Plan | Voice |
src/services/readAloud.ts
---
- Pause and **resume** anytime.
会念出来

Release 1.14.

The reader now shares its credits.

Pause and resume anytime.

能走到声音那一步的只有正文。代码、表格、只写着一个文件路径的行,在第一个字被念出来之前就被丢掉了。

把一份技术文档直接送进语音引擎,你会听到「反引号 斜杠 src 斜杠 services 斜杠 foo 点 ts 反引号」,接着是一张 Markdown 表格被一格一格念完,再接着一条分隔线被念成一长串破折号。这种东西没人听第二遍。所以在任何一个字被念出来之前,文本会先过一遍清理。

用代码围栏包起来的块整块删掉。Markdown 表格、水平分隔线、整行只有一个文件路径的行也一样。粗体、斜体和行内代码的标记被剥掉,里面的字留下。链接只剩标签,图片直接消失。标题和列表项如果没有句号就补一个,否则声音会把一整串条目连成一句不换气的长句。

会念出来
  • 段落和正文
  • 标题和列表项,当成真正的句子
  • 链接的标签,不带 URL
  • 粗体和斜体的字,不带标记
念之前先丢掉
  • 代码围栏块
  • Markdown 表格
  • 只有一个文件路径的行
  • 水平线和分隔线

或者听个短版

同一个按钮的第二个选项:AI 按你选的朗读时长写出一份摘要,被念出来的就是那份摘要。

有些文档不值得整篇听完。一份你只想知道大概长什么样的 changelog。一份开会前只需要抓住要点的规格文档。一条用四段话说了一件事的代理回复。摘要朗读就是干这个的:AgentsRoom 把文字缩到你要的时长,再把它念出来。

你买的是秒,不是词。对听的人来说,唯一算数的单位就是朗读时长,而这恰好也是你付钱的单位,因为语音合成按字符计费。用十秒听个要点,而不是二十二分钟的整篇文档,这点差别在你的额度里四舍五入就没了。

三种时长,一次点击

10s

十秒。只给标题:这份文档在讲什么,什么变了。这是默认值。

30s

三十秒。要点连同它的理由,够你判断整篇值不值得花这个时间。

60s

一分钟。一份真正的简报:文档的结构、主要论点,以及那些需要留意的地方。

一键摘要朗读用的是你在 AgentsRoom 设置里定好的时长。开箱默认十秒。

  • ·摘要用你的界面语言来写,所以界面是中文的话,一份英文文档也会给你一段中文要点。
  • ·文字那部分走你每月的 AI 摘要额度,音频那部分走语音额度。
  • ·写摘要之前会先剥掉 Markdown,好让做摘要的那一端把预算花在正文上,而不是花在代码围栏上。

一个规矩的播放器

一个要说上二十分钟的东西该有的,都有。

进度和剩余时间
朗读往前走,进度条就往前填,按字符数加权,旁边是以分和秒显示的剩余时间。你知道自己还剩两分钟还是十二分钟。
暂停、继续、停止
在一句话中间暂停,回来时就从停住的地方接上。停止会立刻掐断朗读,连正在下载的那一段也一起停。
状态栏里的控制小条
一段朗读比启动它的那个窗口活得久。关掉文件预览,声音还在继续,于是状态栏里出现一个小条,带着进度、暂停和停止。它是那个永远都在的控制,而朗读一结束它就消失。
文档写的是什么语言就念什么语言
定语言的是文档,不是你的界面。界面是中文的用户打开一份英文 README,它照样是英文,因为语音模型念的是眼前真正摆着的东西。

它到底是给谁用的

不说大话。四个人们真的会按下这个按钮的场景。

有阅读障碍的开发者,以及所有读得慢的人。写成文字的技术英语是最难解码的一种,而合成语音把解码这一步整个拿掉了。这个功能就是从这儿来的,也是它服务得最好的场景。

已经受够了的眼睛。傍晚,文档翻到第三屏,注意力没了。站起来伸个懒腰的同时听一份规格文档,这不是什么效率技巧,只是没那么难受而已。

跑了很久的代理。它干了十一分钟,终于回话了,而这条回复有四段。点右键,听,你手上的事继续做。

回头看自己写的东西。一份 README、一条发布说明、一条给用户的支持回复:听它被念出来,能抓到那句你的眼睛已经看不见的别扭句子。

它不做的事

一份老实的清单,免得你装完之后被惊到。

  • 它不是屏幕阅读器。它不朗读界面,不跟随你的键盘焦点,也不声称符合任何无障碍标准。它念的是你选中的一段文字。
  • 一次朗读上限是 20,000 个字符,大约二十二分钟的语音。超过就会被截断,界面会明说。因为语音合成按字符计费,在一个巨大的文件上点一下,不该悄无声息地把一个月的额度掏空。
  • 念一个文件、一段选中内容或一份摘要,在所有代理提供商上都能用。念代理的最后一条回复需要一份可寻址的对话记录,今天这意味着 Claude Code 和 Codex;别的提供商会告诉你没有可读的内容,而不是去猜。
  • 它需要联网。语音在服务端合成,所以没有离线朗读;而一份只有代码或者只有文件路径的文档,清理完之后已经没有什么可念的了。

Pro,走你的语音额度

和 Voice Mode、语音听写共用同一个钱包,没有新的配额要盯。

Read Aloud 是 Pro 功能。Voice Mode 和语音听写对任何登录账号开放,因为一次口头回复很短,大约九百个字符。而一份文档是几万字符。这个消耗量的差距就是设这道套餐门槛的全部理由,它在 Free / Plus / Pro 对比表里也有自己的一行。

计费走的是你账号里已有的语音额度,和 Voice Mode、语音听写共用,每月月初补满。额度会在发出语音请求之前先查一遍,所以不会在余额为零时还去调用。你也可以挂上自己的 OpenAI API 密钥:这样朗读跑在你自己的账号上,一点额度都不花。

Free
不包含
Plus
不包含
Pro
每月语音额度

语音额度由 Read Aloud、Voice Mode 和语音听写共用。

FAQ

Read Aloud 到底是什么?

AgentsRoom 里的一个文字转语音朗读器。你挑一段写好的文字(一个 Markdown 文件、终端里选中的一段、代理的最后一条回复),它就用自然的合成语音念出来,带进度条、暂停和停止。它和语音听写方向正好相反:听写是把你说的话变成文字。

我能听一个 Markdown 文件吗,比如 README?

能,这就是主要入口。在 AgentsRoom 预览里打开文件,点 Source 旁边的喇叭按钮。整份文档会从头念到尾:README、CLAUDE.md、changelog、架构笔记、规格文档。Markdown 语法会先被清理,所以你听到的是正文,不是标记。

它会把代码念出来吗?

不会,这是故意的。代码围栏块会连同 Markdown 表格、水平线和只有一个文件路径的行,在任何内容被念出来之前先被删掉。念出来的代码根本没法听,所以 Read Aloud 留下正文,其余丢掉。

我能只听摘要,不听整篇吗?

可以。每个入口都提供摘要朗读:AI 先按你选的朗读时长写出一份摘要,被念出来的就是那份摘要。时长有三档,大约十秒、三十秒和一分钟,默认十秒。它把一份长 changelog 变成一段短的语音要点,花掉的语音额度也远少于念完整篇。摘要用你的界面语言来写。

如果我有阅读障碍,这个有用吗?

这个功能就是从这儿来的。一位有阅读障碍的用户一直把 AgentsRoom 的 Markdown 预览复制粘贴到外部的文字转语音工具里,于是我们把声音搬进了应用。它把读技术文档时解码那一步去掉了。它不是屏幕阅读器,也不声称符合什么标准,但就读文档这件事而言,它把交给它的活干得很好。

它最多能念多长的文档?

一次朗读的上限是 20,000 个可朗读字符,大约二十二分钟。超过就会被截断,界面会告诉你内容被缩短了。这个上限存在是因为语音合成按字符计费:没有它,在一个巨大的文件上点一下,可能在你反应过来之前就把一个月的额度掏空。

念到一半我把文件关了会怎样?

朗读继续。播放器活在启动它的那个窗口之外,状态栏里会出现一个控制小条,带着进度、剩余时间、暂停和停止。它是那个随时都能用的控制,朗读结束时就消失。

它对所有代理都管用吗?

念文件、念选中内容、念 AI 摘要,对任何提供商都管用,因为文字来自你的屏幕。念代理的最后一条回复需要磁盘上有一份可寻址的对话记录,今天这意味着 Claude Code 和 Codex。用别的提供商时,只有这一个入口会告诉你没有可读的内容。

它要花多少钱?

Read Aloud 是 Pro 功能,按已经和 Voice Mode、语音听写共用的语音额度计费,每月补满。没有单独的配额。额度在请求之前就会检查,所以余额为零时不会被扣掉什么;你也可以挂上自己的 OpenAI API 密钥,让朗读跑在你的账号上,一点额度都不花。

它用什么语言念?

文档的语言。语音模型念的是眼前的东西,所以哪怕你的 AgentsRoom 界面是中文,一份英文 README 也还是英文。摘要朗读是例外:摘要先用你的界面语言写出来,然后再念。

声音能选吗?

能。Read Aloud 用的是你已经在 AgentsRoom 设置里为 Voice Mode 选好的那个声音,设一次,两个功能一起用。

能同时念两段内容吗?

不能,这是故意的。整个应用只有一个朗读器:开始一段新的朗读会停掉正在进行的那一段。两个合成语音抢着说话,从来没有人想要。

你可能也会喜欢

给眼睛放个假

下载 AgentsRoom,让下一份 changelog 念给你听。

免费下载 AgentsRoom

配套应用:随时随地监控你的 Agent

使用 Claude、Codex、Antigravity CLI 或其他 AI 提供商。

获取扩展程序
Chrome Web Store

把 Bug 和需求直接发送到您的公开待办清单。

AgentsRoom 实际运行一瞥。

多项目管理
多供应商
多代理运行
实时状态
文件差异与提交
移动应用
实时预览
代理团队
浏览器自动化
Backlog 驱动开发
提示词库
技能库
查看所有功能