别再什么都用眼睛读。
听就好。
Read Aloud 是内置在 AgentsRoom 里的文字转语音。点一下喇叭,一个 Markdown 文件、终端里选中的一段,或者代理的最后一条回复,就会用自然的合成语音朗读出来,带进度条、暂停和停止。
有时候你不想听完整篇。同一个按钮会改成给你念一份压缩版,念多久由你定:十秒、三十秒,或者一分钟。四十分钟的 changelog,十秒钟讲完。
请打开声音。选中智能体的回答,点击“收听”,合成语音就会念出来。状态栏的小标签显示进度和剩余时间,可以暂停和停止。
写代码就是在读东西。一份不是你写的 README,一份三百行的 changelog,一份掉进收件箱的规格文档,一条用四段话解释迁移的代理回复。这些全靠眼睛,一整天,到傍晚六点它们就撑不住了。Read Aloud 就是把这份负担从眼睛上拿走。
这个功能来自一位用户。他有阅读障碍,每天都在用 AgentsRoom,为了啃完文档,他把 Markdown 预览复制粘贴到另一个文字转语音工具里。复制、切换应用、粘贴、听、回来、再找回自己读到哪。于是声音搬进了应用里:喇叭按钮就在文件预览里 Source 按钮的旁边,文档在它本来就在的地方被念出来。
它不是屏幕阅读器,也不是什么无障碍认证。它把你选中的一段文字念出来,带进度条和暂停。这个承诺窄,而窄正是重点:这是你可以放心交给它的那一件事。
语音额度现在由听写、Voice Mode 和朗读共用。
终端的选择面板多了一个「听」按钮,你选中什么它就念什么。
只要还在朗读,状态栏就一直留着一个控制小条。
Markdown 预览正在朗读一份 changelog,接着把同一份文档压成语音摘要。
四个可以按下播放的地方
到处都是同一个播放器,一次只朗读一段。开第二段会停掉第一段,因为两个声音抢着说话从来不是谁想要的。
一整个 Markdown 文件
在预览里打开任意 Markdown 文件,Source 旁边就会出现一个喇叭按钮。点它,文档从头开始被念出来。README、CLAUDE.md、规格文档、changelog、架构笔记。这个功能当初就是为这个入口做的。
你在终端里选中的那段
在代理终端里选中文字,选择面板就会带着「听」按钮打开。它念的正是你选中的内容:回复里的一段、一处报错解释、长输出里你真正在意的那部分。面板会自己收起来,朗读继续。
代理的最后一条回复
在代理终端里点右键,选朗读那一项。这条回复取自代理写在磁盘上的对话记录,而不是从屏幕上刮下来的,所以你听到的是真正的消息,不是一屏 CLI 的装饰。你在别的窗口忙的时候代理干完了:与其往回滚,不如听一遍。
一段 AI 摘要或解释
选择面板本来就能把选中的一块内容做摘要或解释。回复出来之后,结果气泡上的喇叭按钮会把它念给你听。问问那条难缠的调用栈到底什么意思,然后一边继续打字一边听解释。

它念的是正文,不是标点
把 Markdown 原样丢给语音合成引擎,根本没法听。Read Aloud 会先把它清干净。
Release 1.14.
The reader now shares its credits.
Pause and resume anytime.
能走到声音那一步的只有正文。代码、表格、只写着一个文件路径的行,在第一个字被念出来之前就被丢掉了。
把一份技术文档直接送进语音引擎,你会听到「反引号 斜杠 src 斜杠 services 斜杠 foo 点 ts 反引号」,接着是一张 Markdown 表格被一格一格念完,再接着一条分隔线被念成一长串破折号。这种东西没人听第二遍。所以在任何一个字被念出来之前,文本会先过一遍清理。
用代码围栏包起来的块整块删掉。Markdown 表格、水平分隔线、整行只有一个文件路径的行也一样。粗体、斜体和行内代码的标记被剥掉,里面的字留下。链接只剩标签,图片直接消失。标题和列表项如果没有句号就补一个,否则声音会把一整串条目连成一句不换气的长句。
- 段落和正文
- 标题和列表项,当成真正的句子
- 链接的标签,不带 URL
- 粗体和斜体的字,不带标记
- 代码围栏块
- Markdown 表格
- 只有一个文件路径的行
- 水平线和分隔线
或者听个短版
同一个按钮的第二个选项:AI 按你选的朗读时长写出一份摘要,被念出来的就是那份摘要。
有些文档不值得整篇听完。一份你只想知道大概长什么样的 changelog。一份开会前只需要抓住要点的规格文档。一条用四段话说了一件事的代理回复。摘要朗读就是干这个的:AgentsRoom 把文字缩到你要的时长,再把它念出来。
你买的是秒,不是词。对听的人来说,唯一算数的单位就是朗读时长,而这恰好也是你付钱的单位,因为语音合成按字符计费。用十秒听个要点,而不是二十二分钟的整篇文档,这点差别在你的额度里四舍五入就没了。
三种时长,一次点击
十秒。只给标题:这份文档在讲什么,什么变了。这是默认值。
三十秒。要点连同它的理由,够你判断整篇值不值得花这个时间。
一分钟。一份真正的简报:文档的结构、主要论点,以及那些需要留意的地方。
一键摘要朗读用的是你在 AgentsRoom 设置里定好的时长。开箱默认十秒。
- ·摘要用你的界面语言来写,所以界面是中文的话,一份英文文档也会给你一段中文要点。
- ·文字那部分走你每月的 AI 摘要额度,音频那部分走语音额度。
- ·写摘要之前会先剥掉 Markdown,好让做摘要的那一端把预算花在正文上,而不是花在代码围栏上。
一个规矩的播放器
一个要说上二十分钟的东西该有的,都有。
它到底是给谁用的
不说大话。四个人们真的会按下这个按钮的场景。
有阅读障碍的开发者,以及所有读得慢的人。写成文字的技术英语是最难解码的一种,而合成语音把解码这一步整个拿掉了。这个功能就是从这儿来的,也是它服务得最好的场景。
已经受够了的眼睛。傍晚,文档翻到第三屏,注意力没了。站起来伸个懒腰的同时听一份规格文档,这不是什么效率技巧,只是没那么难受而已。
跑了很久的代理。它干了十一分钟,终于回话了,而这条回复有四段。点右键,听,你手上的事继续做。
回头看自己写的东西。一份 README、一条发布说明、一条给用户的支持回复:听它被念出来,能抓到那句你的眼睛已经看不见的别扭句子。
它不做的事
一份老实的清单,免得你装完之后被惊到。
- 它不是屏幕阅读器。它不朗读界面,不跟随你的键盘焦点,也不声称符合任何无障碍标准。它念的是你选中的一段文字。
- 一次朗读上限是 20,000 个字符,大约二十二分钟的语音。超过就会被截断,界面会明说。因为语音合成按字符计费,在一个巨大的文件上点一下,不该悄无声息地把一个月的额度掏空。
- 念一个文件、一段选中内容或一份摘要,在所有代理提供商上都能用。念代理的最后一条回复需要一份可寻址的对话记录,今天这意味着 Claude Code 和 Codex;别的提供商会告诉你没有可读的内容,而不是去猜。
- 它需要联网。语音在服务端合成,所以没有离线朗读;而一份只有代码或者只有文件路径的文档,清理完之后已经没有什么可念的了。
Pro,走你的语音额度
和 Voice Mode、语音听写共用同一个钱包,没有新的配额要盯。
Read Aloud 是 Pro 功能。Voice Mode 和语音听写对任何登录账号开放,因为一次口头回复很短,大约九百个字符。而一份文档是几万字符。这个消耗量的差距就是设这道套餐门槛的全部理由,它在 Free / Plus / Pro 对比表里也有自己的一行。
计费走的是你账号里已有的语音额度,和 Voice Mode、语音听写共用,每月月初补满。额度会在发出语音请求之前先查一遍,所以不会在余额为零时还去调用。你也可以挂上自己的 OpenAI API 密钥:这样朗读跑在你自己的账号上,一点额度都不花。
语音额度由 Read Aloud、Voice Mode 和语音听写共用。
FAQ
Read Aloud 到底是什么?
AgentsRoom 里的一个文字转语音朗读器。你挑一段写好的文字(一个 Markdown 文件、终端里选中的一段、代理的最后一条回复),它就用自然的合成语音念出来,带进度条、暂停和停止。它和语音听写方向正好相反:听写是把你说的话变成文字。
我能听一个 Markdown 文件吗,比如 README?
能,这就是主要入口。在 AgentsRoom 预览里打开文件,点 Source 旁边的喇叭按钮。整份文档会从头念到尾:README、CLAUDE.md、changelog、架构笔记、规格文档。Markdown 语法会先被清理,所以你听到的是正文,不是标记。
它会把代码念出来吗?
不会,这是故意的。代码围栏块会连同 Markdown 表格、水平线和只有一个文件路径的行,在任何内容被念出来之前先被删掉。念出来的代码根本没法听,所以 Read Aloud 留下正文,其余丢掉。
我能只听摘要,不听整篇吗?
可以。每个入口都提供摘要朗读:AI 先按你选的朗读时长写出一份摘要,被念出来的就是那份摘要。时长有三档,大约十秒、三十秒和一分钟,默认十秒。它把一份长 changelog 变成一段短的语音要点,花掉的语音额度也远少于念完整篇。摘要用你的界面语言来写。
如果我有阅读障碍,这个有用吗?
这个功能就是从这儿来的。一位有阅读障碍的用户一直把 AgentsRoom 的 Markdown 预览复制粘贴到外部的文字转语音工具里,于是我们把声音搬进了应用。它把读技术文档时解码那一步去掉了。它不是屏幕阅读器,也不声称符合什么标准,但就读文档这件事而言,它把交给它的活干得很好。
它最多能念多长的文档?
一次朗读的上限是 20,000 个可朗读字符,大约二十二分钟。超过就会被截断,界面会告诉你内容被缩短了。这个上限存在是因为语音合成按字符计费:没有它,在一个巨大的文件上点一下,可能在你反应过来之前就把一个月的额度掏空。
念到一半我把文件关了会怎样?
朗读继续。播放器活在启动它的那个窗口之外,状态栏里会出现一个控制小条,带着进度、剩余时间、暂停和停止。它是那个随时都能用的控制,朗读结束时就消失。
它对所有代理都管用吗?
念文件、念选中内容、念 AI 摘要,对任何提供商都管用,因为文字来自你的屏幕。念代理的最后一条回复需要磁盘上有一份可寻址的对话记录,今天这意味着 Claude Code 和 Codex。用别的提供商时,只有这一个入口会告诉你没有可读的内容。
它要花多少钱?
Read Aloud 是 Pro 功能,按已经和 Voice Mode、语音听写共用的语音额度计费,每月补满。没有单独的配额。额度在请求之前就会检查,所以余额为零时不会被扣掉什么;你也可以挂上自己的 OpenAI API 密钥,让朗读跑在你的账号上,一点额度都不花。
它用什么语言念?
文档的语言。语音模型念的是眼前的东西,所以哪怕你的 AgentsRoom 界面是中文,一份英文 README 也还是英文。摘要朗读是例外:摘要先用你的界面语言写出来,然后再念。
声音能选吗?
能。Read Aloud 用的是你已经在 AgentsRoom 设置里为 Voice Mode 选好的那个声音,设一次,两个功能一起用。
能同时念两段内容吗?
不能,这是故意的。整个应用只有一个朗读器:开始一段新的朗读会停掉正在进行的那一段。两个合成语音抢着说话,从来没有人想要。
你可能也会喜欢
给眼睛放个假
下载 AgentsRoom,让下一份 changelog 念给你听。
配套应用:随时随地监控你的 Agent
使用 Claude、Codex、Antigravity CLI 或其他 AI 提供商。
把 Bug 和需求直接发送到您的公开待办清单。
AgentsRoom 实际运行一瞥。