Subtitles · 为聋人与听障者提供的字幕

你的 Mac 上的实时字幕,
不用请谁去打开。

需要字幕的人,大多数其实还能听到一些,要做的往往是把漏掉的词补上,而不是替掉已经听到的那些。Subtitles 读的是你的 Mac 正在播放的声音,所以它能给这台机器上的每个 app 配字幕,不用向任何人申请,而且你在前面工作时,浮层始终留在最上面。

14 天退款,不问缘由

一次性 $9,包含日后所有更新 · macOS 14.2 或更高版本 · Apple Silicon
字幕无限量,想用多久用多久。不用买时长,不用注册账号,不用订阅。

真正难的那几处

有字幕,不等于字幕好用。下面这些是别人给你的字幕通常会掉链子的地方,以及这个 app 对每一处的做法。

  • 已经过去的那一行。Google Meet 完全不保留字幕历史,Zoom 大约留三分钟。你只要低头打个字,刚读到一半的那句话就再也找不回来了。在这里按住 ⌥,最近的字幕会回来,可以滚动,所以漏掉一行不等于丢掉整场会议的线索。
  • 两个人同时说话。话音重叠是任何字幕系统都吃力的地方,也正是你最需要它的地方。换人说话时开一个新框是可选的,值得打开:在一场靠读而不是靠听的对话里,弄清楚谁说了什么,就是大部分的工作量。
  • 没有人做过字幕的视频。隐藏式字幕和 SDH 只存在于有人做过的地方,这就把内部门户上的大多数培训视频、大多数会议录像、同事发给你的大多数录屏,以及大多数播客都排除在外了。这个 app 直接读音频,所以「发布方有没有想着加字幕」不再是问题。
  • 不是会议的那些通话。FaceTime、电脑上的 WhatsApp 或 Signal 通话、从 Mac 拨出去的号码、回放的语音留言。这些都没有一个字幕按钮可以按,也没有一个主持人可以去问,而这基本就是为什么打电话一直是一周里最让人发怵的部分。
  • 和听得见的人一起看东西。当屋里没有别人需要字幕时,给一部电影打开字幕就变成了一次商量,而且很多东西本来就没有字幕轨可以打开。这个只画在你的 Mac 上,大小由你定,于是它不再是所有人的决定。
  • 已经在接收 Mac 音频的助听器。Made for iPhone 助听器和声音处理器可以直接与 M1 或更新的 Mac 配对,而声音干净地传过来,和语速快、互相重叠的对话能听清楚,并不是一回事。在传输过来的音频之上再加字幕,是很常见的用法,不是多此一举。它读的是 app 本身的音频流,而不是你的输出设备,所以你用什么在听并不进入这件事。
  • 下午四点的那种累。为了跟上别人说话而全天保持高度专注,那种消耗不会出现在任何人的日程表上。读一个只听清一半的词,比从上下文里把它推回来省力,也比第三次请一屋子人重复一遍省力得多。

它听得到什么,听不到什么

这一段放在最上面而不是写进小字,因为它决定了这个 app 对你到底有没有用。Subtitles 只读一样东西:Mac 上某个应用正在播放的音频。这是一个很窄的接入口,窄是刻意的,而且它确实把有些情况完全排除在外。

  • 它不会给房间配字幕。麦克风从不打开,所以坐在你面前说话的人,在屏幕上不会留下任何东西。如果你需要的是这张桌子上的对话,那这是个错误的工具,任何设置都改不了。macOS 的实时字幕可以接麦克风音频,iPhone 的实时收听就是为房间做的;这两个都是比它更好的答案。
  • 它不会给你自己配字幕。只有 Mac 播放的声音会被读取,所以通话里你读到的是别人,永远不是你自己。
  • 它是语音识别,所以有时会错。人名、行话、抢话和不熟悉的口音,是它最容易滑掉的地方。看医生、法律相关的谈话,或者会被评分的课,这些场合的合理便利是人工速录员或手语翻译,而提出这个要求是你的权利,不是求人帮忙。这个 app 是给一天里剩下的时间用的——那些本来就不会有人给你安排的场合。
  • 它写的是话,不是声音。这才是它和 SDH 真正的差距——SDH 还会标出门铃、笑声和音乐进来。这里有一个人声检测器排在识别器前面,好让伴奏永远不会变成歌词,而代价就是其余的一切:你拿到的是说了什么,而不是当时还有什么在响。
  • 它更适合某一些听力状况。如果你能听到一场对话的大部分,只是在嘈杂里、在快语速里、在糟糕的麦克风里丢词,那它就是冲着你来的。如果你使用手语并且想要翻译,或者你读文字的速度远快于任何识别器能写出来的速度,那它带来的就少一些,值得先试再买。
  • 它什么都不留。字幕画在屏幕上,然后就没了:不写入磁盘,所以事后没有文字记录可以回看。如果你需要留档,这里给不了。

先试试 Mac 上已经有的那个

macOS 自带实时字幕,免费,每台 Apple 芯片的 Mac 上都有:系统设置 ▸ 辅助功能 ▸ 实时字幕。它确实做得不错,一分钱不要,如果它能覆盖你的需要,那就到此为止,不必花 9 美元去验证这件事。花一周用它,也是最快搞清楚自己到底想从字幕里得到什么的方法。

让人去找别的东西的,通常是这三件事之一:需要的语言不在 Apple 的列表里;字幕窗口会被自己正在用的东西盖住;或者想给一节课选一个更慢更准的模型,给一次通话选一个更快的。这些差别在对比页上逐条列着。

14 天退款,不问缘由。

当只有你一个人需要它

字幕里累人的部分很少是读。而是每一个字幕的来源都属于别人,所以要拿到它就得开口,开口就得解释,而解释这件事,你在下一通电话、面对下一批人时还要再做一遍。

没有人需要去问

Zoom 的字幕要主持人打开。Teams 的取决于租户允许什么。Meet 的按 Workspace 等级不同。你自己机器上的一个接入口不对这些负责,所以和陌生人、和招聘方、和一家从来没想过这件事的公司通话时,字幕就那样在那里。

没有任何东西会宣告你

没有机器人加入,参会者名单里不会出现什么,也不会亮起录制标识。要不要告诉别人你是聋人或听障者,依然是你按自己的节奏做的决定,而不是在你正需要跟上对话的那一刻,由软件替你做的决定。

不用再开口第二次

请一屋子人再说一遍,这件事的代价每付一次就涨一点,而大多数人早在不再漏掉东西之前,就已经不再付了。读一眼那句只听到一半的话,不花什么代价,也不打断任何人,而这正是「跟上一场会议」和「在会议里点头」之间的区别。

你需要多久就开多久

模型跑在你 Mac 的 Neural Engine 上,按小时算的成本是零,所以没有计量表,也没有什么要省着用。按分钟收费的字幕服务是在小声要求你决定:你这一天里,哪些部分值得听见。这个 app 对此没有意见。

为连续读上几个小时而做

整天依赖的字幕,和只看一眼的字幕,读法是不一样的。下面每一项都是设置,而不是别人替你做的决定,因为正确答案取决于你听到多少、又读了多少。

  • 它不会跑到你的工作后面去。浮层位于每一个窗口和 app 切换器之上,所以记笔记、看一份文档或者查点东西,不会让你付出「这期间被说出来的那句话」的代价。一边跟上会议一边写下任何东西,本身就是全部的难处,而一个需要你一直保持在前面的字幕窗口,解决不了它。
  • 你可以把它放在视线已经在的地方。它不吃点击,所以你可以直接穿过它工作;指针经过时它会淡开,从不遮住底下的东西。大小、不透明度、淡开的范围、方框放在哪里,都归你;按住 Shift 可以让它保持不透明并拖动。把它放在说话人脸的正下方,是大多数人最后会做的事,也正是读唇和字幕能一起用、而不是互相抢你目光的原因。
  • 每一行都会等你。一条字幕停留大约一秒半,每多一个词再加十分之一秒,所以长句不会在半句处消失;按住 ⌥ 会把最近几条带回来,可以滚动。阅读速度因人而异,默认值只是一个猜测;历史记录就是为了猜错的时候。
  • 人名和行话,是它会让你失望的地方。一个药名、一个姓氏、一个你们团队自己造的缩写:这些恰好是你没法从上下文推出来的词,也恰好是识别器会弄错的词。选一个更慢更准的模型有帮助,但解决不了。与其事后才发现,不如先知道哪些词需要再确认一遍。

在这里,本地运行不是一种偏好

对大多数人来说,本地转写是个不错的原则。如果字幕是你接触语言的方式,那算的就是另一笔账了:一个云端字幕服务,会拿到你就诊、工作、家庭,以及其他所有你需要帮忙才能听清的场合的文字记录。那不是这项便利的副产品,那是你一天的记录,握在一家你并没有选择要告诉的公司手里。

这里不上传任何东西,不录制任何东西,也不往磁盘写任何东西。音频读进来多快就丢掉多快,而且首次运行下载完模型之后,这个 app 完全不再发起网络请求。没有账号,没有遥测,也没有什么需要退出的选项,因为根本没有收集任何东西。如果你更愿意亲自查而不是选择相信,源码是公开的

问题

它能给房间里说话的人配字幕吗?
不能。它只读你的 Mac 播放的声音,而且从不打开麦克风。对于正发生在你面前的对话,它什么都不会显示。Apple 自己的实时字幕在 Mac 上可以给麦克风音频配字幕,iPhone 上的实时收听就是为这件事做的,所以房间里的场合,那些才是对的工具,这个不是。
它能代替速录(CART)或人工字幕员吗?
不能。它是语音识别,所以会出错,尤其是人名、行话、抢话和口音很重的时候。看医生、法律会谈、会被评分的课,或者任何出错要付出代价的场合,合理便利是专业速录员或翻译,而你有权提出这个要求。这个 app 是给一天里剩下的时间用的——那些本来就永远不会有人给你安排的场合。
我需要问主持人,或者告诉别人我在用它吗?
不需要。它给你的 Mac 播放的音频配字幕,而不是去对接某项服务,所以没有东西加入会议,参会者名单里不会出现什么,也不需要任何主持人、管理员或老师去打开什么。没有人会被通知。说不说是你的决定,不是软件的。
我已经把 Mac 的声音传到助听器了,这个还有用吗?
通常有。传输解决的是声音走哪条路,而不是这段话本身有多难:语速快的人、重叠的声音、不熟悉的口音,传到你耳朵里之后还是这些。在传输的音频之上再加字幕,是很常见的组合,不是多余的。它读的是 app 本身的音频流,而不是你的输出设备,所以你用什么在听并不进入这件事,你的配对也什么都不会变。
如果一个视频根本没有字幕也没有 SDH 呢?
那正是它要处理的情况。隐藏式字幕和 SDH 只存在于有人做过的地方,这就排除了大多数内部培训视频、大多数会议录像,以及同事录下来发给你的大多数东西。这个 app 给音频本身配字幕,所以文件里有没有字幕轨并不重要。
字幕会像我开会时那样滞后吗?
会少一些,但不是完全没有。它是随着词一个个到达就持续出字幕,而不是等一句话说完;最新的那个词在模型确定之前会画得淡一些,所以你是边听边读,而不是事后读。它仍然是语音识别:从一个词被说出来,到这个词可以读到,中间有一点延迟,而说话快的人永远会比任何字幕都快上一点。
字幕可以调大、调得更好读吗?
可以。方框大小、不透明度、保留多少行、放在哪里,都是设置项,而且设置窗口是在真正的浮层上预览,不是在示意图上。按住 Shift 可以让它保持不透明并拖到你想要的位置;你放的地方会被记住。
它能给 FaceTime 和电话通话配字幕吗?
凡是通过 Mac 上某个 app 播放的都可以,包括 FaceTime、电脑上的 WhatsApp 或 Signal 通话、从你的 Mac 拨出去的号码,以及回放的语音留言。你读到的是对方,永远不是你自己,因为你的麦克风从不打开。这些正是没有字幕按钮、也没有主持人可问的通话,所以往往是大家最先拿来试的场景。
它会告诉我谁在说话,或者像 SDH 那样标注声音吗?
换人说话时它可以开一个新的字幕框,这是可选的,通话时值得打开,但它不会给任何人标上名字。非语音的声音它完全不标:人声检测器排在识别器前面,好让音乐永远不会变成编出来的歌词,代价就是你拿到的是话语本身,而不是当时还有什么在响。如果声音提示对你重要,这就是它和一条真正的 SDH 字幕轨之间,诚实的差距。
漏掉一句怎么办?
按住 ⌥,最近的字幕会回来,而且在它们显示期间可以滚动查看。这是刻意做成短时的:不写入磁盘,所以它是用来接住你刚刚漏掉的那句话,不是用来保留一整天的记录。
有按分钟计费或者月费吗?
没有。一次 9 美元,字幕不限量,因为模型跑在你的 Mac 上,运行起来不花钱。没有分钟数要买,也没有订阅。当字幕是你跟上一切的方式,而不是偶尔打开的东西时,这一点更重要。
它需要联网吗?
一次,用来在首次运行时下载模型。之后它完全离线运行,不发起任何网络请求,所以你听的任何内容都不会被送到别处。

什么都有字幕,不用开口去要。

14 天退款,不问缘由

一次性 $9,包含日后所有更新 · macOS 14.2 或更高版本 · Apple Silicon
无限量实时字幕,只要这台 Mac 还在你手上。不用买时长,不用注册账号,不用订阅。