你不用语音的那个理由,正是这件事存在的理由。
所有主流语音助手都会录下你,把音频送进一个数据中心,并按某份你没读过的文档所写的期限保存。于是人们只用语音定闹钟、问天气,凡是要紧的事都改成打字。
把识别搬到本机上,这笔账就不存在了。剩下的,是人类最快的输入方式,正对着一个真能动手的智能体。更长的论证我们写在这里: 端上语音识别,以及语音助手为什么一直没什么用.
- 音频被上传到某个识别服务
- 一份转写稿存在别人的硬盘上
- 一张按分钟计费的转写账单
- 因为断网而不能用语音
- 为了跟自己的电脑说话还得注册账号
四个步骤,没有一步离开这台机器。
语音进来,语音出去,中间是同一个智能体、同一套工具。
它察觉到你开口了
人声在设备上就和环境噪音分开了,所以在你没有对它说话的时候,麦克风并没有把任何东西传向任何地方。
你的话在这里变成文字
识别跑在你自己的处理器上。没有音频被上传,也没有哪个转写服务留着一份你说过的话。
智能体去干活
同一个智能体、同一套工具、同样组合出来的界面。语音只是另一个入口,而不是一个缩水版的产品。
它出声回答
语音合成同样在本地运行,所以回答不必等一个来回就开始,拔掉网线也照样能用。
你开口问了。这就是回来的东西。
不是念给你听的一句话,而是和打字提问时一样组合出来的界面;朗读是作为选项提供的,不是默认强加的。这是由桌面自己的渲染器画出来的,编造的只有消息内容。
把夜里进来的东西念给我听
整夜的事,一屏看完
你是开口问的。答案是一屏画面,而不是念回给你的一段话。
构建在 02:14 变红,02:51 又变绿;在你醒来之前就有人修好了。
一份合同签好退回来了。两个会话在等一个只有你有的数字。
它们在等你
也可以让它念出来
语音合成同样在这里跑,所以这些同样不会离开这台机器。
语音抵达的是整个系统,不是它的删减版。
大多数助手给语音的脑子比给应用的小:一组有限的命令、几个意图,其余一律耸肩。这里则是同一个智能体、同一套工具,所以一句口头请求同样可以驱动浏览器、修改文件、组合出界面——和打字提出时完全一样。
- 同一个智能体、同一套工具、同一份记忆
- 一句口头请求可以返回一个组合好的界面,而不只是一句话
- 长任务会继续跑,做完了会来告诉你
- 任务进行到一半在说和打之间切换,也不会丢掉线索
- 手上忙着,眼睛在别处一边做别的事一边问某样东西的状态,得到一句口头回答,等你回头时还有一个组合好的视图在等着。
- 听得懂上下文的口述不只是转写:智能体手上有你的文件和历史,所以「把那个整理成周二那条线程要用的」能落到正确的东西上。
- 真正私密的对话那种人们不会对智能音箱说的事。法律、医疗、财务、私人。什么都不上传,所以也没人留着什么。
- 没网也能用在飞机上,在没有网络的场所,在一台刻意物理隔离的机器上。语音不会退化成「不可用」。
关于语音,人们通常会问什么。
我的声音会被送到服务器吗?
不会。识别和合成都用随系统附带的模型,跑在你自己的机器上。整条链路里没有上传音频这一步,也没有任何转写服务商——这正是语音之所以能用来谈那些人们平时躲着麦克风才敢谈的事的原因。
语音能离线用吗?
能。语音模型和语言模型一起装在本地,所以一台没有网络连接的机器照样能听、能答。让物理隔离部署可行的,也正是这同一个性质。
用语音需要账号或订阅吗?
不需要。语音是本地系统的一部分,按次使用不产生任何费用。没有按分钟计费的转写账单,因为根本没有转写服务。
它是一直在听吗?
人声在设备上就和背景噪音分开了,而且任何时刻都没有东西离开这台机器。所以哪怕它正在等你开口,也没有任何数据流去往任何可以被截获或留存的地方。
语音和屏幕可以一起用吗?
本来就该这么用。一句口头提问可以同时返回一句口头回答和一个组合好的界面:要点用听的,细节等你回头时在屏幕上看。