話しかけてください。何ひとつ、この部屋から出ていきません。
音声アシスタントはこれまで必ず、他人のサーバーに向いたマイクを連れてきました。これは違います。音声認識も音声合成もあなたのマシンで動くので、スマートスピーカーのそばでは決してしないような会話にも、音声が使えるようになります。
あなたが音声を使わない理由こそが、これが存在する理由です。
主要な音声アシスタントはどれも、あなたを録音し、その音声をデータセンターへ送り、あなたが読んでいない文書に書かれた期間だけ保管します。だから人はタイマーと天気にだけ音声を使い、本当に大事なことはすべて打ち込みます。
認識をマシン側へ移せば、その計算そのものが消えます。あとに残るのは、人間が持つ最速の入力手段が、実際に行動できるエージェントに向いているという事実だけです。長い論はこちらに書きました。 端末上の音声認識と、音声アシスタントが役立たずのままだった理由.
- 音声が認識サービスへアップロードされること
- 書き起こしが他人のディスクに保管されること
- 分単位の書き起こし料金
- 接続が切れたせいで音声が止まること
- 自分のコンピュータに話しかけるためにアカウントが要ること
4つのステップ、そのどれもマシンの外へ出ません。
声が入り、声が出る。その間にいるのは、同じエージェントと同じ道具です。
あなたが話し始めたことに気づく
声は端末上で室内の物音から切り分けられます。だからあなたが話しかけていないあいだ、マイクはどこへも何も流していません。
あなたの言葉が、ここでテキストになる
認識はあなた自身のプロセッサで動きます。音声はアップロードされず、あなたが言ったことの写しを持つ書き起こしサービスも存在しません。
エージェントが仕事をする
同じエージェント、同じ道具、同じ組み立てられたインターフェース。音声は入り口のひとつであって、機能を削った版ではありません。
声に出して答える
音声合成もローカルで動くので、往復を待たずに返答が始まり、ネットワークを抜いても動き続けます。
声で尋ねました。返ってくるのはこれです。
読み上げられる一文ではなく、打ち込んだときと同じ組み立てられたインターフェースです。読み上げは前提ではなく、選べるものとして添えられます。描いているのはデスクトップ自身のレンダラーで、作りものはメッセージだけです。
夜のあいだに来たものを読み上げて
一晩ぶんを、一画面に
声で尋ねた。返ってきたのは画面であって、読み上げられる段落ではない。
ビルドは02:14に赤くなり、02:51にまた緑に戻った。あなたが起きる前に誰かが直していた。
契約書が署名されて戻ってきた。2つのスレッドが、あなたしか持っていない数字を待っている。
あなたを待っている
読み上げさせることもできる
音声合成もここで動くので、これもマシンの外には出ない。
音声はシステム全体に届きます。その削減版ではありません。
たいていのアシスタントは、音声にアプリより小さな頭脳しか与えません。限られたコマンド、いくつかの意図、それ以外には肩をすくめるだけ。ここでは同じエージェントが同じ道具を持っているので、声での依頼もブラウザを動かし、ファイルを編集し、インターフェースを組み立てます。打ち込んだ場合とまったく同じように。
- 同じエージェント、同じ道具、同じ記憶
- 声での依頼が、一文ではなく組み立てられたインターフェースを返せる
- 長い処理は動き続け、終わったら知らせてくれる
- 作業の途中で、話すことと打つことを行き来しても筋を見失わない
- 手はふさがり、目は別のところに別のことをしながら何かの状態を尋ねれば、声で答えが返り、目を戻したときには組み立てられた画面が待っています。
- 文脈を分かっている口述単なる書き起こしではありません。エージェントはあなたのファイルと履歴を持っているので、「火曜のスレッド向けにまとめておいて」が正しいものに解決されます。
- 本当に私的な会話スマートスピーカーには言わない類のこと。法務、医療、家計、個人的なこと。アップロードされないので、誰も何も保持しません。
- 接続がなくても動く飛行機の中でも、ネットワークのない施設でも、意図的に隔離されたマシンでも。音声が「利用できません」に落ちることはありません。
音声についてよく聞かれること。
私の声はサーバーへ送られますか。
いいえ。認識も合成も、システムに同梱されたモデルを使って、あなたのマシンで動きます。音声をアップロードする工程も、経路上の書き起こし事業者も存在しません。だからこそ、マイクのそばでは避けられがちな会話にも音声が使えるのです。
音声はオフラインでも動きますか。
はい。音声モデルは言語モデルと並んでローカルに導入されるので、ネットワークにつながっていないマシンでも聞き取り、答えます。これは、隔離された環境への導入を成り立たせているのと同じ性質です。
音声を使うのにアカウントやサブスクリプションは要りますか。
いりません。音声はローカルなシステムの一部で、使うたびの費用はかかりません。書き起こしサービスが存在しないので、分単位の請求も存在しません。
ずっと聞いているのですか。
声は端末上で背景音から切り分けられ、どの時点でもマシンの外へは何も出ません。だからあなたを待って聞いているあいだも、傍受されたり保管されたりしうる流れはどこにも向かっていません。
音声と画面を一緒に使えますか。
それが想定された使い方です。声での質問に対して、声での答えと組み立てられたインターフェースを同時に返せます。要点は声で、細部は画面で、戻ってきたときに読めます。