Parlez-lui.Rien ne sortde la pièce.
Les assistants vocaux sont toujours venus avec un microphone braqué sur les serveurs de quelqu’un d’autre. Pas celui-ci. La reconnaissance et la synthèse vocale tournent toutes deux sur votre machine, ce qui rend la voix utilisable pour les conversations que vous n’auriez jamais près d’une enceinte connectée.
La raison pour laquelle vous n’utilisez pas la voix est la raison d’être de tout ceci.
Tous les assistants vocaux grand public vous enregistrent, envoient l’audio dans un centre de données et le conservent pendant une durée décrite dans un document que vous n’avez pas lu. Alors les gens utilisent la voix pour les minuteurs et la météo, et tapent tout ce qui compte.
Déplacez la reconnaissance sur la machine et ce calcul disparaît. Reste la méthode de saisie la plus rapide dont disposent les humains, braquée sur un agent capable d’agir pour de bon. Nous avons développé l’argument dans la reconnaissance vocale sur l’appareil, et pourquoi les assistants vocaux sont restés inutiles.
- De l’audio envoyé à un service de reconnaissance
- Une transcription stockée sur le disque de quelqu’un d’autre
- Une facture de transcription à la minute
- La voix qui s’arrête parce que la connexion est tombée
- Un compte exigé pour parler à votre propre ordinateur
Quatre étapes, dont aucune ne quitte la machine.
La parole entre, la parole sort, avec le même agent et les mêmes outils entre les deux.
Il remarque que vous avez commencé à parler
La parole est séparée du bruit de la pièce sur l’appareil : le microphone ne diffuse donc rien nulle part tant que vous ne vous adressez pas à lui.
Vos mots deviennent du texte, ici
La reconnaissance tourne sur votre propre processeur. Aucun audio n’est envoyé, et aucun service de transcription ne garde une copie de ce que vous avez dit.
L’agent fait le travail
Le même agent, les mêmes outils, les mêmes interfaces composées. La voix est une autre porte d’entrée, pas une version amoindrie du produit.
Il répond à voix haute
La synthèse vocale tourne aussi en local : une réponse démarre donc sans aller-retour et continue de fonctionner réseau débranché.
Vous avez demandé à voix haute. Voici ce qui revient.
Pas une phrase qu’on vous lit, mais la même interface composée qu’aurait produite une demande tapée, la lecture à voix haute étant proposée et non présumée. Dessiné par le moteur de rendu du bureau lui-même ; seuls les messages sont inventés.
Lis-moi ce qui est arrivé cette nuit
La nuit, sur un seul écran
Vous avez demandé à voix haute. La réponse est un écran, pas un paragraphe qu’on vous relit.
Le build est passé au rouge à 02:14 et de nouveau au vert à 02:51 ; quelqu’un l’avait déjà corrigé avant votre réveil.
Un contrat est revenu signé. Deux fils attendent un chiffre que vous seul avez.
Ils vous veulent
Ou faites-le lire à voix haute
La synthèse vocale tourne ici aussi, donc rien de tout cela ne quitte la machine.
La voix atteint tout le système, pas une version réduite de celui-ci.
La plupart des assistants donnent à la voix un cerveau plus petit qu’à l’application : un jeu de commandes limité, une poignée d’intentions, et un haussement d’épaules pour le reste. Ici, c’est le même agent avec les mêmes outils : une demande orale peut donc piloter le navigateur, modifier des fichiers ou composer une interface exactement comme une demande tapée.
- Le même agent, les mêmes outils, la même mémoire
- Une demande orale peut renvoyer une interface composée, pas seulement une phrase
- Les tâches longues continuent de tourner et vous préviennent quand elles ont fini
- Passez de la parole à la frappe en pleine tâche sans perdre le fil
- Les mains prises, les yeux ailleursDemandez l’état de quelque chose pendant que vous faites autre chose, et obtenez une réponse orale plus une vue composée qui vous attend quand vous revenez.
- Une dictée qui comprend le contextePas seulement de la transcription : l’agent a vos fichiers et votre historique, donc « rédige ça pour le fil de mardi » tombe sur la bonne chose.
- Des conversations réellement privéesLe genre de choses qu’on ne dit pas à une enceinte connectée. Juridique, médical, financier, personnel. Rien n’est envoyé, donc personne ne conserve rien.
- Fonctionne sans connexionDans un avion, dans un site sans réseau, sur une machine délibérément isolée. La voix ne se dégrade pas en « indisponible ».
Ce qu’on nous demande sur la voix.
Ma voix est-elle envoyée à un serveur ?
Non. La reconnaissance et la synthèse tournent toutes deux sur votre machine, avec des modèles livrés avec le système. Il n’y a pas d’étape d’envoi audio ni de prestataire de transcription sur le chemin — et c’est précisément pour cela que la voix devient utilisable pour les conversations qu’on évite d’habitude près d’un micro.
La voix fonctionne-t-elle hors ligne ?
Oui. Les modèles vocaux sont installés en local à côté du modèle de langue : une machine sans connexion réseau écoute et répond quand même. C’est la même propriété qui rend viable une installation isolée du réseau.
Faut-il un compte ou un abonnement pour la voix ?
Non. La voix fait partie du système local et ne coûte rien à l’usage. Il n’y a pas de facture de transcription à la minute parce qu’il n’y a pas de service de transcription.
Est-ce qu’il écoute en permanence ?
La parole est séparée du bruit de fond sur l’appareil, et rien ne quitte la machine à aucun moment. Même pendant qu’il vous écoute, aucun flux ne part donc où que ce soit pour être intercepté ou conservé.
Puis-je utiliser la voix et l’écran en même temps ?
C’est l’usage prévu. Une question orale peut renvoyer en même temps une réponse orale et une interface composée : la version courte à voix haute, le détail à l’écran quand vous y revenez.
Dites-le à voix haute.
Téléchargement gratuit, et le microphone reste braqué sur votre propre machine.