Sprechen Sie mit ihm.Nichts verlässtden Raum.
Sprachassistenten kamen bisher immer mit einem Mikrofon, das auf die Server eines anderen zeigt. Dieser nicht. Spracherkennung und Sprachsynthese laufen beide auf Ihrem Rechner, und damit taugt Sprache für die Gespräche, die Sie neben einem smarten Lautsprecher nie führen würden.
Der Grund, warum Sie Sprache nicht nutzen, ist der Grund, warum es das hier gibt.
Jeder gängige Sprachassistent nimmt Sie auf, schickt das Audio in ein Rechenzentrum und behält es für einen Zeitraum, der in einem Dokument steht, das Sie nicht gelesen haben. Also nutzen Leute Sprache für Timer und Wetter — und tippen alles, worauf es ankommt.
Verlagert man die Erkennung auf den Rechner, entfällt diese Rechnung. Übrig bleibt die schnellste Eingabemethode, die Menschen haben, gerichtet auf einen Agenten, der tatsächlich handeln kann. Das längere Argument haben wir aufgeschrieben in Spracherkennung auf dem Gerät, und warum Sprachassistenten nutzlos blieben.
- Audio, das an einen Erkennungsdienst hochgeladen wird
- Ein Transkript auf der Festplatte eines anderen
- Eine Transkriptionsrechnung pro Minute
- Sprache, die aufhört, weil die Verbindung abgerissen ist
- Ein Konto, das nötig ist, um mit dem eigenen Rechner zu sprechen
Vier Schritte, von denen keiner die Maschine verlässt.
Sprache hinein, Sprache hinaus, dazwischen derselbe Agent und dieselben Werkzeuge.
Es merkt, dass Sie zu sprechen begonnen haben
Sprache wird auf dem Gerät vom Raumgeräusch getrennt, das Mikrofon überträgt also nirgendwohin etwas, solange Sie es nicht ansprechen.
Ihre Worte werden hier zu Text
Die Erkennung läuft auf Ihrem eigenen Prozessor. Kein Audio wird hochgeladen, und kein Transkriptionsdienst hält eine Kopie dessen, was Sie gesagt haben.
Der Agent erledigt die Arbeit
Derselbe Agent, dieselben Werkzeuge, dieselben zusammengesetzten Oberflächen. Sprache ist ein weiterer Weg hinein, keine reduzierte Fassung des Produkts.
Es antwortet laut
Auch die Sprachsynthese läuft lokal, eine Antwort beginnt also ohne Umweg und funktioniert weiter, wenn das Netz abgezogen ist.
Sie haben laut gefragt. Das kommt zurück.
Kein Satz, der Ihnen vorgelesen wird, sondern dieselbe zusammengesetzte Oberfläche, die eine getippte Anfrage erzeugt hätte — das Vorlesen wird angeboten, nicht unterstellt. Gezeichnet vom Renderer des Desktops selbst; erfunden sind nur die Nachrichten.
Lies mir vor, was über Nacht kam
Die Nacht, auf einem Bildschirm
Du hast laut gefragt. Die Antwort ist ein Bildschirm, kein Absatz, der dir vorgelesen wird.
Der Build war um 02:14 rot und um 02:51 wieder grün; jemand hatte ihn repariert, bevor du wach warst.
Ein Vertrag kam unterschrieben zurück. Zwei Threads warten auf eine Zahl, die nur du hast.
Will dich
Oder lass es dir vorlesen
Die Sprachsynthese läuft ebenfalls hier, also verlässt auch davon nichts den Rechner.
Sprache erreicht das ganze System, nicht eine beschnittene Fassung davon.
Die meisten Assistenten geben der Sprache ein kleineres Gehirn als der App: einen begrenzten Befehlssatz, eine Handvoll Absichten und ein Achselzucken für alles andere. Hier ist es derselbe Agent mit denselben Werkzeugen — eine gesprochene Anfrage kann also den Browser bedienen, Dateien bearbeiten oder eine Oberfläche zusammensetzen, genau wie eine getippte.
- Derselbe Agent, dieselben Werkzeuge, dasselbe Gedächtnis
- Eine gesprochene Anfrage kann eine zusammengesetzte Oberfläche zurückgeben, nicht nur einen Satz
- Lange Aufgaben laufen weiter und melden sich, wenn sie fertig sind
- Mitten in der Aufgabe zwischen Sprechen und Tippen wechseln, ohne den Faden zu verlieren
- Hände beschäftigt, Augen woandersFragen Sie nach dem Stand von etwas, während Sie etwas anderes tun, und bekommen Sie eine gesprochene Antwort plus eine zusammengesetzte Ansicht, die wartet, wenn Sie zurückschauen.
- Diktat, das den Zusammenhang verstehtNicht bloß Transkription: der Agent hat Ihre Dateien und Ihre Historie, „schreib das für den Dienstagsthread aus“ trifft also das Richtige.
- Wirklich private GesprächeDie Art Sache, die niemand einem smarten Lautsprecher sagt. Juristisch, medizinisch, finanziell, persönlich. Nichts wird hochgeladen, also behält niemand etwas.
- Funktioniert ohne VerbindungIm Flugzeug, in einer Anlage ohne Netz, auf einem bewusst abgekoppelten Rechner. Sprache verschlechtert sich nicht zu „nicht verfügbar“.
Was Leute zu Sprache fragen.
Wird meine Stimme an einen Server geschickt?
Nein. Erkennung und Synthese laufen beide auf Ihrem Rechner, mit Modellen, die mit dem System ausgeliefert werden. Es gibt keinen Upload-Schritt und keinen Transkriptionsanbieter im Weg — und genau deshalb taugt Sprache für die Gespräche, die Leute sonst nicht in Mikrofonnähe führen.
Funktioniert Sprache offline?
Ja. Die Sprachmodelle werden lokal neben dem Sprachmodell installiert, ein Rechner ohne Netzverbindung hört also weiter zu und antwortet. Es ist dieselbe Eigenschaft, die eine abgekoppelte Installation überhaupt möglich macht.
Brauche ich für Sprache ein Konto oder ein Abo?
Nein. Sprache gehört zum lokalen System und kostet pro Nutzung nichts. Es gibt keine Minutenabrechnung für Transkription, weil es keinen Transkriptionsdienst gibt.
Hört es immer mit?
Sprache wird auf dem Gerät vom Hintergrundgeräusch getrennt, und nichts verlässt zu irgendeinem Zeitpunkt die Maschine. Selbst während es auf Sie hört, geht also kein Datenstrom irgendwohin, den man abfangen oder aufbewahren könnte.
Kann ich Sprache und Bildschirm zusammen nutzen?
Genau so ist es gedacht. Eine gesprochene Frage kann gleichzeitig eine gesprochene Antwort und eine zusammengesetzte Oberfläche zurückgeben: die Kurzfassung laut, das Detail auf dem Bildschirm, wenn Sie sich wieder ihm zuwenden.
Sagen Sie es laut.
Kostenlos herunterladen — und das Mikrofon bleibt auf Ihren eigenen Rechner gerichtet.