Háblale.Nada salede la habitación.
Los asistentes de voz siempre han venido con un micrófono apuntando a los servidores de otra persona. Este no. El reconocimiento y la síntesis de voz se ejecutan en tu máquina, y eso hace que la voz sirva para las conversaciones que jamás tendrías cerca de un altavoz inteligente.
La razón por la que no usas la voz es la razón por la que esto existe.
Todos los asistentes de voz habituales te graban, envían el audio a un centro de datos y lo conservan durante un tiempo descrito en un documento que no leíste. Por eso la gente usa la voz para temporizadores y para el tiempo, y escribe todo lo que importa.
Traslada el reconocimiento a la máquina y ese cálculo desaparece. Lo que queda es el método de entrada más rápido que tenemos los humanos, apuntando a un agente que además puede actuar. Desarrollamos el argumento largo en reconocimiento de voz en el dispositivo, y por qué los asistentes siguieron siendo inútiles.
- Audio subido a un servicio de reconocimiento
- Una transcripción guardada en el disco de otra persona
- Una factura de transcripción por minuto
- La voz dejando de funcionar porque se cayó la conexión
- Una cuenta obligatoria para hablar con tu propio ordenador
Cuatro pasos, y ninguno sale de la máquina.
Voz que entra, voz que sale, con el mismo agente y las mismas herramientas en medio.
Nota que has empezado a hablar
La voz se separa del ruido de la sala en el propio dispositivo, así que el micrófono no está transmitiendo nada a ninguna parte mientras no te diriges a él.
Tus palabras se vuelven texto, aquí
El reconocimiento se ejecuta en tu propio procesador. No se sube ningún audio, y no hay un servicio de transcripción guardando una copia de lo que dijiste.
El agente hace el trabajo
El mismo agente, las mismas herramientas, las mismas interfaces compuestas. La voz es otra puerta de entrada, no una versión reducida del producto.
Responde en voz alta
La síntesis de voz también se ejecuta en local, así que una respuesta empieza sin ida y vuelta y sigue funcionando con la red desenchufada.
Lo preguntaste en voz alta. Esto es lo que recibes.
No una frase leída en voz alta, sino la misma interfaz compuesta que produciría una petición escrita, con la lectura en voz alta ofrecida y no dada por supuesta. Dibujado por el propio renderizador del escritorio; solo los mensajes son inventados.
Léeme lo que entró de madrugada
La madrugada, en una pantalla
Preguntaste en voz alta. La respuesta es una pantalla, no un párrafo que te leen de vuelta.
La compilación se puso en rojo a las 02:14 y en verde otra vez a las 02:51; alguien ya lo había arreglado antes de que despertaras.
Un contrato volvió firmado. Dos conversaciones esperan una cifra que solo tienes tú.
Te quieren
O pide que te lo lean
La síntesis de voz también se ejecuta aquí, así que tampoco sale nada de esto de la máquina.
La voz alcanza todo el sistema, no una versión recortada de él.
La mayoría de los asistentes dan a la voz un cerebro más pequeño que el de la aplicación: un conjunto limitado de comandos, un puñado de intenciones y un encogimiento de hombros para todo lo demás. Aquí es el mismo agente con las mismas herramientas, así que una petición hablada puede conducir el navegador, editar archivos o componer una interfaz exactamente igual que una escrita.
- El mismo agente, las mismas herramientas, la misma memoria
- Una petición hablada puede devolver una interfaz compuesta, no solo una frase
- Las tareas largas siguen ejecutándose y te avisan cuando terminan
- Cambia entre hablar y escribir a mitad de la tarea sin perder el hilo
- Manos ocupadas, ojos en otra partePregunta por el estado de algo mientras haces otra cosa, y recibe una respuesta hablada más una vista compuesta esperándote cuando vuelvas a mirar.
- Dictado que entiende el contextoNo es solo transcripción: el agente tiene tus archivos y tu historial, así que «redacta eso para el hilo del martes» se resuelve en la cosa correcta.
- Conversaciones realmente privadasDe esas que la gente no le dice a un altavoz inteligente. Legales, médicas, financieras, personales. Nada se sube, así que nadie retiene nada.
- Funciona sin conexiónEn un avión, en unas instalaciones sin red, en una máquina aislada a propósito. La voz no se degrada a «no disponible».
Lo que la gente pregunta sobre la voz.
¿Mi voz se envía a un servidor?
No. El reconocimiento y la síntesis se ejecutan en tu máquina, con modelos que vienen con el sistema. No hay paso de subida de audio ni proveedor de transcripción por el camino, que es justamente la razón por la que la voz sirve para las conversaciones que la gente evita tener cerca de un micrófono.
¿La voz funciona sin conexión?
Sí. Los modelos de voz se instalan en local junto al modelo de lenguaje, así que una máquina sin conexión de red sigue escuchando y respondiendo. Es la misma propiedad que hace viable una instalación aislada de la red.
¿Necesito una cuenta o una suscripción para la voz?
No. La voz forma parte del sistema local y no cuesta nada por uso. No hay factura de transcripción por minuto porque no hay servicio de transcripción.
¿Está escuchando todo el rato?
La voz se separa del ruido de fondo en el dispositivo, y nada sale de la máquina en ningún momento, así que incluso mientras te escucha no hay ninguna transmisión yendo a ninguna parte que pueda interceptarse o conservarse.
¿Puedo usar la voz y la pantalla a la vez?
Esa es la forma prevista de usarlo. Una pregunta hablada puede devolver una respuesta hablada y una interfaz compuesta al mismo tiempo, así que tienes la versión corta en voz alta y el detalle en pantalla cuando vuelvas a ella.
Dilo en voz alta.
Descarga gratuita, y el micrófono sigue apuntando a tu propia máquina.