Fale com ele.Nada saida sala.
Assistentes de voz sempre vieram com um microfone apontado para os servidores de outra pessoa. Este não. Reconhecimento e síntese de fala rodam na sua máquina, o que torna a voz utilizável para as conversas que você nunca teria perto de uma caixinha inteligente.
O motivo pelo qual você não usa voz é o motivo pelo qual isto existe.
Todo assistente de voz comum grava você, manda o áudio para um data center e o guarda por um período descrito num documento que você não leu. Então as pessoas usam voz para cronômetro e previsão do tempo, e digitam tudo o que importa.
Traga o reconhecimento para dentro da máquina e essa conta desaparece. O que sobra é o método de entrada mais rápido que os humanos têm, apontado para um agente que de fato consegue agir. Escrevemos o argumento completo em reconhecimento de fala no dispositivo, e por que assistentes de voz continuaram inúteis.
- Áudio enviado a um serviço de reconhecimento
- Uma transcrição guardada no disco de outra pessoa
- Uma cobrança de transcrição por minuto
- A voz parando porque a conexão caiu
- Uma conta exigida para falar com o seu próprio computador
Quatro passos, e nenhum deles sai da máquina.
Fala entrando, fala saindo, com o mesmo agente e as mesmas ferramentas no meio.
Ele percebe que você começou a falar
A fala é separada do ruído da sala no próprio dispositivo, então o microfone não está transmitindo nada para lugar nenhum enquanto você não se dirige a ele.
Suas palavras viram texto, aqui
O reconhecimento roda no seu próprio processador. Nenhum áudio é enviado, e não há serviço de transcrição guardando uma cópia do que você disse.
O agente faz o trabalho
O mesmo agente, as mesmas ferramentas, as mesmas interfaces compostas. A voz é outra porta de entrada, não uma versão reduzida do produto.
Ele responde em voz alta
A síntese de fala também roda localmente, então uma resposta começa sem ida e volta e continua funcionando com a rede desconectada.
Você perguntou em voz alta. É isto que volta.
Não uma frase lida para você, e sim a mesma interface composta que um pedido digitado produziria, com a leitura em voz alta oferecida e não presumida. Desenhado pelo renderizador do próprio desktop; só as mensagens são inventadas.
Leia o que chegou durante a noite
A madrugada, em uma tela
Você perguntou em voz alta. A resposta é uma tela, não um parágrafo lido de volta para você.
O build ficou vermelho às 02:14 e verde de novo às 02:51; alguém já tinha consertado antes de você acordar.
Um contrato voltou assinado. Duas conversas esperam um número que só você tem.
Querem você
Ou peça para ler em voz alta
A síntese de voz também roda aqui, então nada disso sai da máquina.
A voz alcança o sistema inteiro, não uma versão cortada dele.
A maioria dos assistentes dá à voz um cérebro menor que o do aplicativo: um conjunto limitado de comandos, um punhado de intenções e um dar de ombros para o resto. Aqui é o mesmo agente com as mesmas ferramentas, então um pedido falado pode dirigir o navegador, editar arquivos ou compor uma interface exatamente como um pedido digitado faria.
- O mesmo agente, as mesmas ferramentas, a mesma memória
- Um pedido falado pode devolver uma interface composta, não só uma frase
- Tarefas longas continuam rodando e avisam quando terminam
- Alterne entre falar e digitar no meio da tarefa sem perder o fio
- Mãos ocupadas, olhos em outro lugarPergunte o estado de alguma coisa enquanto faz outra, e receba uma resposta falada mais uma visão composta esperando quando você olhar de volta.
- Ditado que entende o contextoNão é só transcrição: o agente tem seus arquivos e seu histórico, então "escreve isso para a thread de terça" resolve na coisa certa.
- Conversas realmente privadasDo tipo que ninguém fala perto de uma caixinha inteligente. Jurídico, médico, financeiro, pessoal. Nada é enviado, então ninguém retém nada.
- Funciona sem conexãoNum avião, numa instalação sem rede, numa máquina isolada de propósito. A voz não vira "indisponível".
O que as pessoas perguntam sobre voz.
Minha voz é enviada para um servidor?
Não. Reconhecimento e síntese rodam na sua máquina, com modelos que vêm junto com o sistema. Não existe etapa de envio de áudio nem provedor de transcrição no caminho — e é exatamente por isso que a voz serve para as conversas que as pessoas evitam ter perto de um microfone.
A voz funciona offline?
Sim. Os modelos de fala são instalados localmente junto do modelo de linguagem, então uma máquina sem conexão de rede continua ouvindo e respondendo. É a mesma propriedade que torna viável uma instalação isolada da rede.
Preciso de conta ou assinatura para usar voz?
Não. A voz faz parte do sistema local e não custa nada por uso. Não há cobrança de transcrição por minuto porque não há serviço de transcrição.
Ele fica sempre ouvindo?
A fala é separada do ruído de fundo no dispositivo, e nada sai da máquina em momento algum. Então mesmo enquanto ele está ouvindo por você, não há nenhum fluxo indo a lugar nenhum que possa ser interceptado ou guardado.
Posso usar voz e tela ao mesmo tempo?
É assim que a coisa foi pensada. Uma pergunta falada pode devolver uma resposta falada e uma interface composta ao mesmo tempo: a versão curta em voz alta e o detalhe na tela quando você voltar a ela.
Diga em voz alta.
Download gratuito, e o microfone continua apontado para a sua própria máquina.