본문으로 건너뛰기
MeghaOS

언어 선택

MeghaOS는 당신의 컴퓨터에서 100개가 넘는 언어를 다룹니다. 이 사이트는 여기 나열된 모든 언어로 전체 페이지를 제공합니다. 법률 페이지와 블로그 글은 영어로 유지됩니다.

FIG 3.9 · 음성

말을 걸어 보세요.아무것도 이 방을벗어나지 않습니다.

음성 비서는 늘 남의 서버를 향한 마이크와 함께 왔습니다. 이것은 다릅니다. 음성 인식도 합성도 당신의 컴퓨터에서 돌아가고, 그래서 스마트 스피커 옆에서는 결코 하지 않을 대화에도 음성을 쓸 수 있게 됩니다.

당신이 음성을 쓰지 않는 이유가, 바로 이것이 존재하는 이유입니다.

주요 음성 비서는 모두 당신을 녹음하고, 그 오디오를 데이터센터로 보내며, 당신이 읽지 않은 문서에 적힌 기간만큼 보관합니다. 그래서 사람들은 타이머와 날씨에만 음성을 쓰고, 정작 중요한 것은 전부 타이핑합니다.

인식을 기기로 옮기면 그 계산 자체가 사라집니다. 남는 것은 인간이 가진 가장 빠른 입력 수단이, 실제로 행동할 수 있는 에이전트를 향하고 있다는 사실뿐입니다. 더 긴 논의는 여기에 적었습니다. 기기에서 도는 음성 인식, 그리고 음성 비서가 쓸모없이 남은 이유.

절대 일어나지 않는 일
  • 오디오가 인식 서비스로 올라가는 일
  • 전사본이 남의 디스크에 저장되는 일
  • 분당 전사 요금
  • 연결이 끊겨서 음성이 멈추는 일
  • 내 컴퓨터에 말을 걸기 위해 계정이 필요한 일
FIG 3.10 · 처음부터 끝까지

네 단계, 그중 어느 것도 컴퓨터를 벗어나지 않습니다.

음성이 들어오고 음성이 나가며, 그 사이에는 같은 에이전트와 같은 도구가 있습니다.

01

당신이 말을 시작했다는 것을 알아챕니다

음성은 기기에서 실내 소음과 분리됩니다. 그래서 당신이 말을 걸고 있지 않은 동안 마이크는 어디로도 아무것도 흘려보내지 않습니다.

02

당신의 말이 여기서 텍스트가 됩니다

인식은 당신의 프로세서에서 돌아갑니다. 오디오는 올라가지 않고, 당신이 말한 것의 사본을 쥐고 있는 전사 서비스도 없습니다.

03

에이전트가 일을 합니다

같은 에이전트, 같은 도구, 같은 구성된 인터페이스. 음성은 또 하나의 입구일 뿐, 기능을 줄인 버전이 아닙니다.

04

소리 내어 답합니다

음성 합성도 로컬에서 돌아가므로 왕복 없이 답이 시작되고, 네트워크를 뽑아도 계속 동작합니다.

FIG 3.10b · 음성으로 들어와, 구성되어 나갑니다

소리 내어 물었습니다. 이것이 돌아오는 것입니다.

읽어주는 한 문장이 아니라, 타이핑했을 때와 똑같이 구성된 인터페이스입니다. 소리 내어 읽어주는 것은 당연한 전제가 아니라 선택지로 제시됩니다. 데스크톱 자신의 렌더러가 그린 것이고, 지어낸 것은 메시지뿐입니다.

밤사이 들어온 걸 읽어줘

해보기

지난밤 전체를, 한 화면에

당신은 소리 내어 물었습니다. 답은 화면이지, 되읽어주는 문단이 아닙니다.

들어옴
31통
정말 당신에게 온 것
4
↑ 나머지는 소음

빌드는 02:14에 빨간불이 되었다가 02:51에 다시 초록이 됐습니다. 당신이 깨기 전에 누군가 이미 고쳤습니다.

계약서 하나가 서명되어 돌아왔습니다. 두 스레드가 당신만 아는 숫자를 기다리고 있습니다.

당신을 찾는 것들

가격 관련 스레드
23:40부터 대기
2
계약서, 서명됨
할 일 없음
✓
빌드 복구됨
02:51에 수정됨
✓

아니면 소리 내어 읽게 하세요

음성 합성도 여기서 돌아가므로, 이 가운데 무엇도 기기 밖으로 나가지 않습니다.

음성
속도105%
50200
끝나면 이어서 듣기
FIG 3.11 · 못한 모드가 아닙니다

음성은 시스템 전체에 닿습니다. 잘라낸 버전이 아니라.

대부분의 비서는 음성에 앱보다 작은 두뇌를 줍니다. 제한된 명령 목록, 몇 안 되는 의도, 그리고 나머지에는 어깨를 으쓱. 여기서는 같은 에이전트가 같은 도구를 씁니다. 그래서 말로 한 요청도 브라우저를 몰고, 파일을 고치고, 인터페이스를 구성합니다. 타이핑했을 때와 똑같이요.

  • 같은 에이전트, 같은 도구, 같은 기억
  • 말로 한 요청이 한 문장이 아니라 구성된 인터페이스를 돌려줄 수 있습니다
  • 오래 걸리는 작업은 계속 돌아가고, 끝나면 알려줍니다
  • 작업 도중에 말하기와 타이핑을 오가도 흐름을 잃지 않습니다
어디에 맞는가
  • 손은 바쁘고 눈은 다른 곳에
    다른 일을 하면서 무언가의 상태를 물어보면, 음성으로 답이 오고 고개를 돌렸을 때 구성된 화면이 기다리고 있습니다.
  • 맥락을 아는 받아쓰기
    단순한 전사가 아닙니다. 에이전트가 당신의 파일과 기록을 갖고 있으니 "그거 화요일 스레드용으로 정리해 줘"가 맞는 대상으로 풀립니다.
  • 진짜로 사적인 대화
    스마트 스피커에는 하지 않을 이야기들. 법률, 의료, 재무, 개인적인 것. 아무것도 올라가지 않으니 누구도 아무것도 보관하지 않습니다.
  • 연결 없이도 동작
    비행기 안에서, 네트워크가 없는 시설에서, 일부러 망을 끊은 컴퓨터에서. 음성이 "사용 불가"로 내려앉지 않습니다.
FIG 3.12 · 질문

사람들이 음성에 대해 묻는 것들.

제 목소리가 서버로 전송되나요?

아닙니다. 인식과 합성 모두 시스템에 함께 들어 있는 모델로 당신의 컴퓨터에서 돌아갑니다. 오디오를 올리는 단계도, 경로상의 전사 업체도 없습니다. 바로 그래서 사람들이 마이크 근처에서 피하던 대화에도 음성을 쓸 수 있게 됩니다.

음성이 오프라인에서도 되나요?

됩니다. 음성 모델은 언어 모델과 나란히 로컬에 설치되므로 네트워크가 없는 컴퓨터도 여전히 듣고 답합니다. 망 분리 설치를 가능하게 하는 것과 같은 성질입니다.

음성을 쓰려면 계정이나 구독이 필요한가요?

아닙니다. 음성은 로컬 시스템의 일부이고 쓸 때마다 드는 비용이 없습니다. 전사 서비스가 없으니 분당 청구서도 없습니다.

항상 듣고 있나요?

음성은 기기에서 배경 소음과 분리되고, 어느 시점에도 아무것도 컴퓨터를 벗어나지 않습니다. 그래서 당신을 기다리며 듣고 있는 동안에도, 가로채이거나 보관될 만한 스트림은 어디로도 가지 않습니다.

음성과 화면을 같이 쓸 수 있나요?

그렇게 쓰라고 만든 것입니다. 말로 한 질문에 음성 답변과 구성된 인터페이스가 동시에 돌아올 수 있습니다. 요약은 소리로, 자세한 것은 화면으로, 다시 눈을 돌렸을 때 읽으면 됩니다.

소리 내어 말해 보세요.

다운로드는 무료이고, 마이크는 계속 당신의 컴퓨터를 향해 있습니다.