Pular para o conteúdo
MeghaOS

Selecione o idioma

O MeghaOS fala mais de 100 idiomas na sua própria máquina. Este site está disponível por completo em todos os idiomas listados aqui; nossas páginas legais e os artigos do blog permanecem em inglês.

FIG 8.0 · Cartão do modelo

Pequeno o bastante para rodaronde os seus dados já estão.

O Megha é um modelo de linguagem causal de 0,6B de parâmetros, feito para fluxos agênticos, tarefas de programação e instruções em vários idiomas. O tamanho é o ponto: processamento local só é garantia de verdade se o modelo couber mesmo na sua máquina.

FIG 8.1 · Especificação

O cartão do modelo inteiro, numa tela só.

Parâmetros
0,6B
no total
Sem embedding
0,44B
parâmetros
Camadas
28
blocos transformer
Cabeças de atenção
16Q / 8KV
grouped-query
Comprimento do contexto
32.768
tokens
Arquitetura
LM causal
só decodificador
Idiomas
100+
seguindo instruções
Modo de raciocínio
Alternável
na hora da inferência
FIG 8.2 · Esquema

28 camadas, atenção com consultas agrupadas.

A atenção com consultas agrupadas, em que 16 cabeças de consulta compartilham 8 cabeças de chave/valor, é o que mantém o cache KV pequeno o bastante para um contexto de 32K em hardware de consumo.

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
embedding · 0,16B
Por bloco

Atenção com consultas agrupadas · 16Q / 8KV

16 cabeças de consulta8 cabeças de chave/valor · compartilhadas

Compartilhar cabeças de chave/valor entre as cabeças de consulta corta o cache KV quase pela metade em relação à atenção multi-cabeça completa. É isso que torna um contexto de 32K viável num notebook e não numa estação de trabalho, e a razão de a garantia de processamento local ser prática e não teórica.

FIG 8.3 · Modo de raciocínio

Raciocínio que você liga quando ele vale o custo.

O modo de raciocínio é alternável na hora da inferência, e não assado dentro do modelo. Extração, classificação e formatação de rotina rodam sem ele e continuam rápidas; planejamento em várias etapas e refatorações difíceis ganham o orçamento extra de raciocínio. O escalonador de agentes faz essa escolha por tarefa, e você pode sobrescrevê-la.

  • Alternado por pedido, não por instalação
  • O trabalho de rotina continua de baixa latência por padrão
  • O escalonador de agentes decide, e mostra a você o que decidiu
  • Os orçamentos valem nos dois casos; modo de raciocínio não é cheque em branco
Quando ele entra
  • DeslClassificação, extração, formatação, preenchimento de modelos
  • DeslRoteamento simples e geração de embeddings
  • LigRefatorações em vários arquivos e edições que respeitam dependências
  • LigPlanejamento em várias etapas, onde errar o primeiro passo sai caro
FIG 8.4 · O que roda de fato

O Megha é uma escolha, não um padrão que você não pode mudar.

O MeghaOS traz um modelo pequeno embutido para que o primeiro uso funcione offline em hardware modesto. O Megha, e qualquer outro que você prefira, está a uma instalação de distância.

Um modelo compacto vem embutido

Para o primeiro uso funcionar offline em qualquer máquina suportada, inclusive Macs e PCs mais antigos, com pouca memória. Ele dá conta bem de roteamento, extração, classificação e escolha de ferramentas, e é deliberadamente pequeno, não deliberadamente capaz.

Instalar o Megha é uma linha

Puxe-o pelo Ollama ou sirva-o com vLLM e aponte o MeghaOS para o endpoint. É esta a configuração que o cartão do modelo acima descreve, e é o que recomendamos em qualquer máquina com memória sobrando.

Ou traga um modelo completamente diferente

Qualquer coisa que você consiga servir por Ollama ou vLLM funciona: Qwen, DeepSeek, Kimi, ou o que você já roda. O MeghaOS fala com um endpoint compatível com OpenAI e não se importa com o que está atrás dele.

Ou use um provedor hospedado

Aponte-o para uma API na nuvem com a sua própria chave, ou assine o MeghaOS Pro. Os pedidos que você enviar por esse caminho saem do dispositivo, e é essa a troca inteira. Veja a página de preços para o que isso custa e o que compra.

FIG 8.5 · Implantação

Rode-o fora do MeghaOS, se quiser.

O modelo se integra aos runtimes que você já usa. Nada nele está preso ao sistema operacional.

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

Pesos do modelo e configurações do tokenizador em hf.co/meghaos/megha-0.6b, sob Apache 2.0.

FIG 8.6 · Limites

O que um modelo de 0,6B não é.

Ser franco quanto a isto é a razão para confiar no resto da página.

Não é um modelo de fronteira

Em raciocínio aberto, escrita longa e problemas novos e difíceis, um modelo de 0,6B não vai igualar um sistema de fronteira. E nem está tentando.

A troca é deliberada

Para classificação, extração, roteamento, formatação e chamada de ferramentas — que é a maior parte do que um agente de fato faz — um modelo local pequeno é mais rápido, sai de graça por chamada e não sofre limite de taxa.

Híbrido é suportado, não obrigatório

Você pode apontar o MeghaOS para um modelo local maior ou para um hospedado. Tudo o que você enviar a um provedor hospedado sai do dispositivo. É isso que enviar para lá significa, e é uma configuração que você escolhe, não algo que acontece caladamente.

O local elimina uma classe inteira de falhas

Boa parte dos erros de LLM em produção são limites de taxa. Um modelo local não pode ser limitado assim, então um agente segue trabalhando numa janela em que um hospedado travaria.

Rode o modelo ondeos dados já moram.

O MeghaOS roda um modelo compacto de saída e deixa você trocar pelo Megha, por outro modelo aberto ou por um provedor hospedado quando quiser.