Pequeno o bastante para rodaronde os seus dados já estão.
O Megha é um modelo de linguagem causal de 0,6B de parâmetros, feito para fluxos agênticos, tarefas de programação e instruções em vários idiomas. O tamanho é o ponto: processamento local só é garantia de verdade se o modelo couber mesmo na sua máquina.
O cartão do modelo inteiro, numa tela só.
- Parâmetros
- 0,6B
- no total
- Sem embedding
- 0,44B
- parâmetros
- Camadas
- 28
- blocos transformer
- Cabeças de atenção
- 16Q / 8KV
- grouped-query
- Comprimento do contexto
- 32.768
- tokens
- Arquitetura
- LM causal
- só decodificador
- Idiomas
- 100+
- seguindo instruções
- Modo de raciocínio
- Alternável
- na hora da inferência
28 camadas, atenção com consultas agrupadas.
A atenção com consultas agrupadas, em que 16 cabeças de consulta compartilham 8 cabeças de chave/valor, é o que mantém o cache KV pequeno o bastante para um contexto de 32K em hardware de consumo.
Atenção com consultas agrupadas · 16Q / 8KV
Compartilhar cabeças de chave/valor entre as cabeças de consulta corta o cache KV quase pela metade em relação à atenção multi-cabeça completa. É isso que torna um contexto de 32K viável num notebook e não numa estação de trabalho, e a razão de a garantia de processamento local ser prática e não teórica.
Raciocínio que você liga quando ele vale o custo.
O modo de raciocínio é alternável na hora da inferência, e não assado dentro do modelo. Extração, classificação e formatação de rotina rodam sem ele e continuam rápidas; planejamento em várias etapas e refatorações difíceis ganham o orçamento extra de raciocínio. O escalonador de agentes faz essa escolha por tarefa, e você pode sobrescrevê-la.
- Alternado por pedido, não por instalação
- O trabalho de rotina continua de baixa latência por padrão
- O escalonador de agentes decide, e mostra a você o que decidiu
- Os orçamentos valem nos dois casos; modo de raciocínio não é cheque em branco
- DeslClassificação, extração, formatação, preenchimento de modelos
- DeslRoteamento simples e geração de embeddings
- LigRefatorações em vários arquivos e edições que respeitam dependências
- LigPlanejamento em várias etapas, onde errar o primeiro passo sai caro
O Megha é uma escolha, não um padrão que você não pode mudar.
O MeghaOS traz um modelo pequeno embutido para que o primeiro uso funcione offline em hardware modesto. O Megha, e qualquer outro que você prefira, está a uma instalação de distância.
Um modelo compacto vem embutido
Para o primeiro uso funcionar offline em qualquer máquina suportada, inclusive Macs e PCs mais antigos, com pouca memória. Ele dá conta bem de roteamento, extração, classificação e escolha de ferramentas, e é deliberadamente pequeno, não deliberadamente capaz.
Instalar o Megha é uma linha
Puxe-o pelo Ollama ou sirva-o com vLLM e aponte o MeghaOS para o endpoint. É esta a configuração que o cartão do modelo acima descreve, e é o que recomendamos em qualquer máquina com memória sobrando.
Ou traga um modelo completamente diferente
Qualquer coisa que você consiga servir por Ollama ou vLLM funciona: Qwen, DeepSeek, Kimi, ou o que você já roda. O MeghaOS fala com um endpoint compatível com OpenAI e não se importa com o que está atrás dele.
Ou use um provedor hospedado
Aponte-o para uma API na nuvem com a sua própria chave, ou assine o MeghaOS Pro. Os pedidos que você enviar por esse caminho saem do dispositivo, e é essa a troca inteira. Veja a página de preços para o que isso custa e o que compra.
Rode-o fora do MeghaOS, se quiser.
O modelo se integra aos runtimes que você já usa. Nada nele está preso ao sistema operacional.
ollama run meghavllm serve meghaos/megha-0.6bpython -m sglang.launch_server --model-path meghaos/megha-0.6bfrom transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")Pesos do modelo e configurações do tokenizador em hf.co/meghaos/megha-0.6b, sob Apache 2.0.
O que um modelo de 0,6B não é.
Ser franco quanto a isto é a razão para confiar no resto da página.
Não é um modelo de fronteira
Em raciocínio aberto, escrita longa e problemas novos e difíceis, um modelo de 0,6B não vai igualar um sistema de fronteira. E nem está tentando.
A troca é deliberada
Para classificação, extração, roteamento, formatação e chamada de ferramentas — que é a maior parte do que um agente de fato faz — um modelo local pequeno é mais rápido, sai de graça por chamada e não sofre limite de taxa.
Híbrido é suportado, não obrigatório
Você pode apontar o MeghaOS para um modelo local maior ou para um hospedado. Tudo o que você enviar a um provedor hospedado sai do dispositivo. É isso que enviar para lá significa, e é uma configuração que você escolhe, não algo que acontece caladamente.
O local elimina uma classe inteira de falhas
Boa parte dos erros de LLM em produção são limites de taxa. Um modelo local não pode ser limitado assim, então um agente segue trabalhando numa janela em que um hospedado travaria.
Rode o modelo ondeos dados já moram.
O MeghaOS roda um modelo compacto de saída e deixa você trocar pelo Megha, por outro modelo aberto ou por um provedor hospedado quando quiser.