Aller au contenu
MeghaOS

Choisir la langue

MeghaOS parle plus de 100 langues sur votre propre machine. Ce site est intégralement disponible dans chacune des langues listées ici ; nos pages légales et les articles du blog restent en anglais.

FIG 8.0 · Fiche du modèle

Assez petit pour tournerlà où vos données sont déjà.

Megha est un modèle de langage causal de 0,6 milliard de paramètres, bâti pour les flux agentiques, les tâches de code et le suivi d'instructions multilingue. La taille, c'est justement le point : le traitement local n'est une vraie garantie que si le modèle tient effectivement sur votre machine.

FIG 8.1 · Spécification

Toute la fiche du modèle, sur un écran.

Paramètres
0,6 Md
au total
Hors embedding
0,44 Md
paramètres
Couches
28
blocs transformeurs
Têtes d'attention
16Q / 8KV
grouped-query
Longueur de contexte
32 768
jetons
Architecture
MdL causal
décodeur seul
Langues
100+
suivi d'instructions
Mode de réflexion
Activable
au moment de l'inférence
FIG 8.2 · Schéma

28 couches, attention à requêtes groupées.

L'attention à requêtes groupées, où 16 têtes de requête partagent 8 têtes clé/valeur, est ce qui garde le cache KV assez petit pour un contexte de 32K sur du matériel grand public.

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
embedding · 0,16 Md
Par bloc

Attention à requêtes groupées · 16Q / 8KV

16 têtes de requête8 têtes clé/valeur · partagées

Partager les têtes clé/valeur entre les têtes de requête réduit le cache KV de moitié environ face à une attention multi-têtes complète. C'est ce qui rend un contexte de 32K viable sur un portable plutôt que sur une station de travail, et la raison pour laquelle la garantie de traitement local est pratique et non théorique.

FIG 8.3 · Mode de réflexion

Un raisonnement que vous activez quand il vaut son coût.

Le mode de réflexion s'active au moment de l'inférence plutôt que d'être cuit dans le modèle. L'extraction, la classification et la mise en forme courantes tournent sans lui et restent rapides ; la planification en plusieurs étapes et les refontes difficiles obtiennent le budget de raisonnement en plus. L'ordonnanceur d'agents fait ce choix tâche par tâche, et vous pouvez le remplacer.

  • Activé par requête, pas par déploiement
  • Le travail courant reste à faible latence par défaut
  • L'ordonnanceur d'agents décide, et vous montre ce qu'il a décidé
  • Les budgets s'appliquent dans les deux cas ; le mode de réflexion n'est pas un chèque en blanc
Quand il entre en jeu
  • NonClassification, extraction, mise en forme, remplissage de gabarits
  • NonRoutage simple et génération d'embeddings
  • OuiRefontes multi-fichiers et modifications conscientes des dépendances
  • OuiPlanification en plusieurs étapes où se tromper au premier pas coûte cher
FIG 8.4 · Ce qui tourne vraiment

Megha est un choix, pas un réglage par défaut qu’on ne peut pas changer.

MeghaOS embarque un petit modèle pour que le premier lancement marche hors ligne sur du matériel modeste. Megha, et tout ce que vous préférez, est à une installation près.

Un modèle compact est fourni

Pour que le premier lancement marche hors ligne sur toute machine prise en charge, y compris les Mac et PC plus anciens à mémoire limitée. Il se débrouille bien en routage, extraction, classification et choix d'outils, et il est délibérément petit plutôt que délibérément puissant.

Installer Megha tient en une ligne

Récupérez-le via Ollama ou servez-le avec vLLM, puis pointez MeghaOS sur le point d'accès. C'est la configuration que décrit la fiche ci-dessus, et celle que nous recommandons sur toute machine ayant de la mémoire à revendre.

Ou apportez un tout autre modèle

Tout ce que vous pouvez servir via Ollama ou vLLM fonctionne : Qwen, DeepSeek, Kimi, ou ce que vous faites déjà tourner. MeghaOS parle à un point d'accès compatible OpenAI et se moque de ce qu'il y a derrière.

Ou passez par un fournisseur hébergé

Pointez-le sur une API cloud avec votre propre clé, ou souscrivez MeghaOS Pro. Les requêtes que vous acheminez ainsi quittent l'appareil, et c'est tout le marché. Voyez la page des tarifs pour ce que cela coûte et ce que cela achète.

FIG 8.5 · Déploiement

Faites-le tourner hors de MeghaOS si vous voulez.

Le modèle s'intègre aux runtimes que vous utilisez déjà. Rien en lui n'est verrouillé au système d'exploitation.

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

Poids du modèle et configurations du tokenizer sur hf.co/meghaos/megha-0.6b, sous Apache 2.0.

FIG 8.6 · Limites

Ce qu’un modèle de 0,6 milliard de paramètres n’est pas.

Être franc là-dessus est la raison de croire le reste de la page.

Ce n'est pas un modèle de pointe

Sur le raisonnement ouvert, l'écriture longue et les problèmes nouveaux et difficiles, un modèle de 0,6 milliard de paramètres n'égalera pas un système de pointe. Il n'essaie pas.

Le compromis est délibéré

Pour la classification, l'extraction, le routage, la mise en forme et l'appel d'outils — c'est-à-dire l'essentiel de ce que fait vraiment un agent — un petit modèle local est plus rapide, gratuit à l'appel et insensible aux limites de débit.

L’hybride est pris en charge, pas exigé

Vous pouvez pointer MeghaOS sur un modèle local plus grand ou sur un modèle hébergé. Tout ce que vous acheminez vers un fournisseur hébergé quitte l'appareil. C'est ce que veut dire y acheminer, et c'est un réglage que vous choisissez, pas quelque chose qui se produit en silence.

Le local supprime toute une classe de pannes

Une grande part des erreurs de LLM en production sont des limites de débit. Un modèle local ne peut pas être limité, donc un agent continue de travailler pendant une fenêtre où un modèle hébergé bloquerait.

Faites tourner le modèlelà où les données vivent déjà.

MeghaOS fait tourner un modèle compact d'emblée et vous laisse basculer sur Megha, sur un autre modèle ouvert ou sur un fournisseur hébergé quand vous voulez.