Assez petit pour tournerlà où vos données sont déjà.
Megha est un modèle de langage causal de 0,6 milliard de paramètres, bâti pour les flux agentiques, les tâches de code et le suivi d'instructions multilingue. La taille, c'est justement le point : le traitement local n'est une vraie garantie que si le modèle tient effectivement sur votre machine.
Toute la fiche du modèle, sur un écran.
- Paramètres
- 0,6 Md
- au total
- Hors embedding
- 0,44 Md
- paramètres
- Couches
- 28
- blocs transformeurs
- Têtes d'attention
- 16Q / 8KV
- grouped-query
- Longueur de contexte
- 32 768
- jetons
- Architecture
- MdL causal
- décodeur seul
- Langues
- 100+
- suivi d'instructions
- Mode de réflexion
- Activable
- au moment de l'inférence
28 couches, attention à requêtes groupées.
L'attention à requêtes groupées, où 16 têtes de requête partagent 8 têtes clé/valeur, est ce qui garde le cache KV assez petit pour un contexte de 32K sur du matériel grand public.
Attention à requêtes groupées · 16Q / 8KV
Partager les têtes clé/valeur entre les têtes de requête réduit le cache KV de moitié environ face à une attention multi-têtes complète. C'est ce qui rend un contexte de 32K viable sur un portable plutôt que sur une station de travail, et la raison pour laquelle la garantie de traitement local est pratique et non théorique.
Un raisonnement que vous activez quand il vaut son coût.
Le mode de réflexion s'active au moment de l'inférence plutôt que d'être cuit dans le modèle. L'extraction, la classification et la mise en forme courantes tournent sans lui et restent rapides ; la planification en plusieurs étapes et les refontes difficiles obtiennent le budget de raisonnement en plus. L'ordonnanceur d'agents fait ce choix tâche par tâche, et vous pouvez le remplacer.
- Activé par requête, pas par déploiement
- Le travail courant reste à faible latence par défaut
- L'ordonnanceur d'agents décide, et vous montre ce qu'il a décidé
- Les budgets s'appliquent dans les deux cas ; le mode de réflexion n'est pas un chèque en blanc
- NonClassification, extraction, mise en forme, remplissage de gabarits
- NonRoutage simple et génération d'embeddings
- OuiRefontes multi-fichiers et modifications conscientes des dépendances
- OuiPlanification en plusieurs étapes où se tromper au premier pas coûte cher
Megha est un choix, pas un réglage par défaut qu’on ne peut pas changer.
MeghaOS embarque un petit modèle pour que le premier lancement marche hors ligne sur du matériel modeste. Megha, et tout ce que vous préférez, est à une installation près.
Un modèle compact est fourni
Pour que le premier lancement marche hors ligne sur toute machine prise en charge, y compris les Mac et PC plus anciens à mémoire limitée. Il se débrouille bien en routage, extraction, classification et choix d'outils, et il est délibérément petit plutôt que délibérément puissant.
Installer Megha tient en une ligne
Récupérez-le via Ollama ou servez-le avec vLLM, puis pointez MeghaOS sur le point d'accès. C'est la configuration que décrit la fiche ci-dessus, et celle que nous recommandons sur toute machine ayant de la mémoire à revendre.
Ou apportez un tout autre modèle
Tout ce que vous pouvez servir via Ollama ou vLLM fonctionne : Qwen, DeepSeek, Kimi, ou ce que vous faites déjà tourner. MeghaOS parle à un point d'accès compatible OpenAI et se moque de ce qu'il y a derrière.
Ou passez par un fournisseur hébergé
Pointez-le sur une API cloud avec votre propre clé, ou souscrivez MeghaOS Pro. Les requêtes que vous acheminez ainsi quittent l'appareil, et c'est tout le marché. Voyez la page des tarifs pour ce que cela coûte et ce que cela achète.
Faites-le tourner hors de MeghaOS si vous voulez.
Le modèle s'intègre aux runtimes que vous utilisez déjà. Rien en lui n'est verrouillé au système d'exploitation.
ollama run meghavllm serve meghaos/megha-0.6bpython -m sglang.launch_server --model-path meghaos/megha-0.6bfrom transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")Poids du modèle et configurations du tokenizer sur hf.co/meghaos/megha-0.6b, sous Apache 2.0.
Ce qu’un modèle de 0,6 milliard de paramètres n’est pas.
Être franc là-dessus est la raison de croire le reste de la page.
Ce n'est pas un modèle de pointe
Sur le raisonnement ouvert, l'écriture longue et les problèmes nouveaux et difficiles, un modèle de 0,6 milliard de paramètres n'égalera pas un système de pointe. Il n'essaie pas.
Le compromis est délibéré
Pour la classification, l'extraction, le routage, la mise en forme et l'appel d'outils — c'est-à-dire l'essentiel de ce que fait vraiment un agent — un petit modèle local est plus rapide, gratuit à l'appel et insensible aux limites de débit.
L’hybride est pris en charge, pas exigé
Vous pouvez pointer MeghaOS sur un modèle local plus grand ou sur un modèle hébergé. Tout ce que vous acheminez vers un fournisseur hébergé quitte l'appareil. C'est ce que veut dire y acheminer, et c'est un réglage que vous choisissez, pas quelque chose qui se produit en silence.
Le local supprime toute une classe de pannes
Une grande part des erreurs de LLM en production sont des limites de débit. Un modèle local ne peut pas être limité, donc un agent continue de travailler pendant une fenêtre où un modèle hébergé bloquerait.
- Où le modèle se situe dans l’architectureLes six couches entre le matériel et l'interface composée.
- Inférence locale contre inférence hébergéeCe qui est gratuit parce que cela tourne sur votre matériel, et ce qui ne l’est pas.
- Ce qu’un modèle local change au quotidienL'argument de capacité pour faire tourner le modèle là où sont les données.
Faites tourner le modèlelà où les données vivent déjà.
MeghaOS fait tourner un modèle compact d'emblée et vous laisse basculer sur Megha, sur un autre modèle ouvert ou sur un fournisseur hébergé quand vous voulez.