Zum Inhalt springen
MeghaOS

Sprache auswählen

MeghaOS spricht über 100 Sprachen auf Ihrem eigenen Rechner. Diese Website ist in jeder hier aufgeführten Sprache vollständig verfügbar; unsere Rechtstexte und die Blogbeiträge bleiben auf Englisch.

FIG 8.0 · Modellkarte

Klein genug, um dort zu laufen,wo Ihre Daten ohnehin sind.

Megha ist ein kausales Sprachmodell mit 0,6 Mrd. Parametern, gebaut für agentische Abläufe, Programmieraufgaben und mehrsprachiges Befolgen von Anweisungen. Die Größe ist der Punkt: Lokale Verarbeitung ist nur dann eine echte Zusage, wenn das Modell tatsächlich auf Ihre Maschine passt.

FIG 8.1 · Spezifikation

Die ganze Modellkarte, auf einem Bildschirm.

Parameter
0,6 Mrd.
insgesamt
Ohne Embedding
0,44 Mrd.
Parameter
Schichten
28
Transformer-Blöcke
Attention-Köpfe
16Q / 8KV
Grouped-Query
Kontextlänge
32.768
Token
Architektur
Kausales LM
nur Decoder
Sprachen
100+
Anweisungen befolgend
Denkmodus
Zuschaltbar
zur Inferenzzeit
FIG 8.2 · Schema

28 Schichten, Grouped-Query-Attention.

Grouped-Query-Attention, bei der 16 Query-Köpfe sich 8 Key/Value-Köpfe teilen, hält den KV-Cache klein genug für 32K Kontext auf gewöhnlicher Hardware.

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
Embedding · 0,16 Mrd.
Je Block

Grouped-Query-Attention · 16Q / 8KV

16 Query-Köpfe8 Key/Value-Köpfe · geteilt

Key/Value-Köpfe über die Query-Köpfe zu teilen halbiert den KV-Cache gegenüber voller Multi-Head-Attention ungefähr. Genau das macht 32K Kontext auf einem Laptop statt auf einer Workstation möglich – und ist der Grund, warum die Zusage lokaler Verarbeitung praktisch statt theoretisch ist.

FIG 8.3 · Denkmodus

Nachdenken, das Sie zuschalten, wenn es seinen Preis wert ist.

Der Denkmodus ist zur Inferenzzeit zuschaltbar und nicht ins Modell eingebacken. Routinemäßiges Extrahieren, Klassifizieren und Formatieren läuft ohne ihn und bleibt schnell; mehrstufige Planung und schwierige Refaktorierungen bekommen das zusätzliche Denkbudget. Der Agenten-Scheduler trifft diese Wahl je Aufgabe, und Sie können sie überstimmen.

  • Je Anfrage zugeschaltet, nicht je Installation
  • Routinearbeit bleibt standardmäßig latenzarm
  • Der Agenten-Scheduler entscheidet und zeigt Ihnen, wie er entschieden hat
  • Budgets gelten so oder so; der Denkmodus ist kein Blankoscheck
Wann er greift
  • AusKlassifikation, Extraktion, Formatierung, Vorlagen ausfüllen
  • AusEinfaches Routing und Erzeugen von Embeddings
  • AnRefaktorierungen über mehrere Dateien und abhängigkeitsbewusste Änderungen
  • AnMehrstufige Planung, bei der ein falscher erster Schritt teuer ist
FIG 8.4 · Was tatsächlich läuft

Megha ist eine Wahl, keine Vorgabe, die Sie nicht ändern können.

MeghaOS bringt ein kleines Modell mit, damit der erste Start auf bescheidener Hardware offline funktioniert. Megha – und alles andere, was Sie lieber mögen – ist eine Installation entfernt.

Ein kompaktes Modell liegt bei

Damit der erste Start auf jeder unterstützten Maschine offline trägt, auch auf älteren Macs und PCs mit wenig Speicher. Es kann Routing, Extraktion, Klassifikation und Werkzeugauswahl gut, und es ist absichtlich klein statt absichtlich stark.

Megha ist eine Zeile Installation

Holen Sie es über Ollama oder liefern Sie es mit vLLM aus und richten Sie MeghaOS auf den Endpunkt. Das ist die Konfiguration, die die Modellkarte oben beschreibt, und die wir auf jeder Maschine mit Speicher übrig empfehlen.

Oder bringen Sie ein ganz anderes Modell mit

Alles, was Sie über Ollama oder vLLM ausliefern können, geht: Qwen, DeepSeek, Kimi oder was Sie ohnehin betreiben. MeghaOS spricht mit einem OpenAI-kompatiblen Endpunkt und interessiert sich nicht dafür, was dahintersteckt.

Oder nutzen Sie einen gehosteten Anbieter

Richten Sie es mit Ihrem eigenen Schlüssel auf eine Cloud-API oder buchen Sie MeghaOS Pro. Anfragen, die Sie so leiten, verlassen das Gerät – das ist der ganze Handel. Was das kostet und was es bringt, steht bei den Preisen.

FIG 8.5 · Betrieb

Betreiben Sie es auch außerhalb von MeghaOS.

Das Modell fügt sich in die Runtimes ein, die Sie schon nutzen. Nichts daran ist an das Betriebssystem gebunden.

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

Modellgewichte und Tokenizer-Konfigurationen unter hf.co/meghaos/megha-0.6b, Apache 2.0.

FIG 8.6 · Grenzen

Was ein 0,6-Mrd.-Modell nicht ist.

Dass wir hier gerade heraus sind, ist der Grund, dem Rest der Seite zu glauben.

Es ist kein Frontier-Modell

Bei offenem Nachdenken, langen Texten und schweren, neuartigen Problemen kommt ein 0,6-Mrd.-Modell an ein Frontier-System nicht heran. Das versucht es auch nicht.

Der Handel ist gewollt

Für Klassifikation, Extraktion, Routing, Formatierung und Werkzeugaufrufe – also das meiste, was ein Agent tatsächlich tut – ist ein kleines lokales Modell schneller, je Aufruf kostenlos und gegen Ratenbegrenzungen immun.

Hybrid wird unterstützt, nicht verlangt

Sie können MeghaOS auf ein größeres lokales oder ein gehostetes Modell richten. Alles, was Sie an einen gehosteten Anbieter leiten, verlässt das Gerät. Genau das heißt dorthin leiten, und es ist eine Einstellung, die Sie wählen, nicht etwas, das leise geschieht.

Lokal räumt eine ganze Fehlerklasse ab

Ein großer Teil der LLM-Fehler im Produktivbetrieb sind Ratenbegrenzungen. Ein lokales Modell lässt sich nicht drosseln, also kann ein Agent in einem Zeitfenster weiterarbeiten, in dem ein gehostetes stehen bliebe.

Betreiben Sie das Modell dort,wo die Daten schon liegen.

MeghaOS betreibt ab Werk ein kompaktes Modell und lässt Sie jederzeit auf Megha, ein anderes offenes Modell oder einen gehosteten Anbieter wechseln.