सामग्री पर जाएं
MeghaOS

भाषा चुनें

MeghaOS आपकी अपनी मशीन पर 100 से ज़्यादा भाषाएं बोलता है। यह साइट यहां दी गई हर भाषा में पूरी तरह उपलब्ध है; हमारे कानूनी पेज और ब्लॉग लेख अंग्रेज़ी में ही रहते हैं।

FIG 8.0 · मॉडल कार्ड

इतना छोटा कि वहीं चल जाएजहाँ आपका डेटा पहले से है।

Megha 0.6B पैरामीटर वाला कॉज़ल भाषा मॉडल है, जो एजेंटिक कामकाज, कोडिंग और कई भाषाओं में निर्देश मानने के लिए बना है। आकार ही असल बात है: स्थानीय प्रोसेसिंग तभी सच्ची गारंटी है जब मॉडल वाक़ई आपकी मशीन में समा जाए।

FIG 8.1 · विनिर्देश

पूरा मॉडल कार्ड, एक ही स्क्रीन पर।

पैरामीटर
0.6B
कुल
एम्बेडिंग छोड़कर
0.44B
पैरामीटर
परतें
28
ट्रांसफ़ॉर्मर ब्लॉक
अटेंशन हेड
16Q / 8KV
ग्रुप्ड-क्वेरी
कॉन्टेक्स्ट लंबाई
32,768
टोकन
आर्किटेक्चर
कॉज़ल LM
सिर्फ़ डिकोडर
भाषाएँ
100+
निर्देश मानने वाली
थिंकिंग मोड
चालू-बंद
इन्फ़रेंस के समय
FIG 8.2 · रेखाचित्र

28 परतें, ग्रुप्ड-क्वेरी अटेंशन।

ग्रुप्ड-क्वेरी अटेंशन, जिसमें 16 क्वेरी हेड 8 की/वैल्यू हेड साझा करते हैं, वही KV कैश को इतना छोटा रखती है कि आम हार्डवेयर पर 32K कॉन्टेक्स्ट संभव हो जाए।

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
एम्बेडिंग · 0.16B
हर ब्लॉक में

ग्रुप्ड-क्वेरी अटेंशन · 16Q / 8KV

16 क्वेरी हेड8 की/वैल्यू हेड · साझा

क्वेरी हेड के बीच की/वैल्यू हेड साझा करने से पूरी मल्टी-हेड अटेंशन के मुक़ाबले KV कैश लगभग आधा रह जाता है। इसी वजह से 32K कॉन्टेक्स्ट किसी वर्कस्टेशन के बजाय लैपटॉप पर भी चल पाता है, और इसी वजह से स्थानीय प्रोसेसिंग की गारंटी सैद्धांतिक नहीं, व्यावहारिक है।

FIG 8.3 · थिंकिंग मोड

ऐसा तर्क जिसे आप तब चालू करें जब वह अपनी क़ीमत वसूल करे।

थिंकिंग मोड मॉडल में पकाया हुआ नहीं है, इन्फ़रेंस के समय चालू-बंद होता है। रोज़मर्रा की निकासी, वर्गीकरण और फ़ॉर्मैटिंग इसके बिना चलती है और तेज़ बनी रहती है; कई क़दमों वाली योजना और कठिन रीफ़ैक्टर को तर्क का अतिरिक्त बजट मिलता है। एजेंट शेड्यूलर यह चुनाव हर काम पर करता है, और आप उसे बदल सकते हैं।

  • हर अनुरोध पर चालू-बंद, हर तैनाती पर नहीं
  • रोज़मर्रा का काम डिफ़ॉल्ट रूप से कम विलंब वाला बना रहता है
  • एजेंट शेड्यूलर तय करता है, और यह भी दिखाता है कि क्या तय किया
  • बजट दोनों हालात में लागू रहता है; थिंकिंग मोड कोई खुला चेक नहीं
यह कब जुड़ता है
  • बंदवर्गीकरण, निकासी, फ़ॉर्मैटिंग, टेम्पलेट भरना
  • बंदसाधारण रूटिंग और एम्बेडिंग बनाना
  • चालूकई फ़ाइलों में रीफ़ैक्टर और निर्भरताओं का ध्यान रखते बदलाव
  • चालूकई क़दमों वाली योजना, जहाँ पहला क़दम ग़लत पड़ना महँगा हो
FIG 8.4 · असल में चलता क्या है

Megha एक चुनाव है, ऐसा डिफ़ॉल्ट नहीं जिसे आप बदल न सकें।

MeghaOS साथ में एक छोटा मॉडल देता है, ताकि मामूली हार्डवेयर पर भी पहली बार बिना नेट के चले। Megha, और जो कुछ भी आप पसंद करें, बस एक इंस्टॉल दूर है।

एक छोटा मॉडल साथ आता है

ताकि हर समर्थित मशीन पर पहली बार बिना नेट के चले — पुराने Mac और कम मेमोरी वाले PC पर भी। यह रूटिंग, निकासी, वर्गीकरण और औज़ार चुनने में अच्छा है, और यह जान-बूझकर छोटा है, जान-बूझकर सक्षम नहीं।

Megha एक लाइन में इंस्टॉल हो जाता है

इसे Ollama से खींच लीजिए या vLLM से परोसिए, और MeghaOS को उस एंडपॉइंट की ओर मोड़ दीजिए। ऊपर का मॉडल कार्ड इसी कॉन्फ़िगरेशन का ब्योरा देता है, और जिस भी मशीन में मेमोरी बची हो, हम यही सुझाते हैं।

या कोई बिल्कुल दूसरा मॉडल ले आइए

जो कुछ आप Ollama या vLLM से परोस सकें, वह चलेगा: Qwen, DeepSeek, Kimi, या जो भी आप पहले से चला रहे हों। MeghaOS एक OpenAI-संगत एंडपॉइंट से बात करता है और उसके पीछे क्या है, इससे उसे फ़र्क़ नहीं पड़ता।

या किसी होस्टेड प्रदाता का इस्तेमाल कीजिए

अपनी चाबी के साथ इसे किसी क्लाउड API की ओर मोड़िए, या MeghaOS Pro लीजिए। इस रास्ते से भेजे गए अनुरोध डिवाइस से बाहर जाते हैं — यही पूरा सौदा है। इसकी क़ीमत और उससे क्या मिलता है, यह क़ीमत वाले पन्ने पर देखिए।

FIG 8.5 · तैनाती

चाहें तो इसे MeghaOS के बाहर भी चलाइए।

यह मॉडल उन्हीं रनटाइम के साथ जुड़ जाता है जो आप पहले से इस्तेमाल करते हैं। इसमें कुछ भी ऑपरेटिंग सिस्टम से बँधा नहीं है।

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

मॉडल वेट और टोकनाइज़र कॉन्फ़िग hf.co/meghaos/megha-0.6b पर, Apache 2.0 के तहत उपलब्ध हैं।

FIG 8.6 · सीमाएँ

0.6B का मॉडल क्या नहीं है।

इस बारे में सीधा-सीधा कह देना ही वह वजह है जिससे इस पन्ने की बाक़ी बातों पर भरोसा किया जा सके।

यह फ़्रंटियर मॉडल नहीं है

खुले-आम तर्क, लंबे लेखन और कठिन नई समस्याओं में 0.6B का मॉडल किसी फ़्रंटियर सिस्टम की बराबरी नहीं करेगा। वह कोशिश भी नहीं कर रहा।

यह अदला-बदली जान-बूझकर है

वर्गीकरण, निकासी, रूटिंग, फ़ॉर्मैटिंग और औज़ार बुलाने में — जो असल में किसी एजेंट का ज़्यादातर काम है — छोटा स्थानीय मॉडल तेज़ है, हर कॉल पर मुफ़्त है, और रेट लिमिट से अछूता है।

हाइब्रिड समर्थित है, अनिवार्य नहीं

आप MeghaOS को किसी बड़े स्थानीय मॉडल या होस्टेड मॉडल की ओर मोड़ सकते हैं। जो कुछ आप होस्टेड प्रदाता को भेजेंगे, वह डिवाइस से बाहर जाएगा। वहाँ भेजने का मतलब यही होता है, और यह ऐसी सेटिंग है जिसे आप चुनते हैं, न कि कुछ ऐसा जो चुपचाप हो जाए।

स्थानीय होना विफलताओं की एक पूरी क़िस्म हटा देता है

उत्पादन में LLM की बड़ी हिस्सेदारी वाली ग़लतियाँ रेट लिमिट होती हैं। स्थानीय मॉडल पर रेट लिमिट लग ही नहीं सकती, इसलिए एजेंट उस दौर में भी काम करता रहता है जब कोई होस्टेड मॉडल अटक जाता।

मॉडल को वहीं चलाइएजहाँ डेटा पहले से रहता है।

MeghaOS डिब्बे से निकलते ही एक छोटा मॉडल चलाता है, और जब चाहें आप उसकी जगह Megha, कोई दूसरा खुला मॉडल, या कोई होस्टेड प्रदाता रख सकते हैं।