इतना छोटा कि वहीं चल जाएजहाँ आपका डेटा पहले से है।
Megha 0.6B पैरामीटर वाला कॉज़ल भाषा मॉडल है, जो एजेंटिक कामकाज, कोडिंग और कई भाषाओं में निर्देश मानने के लिए बना है। आकार ही असल बात है: स्थानीय प्रोसेसिंग तभी सच्ची गारंटी है जब मॉडल वाक़ई आपकी मशीन में समा जाए।
पूरा मॉडल कार्ड, एक ही स्क्रीन पर।
- पैरामीटर
- 0.6B
- कुल
- एम्बेडिंग छोड़कर
- 0.44B
- पैरामीटर
- परतें
- 28
- ट्रांसफ़ॉर्मर ब्लॉक
- अटेंशन हेड
- 16Q / 8KV
- ग्रुप्ड-क्वेरी
- कॉन्टेक्स्ट लंबाई
- 32,768
- टोकन
- आर्किटेक्चर
- कॉज़ल LM
- सिर्फ़ डिकोडर
- भाषाएँ
- 100+
- निर्देश मानने वाली
- थिंकिंग मोड
- चालू-बंद
- इन्फ़रेंस के समय
28 परतें, ग्रुप्ड-क्वेरी अटेंशन।
ग्रुप्ड-क्वेरी अटेंशन, जिसमें 16 क्वेरी हेड 8 की/वैल्यू हेड साझा करते हैं, वही KV कैश को इतना छोटा रखती है कि आम हार्डवेयर पर 32K कॉन्टेक्स्ट संभव हो जाए।
ग्रुप्ड-क्वेरी अटेंशन · 16Q / 8KV
क्वेरी हेड के बीच की/वैल्यू हेड साझा करने से पूरी मल्टी-हेड अटेंशन के मुक़ाबले KV कैश लगभग आधा रह जाता है। इसी वजह से 32K कॉन्टेक्स्ट किसी वर्कस्टेशन के बजाय लैपटॉप पर भी चल पाता है, और इसी वजह से स्थानीय प्रोसेसिंग की गारंटी सैद्धांतिक नहीं, व्यावहारिक है।
ऐसा तर्क जिसे आप तब चालू करें जब वह अपनी क़ीमत वसूल करे।
थिंकिंग मोड मॉडल में पकाया हुआ नहीं है, इन्फ़रेंस के समय चालू-बंद होता है। रोज़मर्रा की निकासी, वर्गीकरण और फ़ॉर्मैटिंग इसके बिना चलती है और तेज़ बनी रहती है; कई क़दमों वाली योजना और कठिन रीफ़ैक्टर को तर्क का अतिरिक्त बजट मिलता है। एजेंट शेड्यूलर यह चुनाव हर काम पर करता है, और आप उसे बदल सकते हैं।
- हर अनुरोध पर चालू-बंद, हर तैनाती पर नहीं
- रोज़मर्रा का काम डिफ़ॉल्ट रूप से कम विलंब वाला बना रहता है
- एजेंट शेड्यूलर तय करता है, और यह भी दिखाता है कि क्या तय किया
- बजट दोनों हालात में लागू रहता है; थिंकिंग मोड कोई खुला चेक नहीं
- बंदवर्गीकरण, निकासी, फ़ॉर्मैटिंग, टेम्पलेट भरना
- बंदसाधारण रूटिंग और एम्बेडिंग बनाना
- चालूकई फ़ाइलों में रीफ़ैक्टर और निर्भरताओं का ध्यान रखते बदलाव
- चालूकई क़दमों वाली योजना, जहाँ पहला क़दम ग़लत पड़ना महँगा हो
Megha एक चुनाव है, ऐसा डिफ़ॉल्ट नहीं जिसे आप बदल न सकें।
MeghaOS साथ में एक छोटा मॉडल देता है, ताकि मामूली हार्डवेयर पर भी पहली बार बिना नेट के चले। Megha, और जो कुछ भी आप पसंद करें, बस एक इंस्टॉल दूर है।
एक छोटा मॉडल साथ आता है
ताकि हर समर्थित मशीन पर पहली बार बिना नेट के चले — पुराने Mac और कम मेमोरी वाले PC पर भी। यह रूटिंग, निकासी, वर्गीकरण और औज़ार चुनने में अच्छा है, और यह जान-बूझकर छोटा है, जान-बूझकर सक्षम नहीं।
Megha एक लाइन में इंस्टॉल हो जाता है
इसे Ollama से खींच लीजिए या vLLM से परोसिए, और MeghaOS को उस एंडपॉइंट की ओर मोड़ दीजिए। ऊपर का मॉडल कार्ड इसी कॉन्फ़िगरेशन का ब्योरा देता है, और जिस भी मशीन में मेमोरी बची हो, हम यही सुझाते हैं।
या कोई बिल्कुल दूसरा मॉडल ले आइए
जो कुछ आप Ollama या vLLM से परोस सकें, वह चलेगा: Qwen, DeepSeek, Kimi, या जो भी आप पहले से चला रहे हों। MeghaOS एक OpenAI-संगत एंडपॉइंट से बात करता है और उसके पीछे क्या है, इससे उसे फ़र्क़ नहीं पड़ता।
या किसी होस्टेड प्रदाता का इस्तेमाल कीजिए
अपनी चाबी के साथ इसे किसी क्लाउड API की ओर मोड़िए, या MeghaOS Pro लीजिए। इस रास्ते से भेजे गए अनुरोध डिवाइस से बाहर जाते हैं — यही पूरा सौदा है। इसकी क़ीमत और उससे क्या मिलता है, यह क़ीमत वाले पन्ने पर देखिए।
चाहें तो इसे MeghaOS के बाहर भी चलाइए।
यह मॉडल उन्हीं रनटाइम के साथ जुड़ जाता है जो आप पहले से इस्तेमाल करते हैं। इसमें कुछ भी ऑपरेटिंग सिस्टम से बँधा नहीं है।
ollama run meghavllm serve meghaos/megha-0.6bpython -m sglang.launch_server --model-path meghaos/megha-0.6bfrom transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")मॉडल वेट और टोकनाइज़र कॉन्फ़िग hf.co/meghaos/megha-0.6b पर, Apache 2.0 के तहत उपलब्ध हैं।
0.6B का मॉडल क्या नहीं है।
इस बारे में सीधा-सीधा कह देना ही वह वजह है जिससे इस पन्ने की बाक़ी बातों पर भरोसा किया जा सके।
यह फ़्रंटियर मॉडल नहीं है
खुले-आम तर्क, लंबे लेखन और कठिन नई समस्याओं में 0.6B का मॉडल किसी फ़्रंटियर सिस्टम की बराबरी नहीं करेगा। वह कोशिश भी नहीं कर रहा।
यह अदला-बदली जान-बूझकर है
वर्गीकरण, निकासी, रूटिंग, फ़ॉर्मैटिंग और औज़ार बुलाने में — जो असल में किसी एजेंट का ज़्यादातर काम है — छोटा स्थानीय मॉडल तेज़ है, हर कॉल पर मुफ़्त है, और रेट लिमिट से अछूता है।
हाइब्रिड समर्थित है, अनिवार्य नहीं
आप MeghaOS को किसी बड़े स्थानीय मॉडल या होस्टेड मॉडल की ओर मोड़ सकते हैं। जो कुछ आप होस्टेड प्रदाता को भेजेंगे, वह डिवाइस से बाहर जाएगा। वहाँ भेजने का मतलब यही होता है, और यह ऐसी सेटिंग है जिसे आप चुनते हैं, न कि कुछ ऐसा जो चुपचाप हो जाए।
स्थानीय होना विफलताओं की एक पूरी क़िस्म हटा देता है
उत्पादन में LLM की बड़ी हिस्सेदारी वाली ग़लतियाँ रेट लिमिट होती हैं। स्थानीय मॉडल पर रेट लिमिट लग ही नहीं सकती, इसलिए एजेंट उस दौर में भी काम करता रहता है जब कोई होस्टेड मॉडल अटक जाता।
मॉडल को वहीं चलाइएजहाँ डेटा पहले से रहता है।
MeghaOS डिब्बे से निकलते ही एक छोटा मॉडल चलाता है, और जब चाहें आप उसकी जगह Megha, कोई दूसरा खुला मॉडल, या कोई होस्टेड प्रदाता रख सकते हैं।