データがすでにある場所で動くだけの小ささ。
Megha は 0.6B パラメータの因果言語モデルで、エージェント型の作業、コーディング、多言語での指示追従のために作られています。小ささこそが要点です。ローカル処理が本当の保証になるのは、モデルが実際にあなたのマシンに収まるときだけだからです。
モデルカードの全部を、一画面で。
- パラメータ
- 0.6B
- 合計
- 埋め込みを除く
- 0.44B
- パラメータ
- 層
- 28
- Transformer ブロック
- アテンションヘッド
- 16Q / 8KV
- グループ化クエリ
- コンテキスト長
- 32,768
- トークン
- アーキテクチャ
- 因果 LM
- デコーダのみ
- 言語
- 100+
- 指示追従
- 思考モード
- 切り替え可
- 推論時に
28 層、グループ化クエリ・アテンション。
16 個のクエリヘッドが 8 個のキー/バリューヘッドを共有するグループ化クエリ・アテンションが、KV キャッシュを小さく保ち、一般向けのハードウェアでも 32K のコンテキストを成り立たせています。
グループ化クエリ・アテンション · 16Q / 8KV
キー/バリューヘッドをクエリヘッド間で共有すると、KV キャッシュは完全なマルチヘッド・アテンションのおよそ半分で済みます。だからこそ 32K のコンテキストが、ワークステーションではなくノートパソコンで成り立ちます。ローカル処理の保証が理屈ではなく実務になるのも、そのためです。
見合うときだけ入れられる推論。
思考モードはモデルに焼き付けるのではなく、推論時に切り替えます。日常の抽出・分類・整形はこれを使わずに速いまま。多段の計画や難しいリファクタには、余分な推論の予算を回します。エージェントスケジューラが作業ごとに選び、あなたはそれを上書きできます。
- 切り替えは要求ごと。導入ごとではありません
- 日常の作業は既定のまま低遅延
- エージェントスケジューラが判断し、その判断を見せます
- どちらでも予算は効きます。思考モードは白紙の小切手ではありません
- オフ分類、抽出、整形、テンプレートの穴埋め
- オフ単純な振り分けと埋め込みの生成
- オン複数ファイルにまたがるリファクタと、依存を踏まえた編集
- オン最初の一手を誤ると高くつく、多段の計画
Megha は選択肢であって、変えられない既定ではありません。
MeghaOS は小型のモデルを同梱しているので、控えめなハードウェアでも初回起動がオフラインで成り立ちます。Megha も、ほかにお好みのものも、インストール一回の距離です。
小型のモデルを同梱しています
対応するどのマシンでも、メモリの限られた古い Mac や PC も含めて、初回起動がオフラインで成り立つように。振り分け、抽出、分類、道具選びはよくこなします。あえて小さく作ってあり、あえて強く作ってはいません。
Megha のインストールは一行
Ollama で取ってくるか vLLM で配信し、MeghaOS をそのエンドポイントに向けてください。上のモデルカードが述べているのはこの構成で、メモリに余裕のあるマシンではこれをお勧めします。
まったく別のモデルを持ち込んでも
Ollama や vLLM で配信できるものなら何でも動きます。Qwen でも DeepSeek でも Kimi でも、すでに動かしているものでも。MeghaOS は OpenAI 互換のエンドポイントと話すだけで、その裏が何かは気にしません。
ホスト型の提供元を使っても
自分の鍵でクラウド API に向けるか、MeghaOS Pro を契約してください。この経路に回した要求は端末から出ていきます。それが取り引きのすべてです。何にいくらかかり、何が手に入るかは料金のページをご覧ください。
望むなら MeghaOS の外でも動かせます。
このモデルは、あなたがすでに使っているランタイムに収まります。オペレーティングシステムに縛られている部分はありません。
ollama run meghavllm serve meghaos/megha-0.6bpython -m sglang.launch_server --model-path meghaos/megha-0.6bfrom transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")モデルの重みとトークナイザ設定は hf.co/meghaos/megha-0.6b にて、Apache 2.0 で公開しています。
0.6B のモデルではないもの。
ここを正直に書いていることが、このページの残りを信じてよい理由です。
フロンティアモデルではありません
開かれた問いの推論、長文の執筆、難しい新規の問題では、0.6B のモデルはフロンティアの系にかないません。かなおうともしていません。
この取り引きは意図したもの
分類、抽出、振り分け、整形、道具の呼び出し。エージェントが実際にやっていることの大半はこれで、そこでは小さなローカルモデルのほうが速く、呼び出しごとの費用がなく、レート制限とも無縁です。
ハイブリッドは可能ですが、必須ではありません
MeghaOS をより大きなローカルモデルにも、ホスト型のモデルにも向けられます。ホスト型の提供元へ回したものは端末から出ていきます。そこへ回すとはそういうことで、これはあなたが選ぶ設定であって、黙って起きることではありません。
ローカルは失敗の型をひとつ丸ごと消す
本番の LLM のエラーのかなりの割合はレート制限です。ローカルモデルにはレート制限がかからないので、ホスト型なら止まっていた時間帯でも、エージェントは働き続けられます。