本文へスキップ
MeghaOS

言語を選択

MeghaOSはあなたのマシン上で100以上の言語を扱えます。このサイトはここに挙げたすべての言語で全ページご覧いただけます。法務ページとブログ記事は英語のままです。

FIG 8.0 · モデルカード

データがすでにある場所で動くだけの小ささ。

Megha は 0.6B パラメータの因果言語モデルで、エージェント型の作業、コーディング、多言語での指示追従のために作られています。小ささこそが要点です。ローカル処理が本当の保証になるのは、モデルが実際にあなたのマシンに収まるときだけだからです。

FIG 8.1 · 仕様

モデルカードの全部を、一画面で。

パラメータ
0.6B
合計
埋め込みを除く
0.44B
パラメータ
層
28
Transformer ブロック
アテンションヘッド
16Q / 8KV
グループ化クエリ
コンテキスト長
32,768
トークン
アーキテクチャ
因果 LM
デコーダのみ
言語
100+
指示追従
思考モード
切り替え可
推論時に
FIG 8.2 · 構造図

28 層、グループ化クエリ・アテンション。

16 個のクエリヘッドが 8 個のキー/バリューヘッドを共有するグループ化クエリ・アテンションが、KV キャッシュを小さく保ち、一般向けのハードウェアでも 32K のコンテキストを成り立たせています。

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
埋め込み · 0.16B
ブロックごと

グループ化クエリ・アテンション · 16Q / 8KV

クエリヘッド 16 個キー/バリューヘッド 8 個 · 共有

キー/バリューヘッドをクエリヘッド間で共有すると、KV キャッシュは完全なマルチヘッド・アテンションのおよそ半分で済みます。だからこそ 32K のコンテキストが、ワークステーションではなくノートパソコンで成り立ちます。ローカル処理の保証が理屈ではなく実務になるのも、そのためです。

FIG 8.3 · 思考モード

見合うときだけ入れられる推論。

思考モードはモデルに焼き付けるのではなく、推論時に切り替えます。日常の抽出・分類・整形はこれを使わずに速いまま。多段の計画や難しいリファクタには、余分な推論の予算を回します。エージェントスケジューラが作業ごとに選び、あなたはそれを上書きできます。

  • 切り替えは要求ごと。導入ごとではありません
  • 日常の作業は既定のまま低遅延
  • エージェントスケジューラが判断し、その判断を見せます
  • どちらでも予算は効きます。思考モードは白紙の小切手ではありません
どんなときに働くか
  • オフ分類、抽出、整形、テンプレートの穴埋め
  • オフ単純な振り分けと埋め込みの生成
  • オン複数ファイルにまたがるリファクタと、依存を踏まえた編集
  • オン最初の一手を誤ると高くつく、多段の計画
FIG 8.4 · 実際に動くもの

Megha は選択肢であって、変えられない既定ではありません。

MeghaOS は小型のモデルを同梱しているので、控えめなハードウェアでも初回起動がオフラインで成り立ちます。Megha も、ほかにお好みのものも、インストール一回の距離です。

小型のモデルを同梱しています

対応するどのマシンでも、メモリの限られた古い Mac や PC も含めて、初回起動がオフラインで成り立つように。振り分け、抽出、分類、道具選びはよくこなします。あえて小さく作ってあり、あえて強く作ってはいません。

Megha のインストールは一行

Ollama で取ってくるか vLLM で配信し、MeghaOS をそのエンドポイントに向けてください。上のモデルカードが述べているのはこの構成で、メモリに余裕のあるマシンではこれをお勧めします。

まったく別のモデルを持ち込んでも

Ollama や vLLM で配信できるものなら何でも動きます。Qwen でも DeepSeek でも Kimi でも、すでに動かしているものでも。MeghaOS は OpenAI 互換のエンドポイントと話すだけで、その裏が何かは気にしません。

ホスト型の提供元を使っても

自分の鍵でクラウド API に向けるか、MeghaOS Pro を契約してください。この経路に回した要求は端末から出ていきます。それが取り引きのすべてです。何にいくらかかり、何が手に入るかは料金のページをご覧ください。

FIG 8.5 · 動かし方

望むなら MeghaOS の外でも動かせます。

このモデルは、あなたがすでに使っているランタイムに収まります。オペレーティングシステムに縛られている部分はありません。

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

モデルの重みとトークナイザ設定は hf.co/meghaos/megha-0.6b にて、Apache 2.0 で公開しています。

FIG 8.6 · 限界

0.6B のモデルではないもの。

ここを正直に書いていることが、このページの残りを信じてよい理由です。

フロンティアモデルではありません

開かれた問いの推論、長文の執筆、難しい新規の問題では、0.6B のモデルはフロンティアの系にかないません。かなおうともしていません。

この取り引きは意図したもの

分類、抽出、振り分け、整形、道具の呼び出し。エージェントが実際にやっていることの大半はこれで、そこでは小さなローカルモデルのほうが速く、呼び出しごとの費用がなく、レート制限とも無縁です。

ハイブリッドは可能ですが、必須ではありません

MeghaOS をより大きなローカルモデルにも、ホスト型のモデルにも向けられます。ホスト型の提供元へ回したものは端末から出ていきます。そこへ回すとはそういうことで、これはあなたが選ぶ設定であって、黙って起きることではありません。

ローカルは失敗の型をひとつ丸ごと消す

本番の LLM のエラーのかなりの割合はレート制限です。ローカルモデルにはレート制限がかからないので、ホスト型なら止まっていた時間帯でも、エージェントは働き続けられます。

モデルを動かすのは、データがすでにある場所で。

MeghaOS は最初から小型のモデルを動かし、いつでも Megha や別の公開モデル、ホスト型の提供元に差し替えられます。