跳到正文
MeghaOS

选择语言

MeghaOS 能在你自己的机器上处理 100 多种语言。本站在此处列出的每一种语言中都已全部翻译完成;法律页面与博客文章保持英文。

FIG 8.0 · 模型卡

小到可以就地运行,就在你数据已经所在的地方。

Megha 是一个 0.6B 参数的因果语言模型,为智能体流程、写代码和多语言指令跟随而建。小,正是关键:只有当模型真的装得进你的机器,本地处理才算得上一个真正的保证。

FIG 8.1 · 规格

整张模型卡,一屏看完。

参数量
0.6B
总计
不含嵌入
0.44B
参数
层数
28
Transformer 块
注意力头
16Q / 8KV
分组查询
上下文长度
32,768
token
架构
因果 LM
仅解码器
语言
100+
可跟随指令
思考模式
可开关
在推理时
FIG 8.2 · 结构图

28 层,分组查询注意力。

分组查询注意力让 16 个查询头共享 8 个键/值头,正是这一点把 KV 缓存压得足够小,使 32K 上下文在消费级硬件上也成立。

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
嵌入 · 0.16B
每一块里

分组查询注意力 · 16Q / 8KV

16 个查询头8 个键/值头 · 共享

让查询头共享键/值头,KV 缓存比完整多头注意力大约省掉一半。正因如此,32K 的上下文才能跑在一台笔记本上,而不是非得一台工作站;也正因如此,"本地处理"这个保证才是可用的,而不是纸面上的。

FIG 8.3 · 思考模式

值这个价的时候,你才把推理打开。

思考模式不是烧进模型里的,而是在推理时开关。日常的抽取、分类和排版不开它,照样很快;多步的规划和棘手的重构则拿到额外的推理预算。智能体调度器按任务替你选,而你可以推翻它。

  • 按每次请求切换,而不是按每次部署
  • 日常活儿默认保持低延迟
  • 智能体调度器来定,并且把它定了什么摆给你看
  • 两种情况下预算都照样管着;思考模式不是一张空白支票
它什么时候介入
  • 关分类、抽取、排版、套模板
  • 关简单的路由和生成嵌入
  • 开跨多个文件的重构,以及顾及依赖的改动
  • 开第一步走错就很贵的多步规划
FIG 8.4 · 实际跑的是什么

Megha 是一个选择,而不是你改不了的默认值。

MeghaOS 随附一个小模型,好让第一次使用在普通配置的机器上也能离线跑起来。Megha,以及你更中意的任何一个,都只隔着一次安装。

随附一个小模型

好让每一台受支持的机器上,第一次使用都能离线跑起来——包括内存有限的老 Mac 和 PC。它在路由、抽取、分类和挑工具上表现不错,它是刻意做小的,不是刻意做强的。

装 Megha 只要一行

用 Ollama 拉下来,或者用 vLLM 提供服务,然后把 MeghaOS 指向那个端点。上面那张模型卡描述的就是这套配置,只要机器内存还有富余,我们都推荐这么做。

或者干脆换一个别的模型

凡是你能用 Ollama 或 vLLM 提供出来的都行:Qwen、DeepSeek、Kimi,或者你本来就在跑的那个。MeghaOS 只跟一个兼容 OpenAI 的端点对话,并不关心它背后是什么。

或者用一个托管服务商

拿你自己的密钥把它指向某个云 API,或者订阅 MeghaOS Pro。走这条路的请求会离开设备,这就是这笔交换的全部。花多少钱、买到什么,见价格页。

FIG 8.5 · 部署

想的话,也可以在 MeghaOS 之外跑它。

这个模型能接进你本来就在用的运行时。它没有任何一处被锁死在这个操作系统上。

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

模型权重与分词器配置在 hf.co/meghaos/megha-0.6b,采用 Apache 2.0 许可。

FIG 8.6 · 边界

一个 0.6B 的模型不是什么。

这一段肯直说,才是这一页其余内容值得信的理由。

它不是前沿模型

在开放式推理、长篇写作和棘手的新问题上,0.6B 的模型比不过一个前沿系统。它也没打算比。

这笔交换是有意为之

分类、抽取、路由、排版和调用工具——智能体实际干的活儿大半就是这些——在这些事情上,一个小的本地模型更快,每次调用都不花钱,也不会撞上限流。

混合是支持的,不是必须的

你可以把 MeghaOS 指向一个更大的本地模型,或者一个托管模型。凡是你送往托管服务商的,都会离开设备。往那儿送本来就是这个意思,而这是一项由你选定的设置,不是悄悄发生的事。

本地一下子消掉一整类故障

生产环境里很大一部分 LLM 报错就是限流。本地模型没法被限流,所以在托管模型会卡住的那段时间里,智能体还能接着干活。

把模型跑在数据本来就在的地方。

MeghaOS 开箱即跑一个小模型,你随时可以把它换成 Megha、另一个开放模型,或者一个托管服务商。