小到可以就地运行,就在你数据已经所在的地方。
Megha 是一个 0.6B 参数的因果语言模型,为智能体流程、写代码和多语言指令跟随而建。小,正是关键:只有当模型真的装得进你的机器,本地处理才算得上一个真正的保证。
整张模型卡,一屏看完。
- 参数量
- 0.6B
- 总计
- 不含嵌入
- 0.44B
- 参数
- 层数
- 28
- Transformer 块
- 注意力头
- 16Q / 8KV
- 分组查询
- 上下文长度
- 32,768
- token
- 架构
- 因果 LM
- 仅解码器
- 语言
- 100+
- 可跟随指令
- 思考模式
- 可开关
- 在推理时
28 层,分组查询注意力。
分组查询注意力让 16 个查询头共享 8 个键/值头,正是这一点把 KV 缓存压得足够小,使 32K 上下文在消费级硬件上也成立。
分组查询注意力 · 16Q / 8KV
让查询头共享键/值头,KV 缓存比完整多头注意力大约省掉一半。正因如此,32K 的上下文才能跑在一台笔记本上,而不是非得一台工作站;也正因如此,"本地处理"这个保证才是可用的,而不是纸面上的。
值这个价的时候,你才把推理打开。
思考模式不是烧进模型里的,而是在推理时开关。日常的抽取、分类和排版不开它,照样很快;多步的规划和棘手的重构则拿到额外的推理预算。智能体调度器按任务替你选,而你可以推翻它。
- 按每次请求切换,而不是按每次部署
- 日常活儿默认保持低延迟
- 智能体调度器来定,并且把它定了什么摆给你看
- 两种情况下预算都照样管着;思考模式不是一张空白支票
- 关分类、抽取、排版、套模板
- 关简单的路由和生成嵌入
- 开跨多个文件的重构,以及顾及依赖的改动
- 开第一步走错就很贵的多步规划
Megha 是一个选择,而不是你改不了的默认值。
MeghaOS 随附一个小模型,好让第一次使用在普通配置的机器上也能离线跑起来。Megha,以及你更中意的任何一个,都只隔着一次安装。
随附一个小模型
好让每一台受支持的机器上,第一次使用都能离线跑起来——包括内存有限的老 Mac 和 PC。它在路由、抽取、分类和挑工具上表现不错,它是刻意做小的,不是刻意做强的。
装 Megha 只要一行
用 Ollama 拉下来,或者用 vLLM 提供服务,然后把 MeghaOS 指向那个端点。上面那张模型卡描述的就是这套配置,只要机器内存还有富余,我们都推荐这么做。
或者干脆换一个别的模型
凡是你能用 Ollama 或 vLLM 提供出来的都行:Qwen、DeepSeek、Kimi,或者你本来就在跑的那个。MeghaOS 只跟一个兼容 OpenAI 的端点对话,并不关心它背后是什么。
或者用一个托管服务商
拿你自己的密钥把它指向某个云 API,或者订阅 MeghaOS Pro。走这条路的请求会离开设备,这就是这笔交换的全部。花多少钱、买到什么,见价格页。
想的话,也可以在 MeghaOS 之外跑它。
这个模型能接进你本来就在用的运行时。它没有任何一处被锁死在这个操作系统上。
ollama run meghavllm serve meghaos/megha-0.6bpython -m sglang.launch_server --model-path meghaos/megha-0.6bfrom transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")模型权重与分词器配置在 hf.co/meghaos/megha-0.6b,采用 Apache 2.0 许可。
一个 0.6B 的模型不是什么。
这一段肯直说,才是这一页其余内容值得信的理由。
它不是前沿模型
在开放式推理、长篇写作和棘手的新问题上,0.6B 的模型比不过一个前沿系统。它也没打算比。
这笔交换是有意为之
分类、抽取、路由、排版和调用工具——智能体实际干的活儿大半就是这些——在这些事情上,一个小的本地模型更快,每次调用都不花钱,也不会撞上限流。
混合是支持的,不是必须的
你可以把 MeghaOS 指向一个更大的本地模型,或者一个托管模型。凡是你送往托管服务商的,都会离开设备。往那儿送本来就是这个意思,而这是一项由你选定的设置,不是悄悄发生的事。
本地一下子消掉一整类故障
生产环境里很大一部分 LLM 报错就是限流。本地模型没法被限流,所以在托管模型会卡住的那段时间里,智能体还能接着干活。