Saltar al contenido
MeghaOS

Selecciona idioma

MeghaOS habla más de 100 idiomas en tu propia máquina. Este sitio está disponible por completo en todos los idiomas que aparecen aquí; nuestras páginas legales y las entradas del blog siguen en inglés.

FIG 8.0 · Ficha del modelo

Lo bastante pequeño para correrdonde ya están tus datos.

Megha es un modelo de lenguaje causal de 0,6B de parámetros, hecho para flujos agénticos, tareas de programación y seguimiento de instrucciones en varios idiomas. El tamaño es la idea: el procesamiento local solo es una garantía real si el modelo cabe de verdad en tu máquina.

FIG 8.1 · Especificación

La ficha entera del modelo, en una pantalla.

Parámetros
0,6B
en total
Sin embedding
0,44B
parámetros
Capas
28
bloques transformer
Cabezas de atención
16Q / 8KV
grouped-query
Longitud de contexto
32.768
tokens
Arquitectura
LM causal
solo decodificador
Idiomas
100+
siguiendo instrucciones
Modo de razonamiento
Conmutable
en tiempo de inferencia
FIG 8.2 · Esquema

28 capas, atención de consultas agrupadas.

La atención de consultas agrupadas, con 16 cabezas de consulta compartiendo 8 cabezas de clave/valor, es lo que mantiene la caché KV lo bastante pequeña para un contexto de 32K en hardware de consumo.

01
02
03
04
05
06
07
08
09
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
embedding · 0,16B
Por bloque

Atención de consultas agrupadas · 16Q / 8KV

16 cabezas de consulta8 cabezas de clave/valor · compartidas

Compartir cabezas de clave/valor entre las de consulta reduce la caché KV casi a la mitad frente a la atención multicabeza completa. Eso es lo que hace viable un contexto de 32K en un portátil y no en una estación de trabajo, y la razón de que la garantía de procesamiento local sea práctica en vez de teórica.

FIG 8.3 · Modo de razonamiento

Razonamiento que enciendes cuando compensa su coste.

El modo de razonamiento se conmuta en tiempo de inferencia, no viene cocido en el modelo. La extracción, la clasificación y el formateo de rutina corren sin él y siguen siendo rápidos; la planificación en varios pasos y las refactorizaciones difíciles reciben el presupuesto extra de razonamiento. El planificador de agentes toma esa decisión por tarea, y tú puedes anularla.

  • Se conmuta por petición, no por despliegue
  • El trabajo de rutina sigue siendo de baja latencia por defecto
  • El planificador de agentes decide, y te enseña qué decidió
  • Los presupuestos se aplican igual; el modo de razonamiento no es un cheque en blanco
Cuándo entra
  • NoClasificación, extracción, formateo, relleno de plantillas
  • NoEnrutado simple y generación de embeddings
  • SíRefactorizaciones de varios archivos y ediciones conscientes de dependencias
  • SíPlanificación de varios pasos donde equivocar el primero sale caro
FIG 8.4 · Qué corre realmente

Megha es una elección, no un valor por defecto que no puedas cambiar.

MeghaOS incluye un modelo pequeño para que el primer arranque funcione sin conexión en hardware modesto. Megha, y cualquier otro que prefieras, está a una instalación de distancia.

Se incluye un modelo compacto

Para que el primer arranque funcione sin conexión en cualquier máquina soportada, incluidos Macs y PCs antiguos con poca memoria. Se le da bien el enrutado, la extracción, la clasificación y la elección de herramientas, y es deliberadamente pequeño, no deliberadamente potente.

Instalar Megha es una línea

Descárgalo con Ollama o sírvelo con vLLM y apunta MeghaOS al endpoint. Esta es la configuración que describe la ficha de arriba, y es la que recomendamos en cualquier máquina con memoria de sobra.

O trae un modelo completamente distinto

Vale cualquier cosa que puedas servir con Ollama o vLLM: Qwen, DeepSeek, Kimi o lo que ya uses. MeghaOS habla con un endpoint compatible con OpenAI y no le importa qué hay detrás.

O usa un proveedor alojado

Apúntalo a una API en la nube con tu propia clave, o suscríbete a MeghaOS Pro. Las peticiones que encamines así salen del dispositivo, y ese es todo el intercambio. Mira la página de precios para ver qué cuesta y qué compra.

FIG 8.5 · Despliegue

Ejecútalo fuera de MeghaOS si quieres.

El modelo se integra con los runtimes que ya usas. Nada en él está atado al sistema operativo.

Ollama
ollama run megha
vLLM
vllm serve meghaos/megha-0.6b
SGLang
python -m sglang.launch_server --model-path meghaos/megha-0.6b
Transformers
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")

Pesos del modelo y configuraciones del tokenizador en hf.co/meghaos/megha-0.6b, bajo Apache 2.0.

FIG 8.6 · Límites

Lo que un modelo de 0,6B no es.

Ser franco con esto es la razón para fiarse del resto de la página.

No es un modelo de frontera

En razonamiento abierto, escritura larga y problemas nuevos y difíciles, un modelo de 0,6B no igualará a un sistema de frontera. Tampoco lo pretende.

El intercambio es deliberado

Para clasificación, extracción, enrutado, formateo y llamadas a herramientas —que es la mayor parte de lo que hace un agente— un modelo local pequeño es más rápido, gratis por llamada e inmune a los límites de tasa.

Lo híbrido está soportado, no es obligatorio

Puedes apuntar MeghaOS a un modelo local más grande o a uno alojado. Todo lo que encamines a un proveedor alojado sale del dispositivo. Eso es lo que significa encaminar allí, y es un ajuste que eliges tú, no algo que ocurre en silencio.

Lo local elimina una clase entera de fallos

Buena parte de los errores de LLM en producción son límites de tasa. A un modelo local no se le puede limitar la tasa, así que un agente puede seguir trabajando en una ventana donde uno alojado se atascaría.

Ejecuta el modelo dondelos datos ya viven.

MeghaOS corre un modelo compacto de fábrica y te deja cambiarlo por Megha, por otro modelo abierto o por un proveedor alojado cuando quieras.