Lo bastante pequeño para correrdonde ya están tus datos.
Megha es un modelo de lenguaje causal de 0,6B de parámetros, hecho para flujos agénticos, tareas de programación y seguimiento de instrucciones en varios idiomas. El tamaño es la idea: el procesamiento local solo es una garantía real si el modelo cabe de verdad en tu máquina.
La ficha entera del modelo, en una pantalla.
- Parámetros
- 0,6B
- en total
- Sin embedding
- 0,44B
- parámetros
- Capas
- 28
- bloques transformer
- Cabezas de atención
- 16Q / 8KV
- grouped-query
- Longitud de contexto
- 32.768
- tokens
- Arquitectura
- LM causal
- solo decodificador
- Idiomas
- 100+
- siguiendo instrucciones
- Modo de razonamiento
- Conmutable
- en tiempo de inferencia
28 capas, atención de consultas agrupadas.
La atención de consultas agrupadas, con 16 cabezas de consulta compartiendo 8 cabezas de clave/valor, es lo que mantiene la caché KV lo bastante pequeña para un contexto de 32K en hardware de consumo.
Atención de consultas agrupadas · 16Q / 8KV
Compartir cabezas de clave/valor entre las de consulta reduce la caché KV casi a la mitad frente a la atención multicabeza completa. Eso es lo que hace viable un contexto de 32K en un portátil y no en una estación de trabajo, y la razón de que la garantía de procesamiento local sea práctica en vez de teórica.
Razonamiento que enciendes cuando compensa su coste.
El modo de razonamiento se conmuta en tiempo de inferencia, no viene cocido en el modelo. La extracción, la clasificación y el formateo de rutina corren sin él y siguen siendo rápidos; la planificación en varios pasos y las refactorizaciones difíciles reciben el presupuesto extra de razonamiento. El planificador de agentes toma esa decisión por tarea, y tú puedes anularla.
- Se conmuta por petición, no por despliegue
- El trabajo de rutina sigue siendo de baja latencia por defecto
- El planificador de agentes decide, y te enseña qué decidió
- Los presupuestos se aplican igual; el modo de razonamiento no es un cheque en blanco
- NoClasificación, extracción, formateo, relleno de plantillas
- NoEnrutado simple y generación de embeddings
- SíRefactorizaciones de varios archivos y ediciones conscientes de dependencias
- SíPlanificación de varios pasos donde equivocar el primero sale caro
Megha es una elección, no un valor por defecto que no puedas cambiar.
MeghaOS incluye un modelo pequeño para que el primer arranque funcione sin conexión en hardware modesto. Megha, y cualquier otro que prefieras, está a una instalación de distancia.
Se incluye un modelo compacto
Para que el primer arranque funcione sin conexión en cualquier máquina soportada, incluidos Macs y PCs antiguos con poca memoria. Se le da bien el enrutado, la extracción, la clasificación y la elección de herramientas, y es deliberadamente pequeño, no deliberadamente potente.
Instalar Megha es una línea
Descárgalo con Ollama o sírvelo con vLLM y apunta MeghaOS al endpoint. Esta es la configuración que describe la ficha de arriba, y es la que recomendamos en cualquier máquina con memoria de sobra.
O trae un modelo completamente distinto
Vale cualquier cosa que puedas servir con Ollama o vLLM: Qwen, DeepSeek, Kimi o lo que ya uses. MeghaOS habla con un endpoint compatible con OpenAI y no le importa qué hay detrás.
O usa un proveedor alojado
Apúntalo a una API en la nube con tu propia clave, o suscríbete a MeghaOS Pro. Las peticiones que encamines así salen del dispositivo, y ese es todo el intercambio. Mira la página de precios para ver qué cuesta y qué compra.
Ejecútalo fuera de MeghaOS si quieres.
El modelo se integra con los runtimes que ya usas. Nada en él está atado al sistema operativo.
ollama run meghavllm serve meghaos/megha-0.6bpython -m sglang.launch_server --model-path meghaos/megha-0.6bfrom transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meghaos/megha-0.6b")Pesos del modelo y configuraciones del tokenizador en hf.co/meghaos/megha-0.6b, bajo Apache 2.0.
Lo que un modelo de 0,6B no es.
Ser franco con esto es la razón para fiarse del resto de la página.
No es un modelo de frontera
En razonamiento abierto, escritura larga y problemas nuevos y difíciles, un modelo de 0,6B no igualará a un sistema de frontera. Tampoco lo pretende.
El intercambio es deliberado
Para clasificación, extracción, enrutado, formateo y llamadas a herramientas —que es la mayor parte de lo que hace un agente— un modelo local pequeño es más rápido, gratis por llamada e inmune a los límites de tasa.
Lo híbrido está soportado, no es obligatorio
Puedes apuntar MeghaOS a un modelo local más grande o a uno alojado. Todo lo que encamines a un proveedor alojado sale del dispositivo. Eso es lo que significa encaminar allí, y es un ajuste que eliges tú, no algo que ocurre en silencio.
Lo local elimina una clase entera de fallos
Buena parte de los errores de LLM en producción son límites de tasa. A un modelo local no se le puede limitar la tasa, así que un agente puede seguir trabajando en una ventana donde uno alojado se atascaría.
- Dónde encaja el modelo en la arquitecturaLas seis capas entre el hardware y la interfaz compuesta.
- Inferencia local frente a inferencia alojadaQué es gratis porque corre en tu hardware, y qué no.
- Qué cambia un modelo local en el día a díaEl argumento de capacidad para ejecutar el modelo donde están los datos.
Ejecuta el modelo dondelos datos ya viven.
MeghaOS corre un modelo compacto de fábrica y te deja cambiarlo por Megha, por otro modelo abierto o por un proveedor alojado cuando quieras.