Guía · @vanlookeren
Un modelo open source corriendo entero en tu máquina. Sin nube, sin API key, sin pagar por token.
Esta es la pregunta que casi ninguna guía contesta primero, y es la única que importa. Un modelo local no se «instala mal»: entra en tu memoria o no entra. Si no entra, macOS empieza a usar disco como si fuera RAM y el modelo pasa de rápido a inservible.
| RAM | Qwen 3.8 27B · 4 bits | Qué hacer |
|---|---|---|
| 16 GB | No entra | Andá por un modelo de 7B u 8B a 4 bits. Son buenos para tareas mecánicas y vuelan. |
| 32 GB | Entra, con contexto corto | El modelo carga bien. El contexto largo es lo que te va a quedar chico — mirá la sección de abajo. |
| 48 GB + | Entra cómodo | Es donde está medido todo lo de esta guía. Contexto largo sin pelear. |
Es gratis y hace de todo: descarga el modelo, lo corre, y levanta un servidor local compatible con la API de OpenAI. Ese servidor es lo que después te deja enchufarlo a otras herramientas.
Buscá qwen3.8 dentro de la app y elegí la build MLX cuantizada a 4 bits. MLX es el framework de Apple: en Apple Silicon rinde bastante más que las builds genéricas.
Los 4 bits no son un recorte menor. Son la diferencia entre que el modelo entre en tu Mac o no entre.
Cargá el modelo desde la app y escribile algo en el chat. Si responde fluido, ya está: tenés un modelo corriendo local.
Si en cambio se arrastra y el ventilador despega, es memoria — volvé a la tabla de arriba.
En la pestaña de servidor de LM Studio, dale a arrancar. Queda escuchando en tu propia máquina y cualquier herramienta que hable el protocolo de OpenAI puede usarlo apuntando ahí.
http://127.0.0.1:1234/v1
Acá está la parte que decide si tu experiencia es buena o frustrante. El contexto —cuánto texto puede tener en la cabeza a la vez— no es gratis: se paga en memoria, aparte de lo que pesa el modelo.
Es decir: llenar el contexto nativo cuesta 16 GiB extra, encima de los 21 del modelo. Total, unos 37 GB solo para tenerlo abierto.
En una Mac de 48 GB el límite real no son los 48: es cuánta memoria le permite macOS a la GPU, que ronda los 36 GB. Por eso 196.608 es el punto seguro y el contexto nativo completo se queda afuera por poco.
Subir ese techo se puede, pero es tocar el sistema. No hace falta para empezar.
Si querés fijarlo desde la terminal en vez de la interfaz:
lms load qwen3.8-27b-mlx --context-length 196608 --parallel 1 -y
El --parallel 1 importa: cada conversación simultánea reserva su propio contexto. Cuatro sesiones en paralelo a 196.000 tokens no entran en ninguna máquina.
La ficha oficial anuncia un millón de tokens de contexto. En esta build no aplica: no trae activada la técnica que lo habilita. Y aunque la trajera, ese contexto solo en memoria serían 64 GiB.
Tener el modelo corriendo es la mitad. La otra mitad es darle trabajo: que las tareas mecánicas —resúmenes, borradores largos, transformaciones repetitivas— dejen de gastar tu plan pago y las haga el modelo local, que no cobra.
Eso es exactamente lo que hace este repo: