Qwen 3.8 en tu Mac

Guía · @vanlookeren

Qwen 3.8 en tu Mac

Un modelo open source corriendo entero en tu máquina. Sin nube, sin API key, sin pagar por token.

Antes que nada: ¿te entra?

Esta es la pregunta que casi ninguna guía contesta primero, y es la única que importa. Un modelo local no se «instala mal»: entra en tu memoria o no entra. Si no entra, macOS empieza a usar disco como si fuera RAM y el modelo pasa de rápido a inservible.

Qué te entra según tu RAM
RAMQwen 3.8 27B · 4 bitsQué hacer
16 GB No entra Andá por un modelo de 7B u 8B a 4 bits. Son buenos para tareas mecánicas y vuelan.
32 GB Entra, con contexto corto El modelo carga bien. El contexto largo es lo que te va a quedar chico — mirá la sección de abajo.
48 GB + Entra cómodo Es donde está medido todo lo de esta guía. Contexto largo sin pelear.

Los cuatro pasos

  1. Instalá LM Studio

    Es gratis y hace de todo: descarga el modelo, lo corre, y levanta un servidor local compatible con la API de OpenAI. Ese servidor es lo que después te deja enchufarlo a otras herramientas.

  2. Descargá la variante MLX de 4 bits

    Buscá qwen3.8 dentro de la app y elegí la build MLX cuantizada a 4 bits. MLX es el framework de Apple: en Apple Silicon rinde bastante más que las builds genéricas.

    Los 4 bits no son un recorte menor. Son la diferencia entre que el modelo entre en tu Mac o no entre.

  3. Cargalo y probalo

    Cargá el modelo desde la app y escribile algo en el chat. Si responde fluido, ya está: tenés un modelo corriendo local.

    Si en cambio se arrastra y el ventilador despega, es memoria — volvé a la tabla de arriba.

  4. Encendé el servidor local

    En la pestaña de servidor de LM Studio, dale a arrancar. Queda escuchando en tu propia máquina y cualquier herramienta que hable el protocolo de OpenAI puede usarlo apuntando ahí.

    http://127.0.0.1:1234/v1

Lo que casi nadie ajusta: el contexto

Acá está la parte que decide si tu experiencia es buena o frustrante. El contexto —cuánto texto puede tener en la cabeza a la vez— no es gratis: se paga en memoria, aparte de lo que pesa el modelo.

La cuenta, para este modelo
Pesos del modelo, cargados
~21 GiB
Memoria por cada token de contexto
64 KiB
Contexto nativo del modelo
262.144

Es decir: llenar el contexto nativo cuesta 16 GiB extra, encima de los 21 del modelo. Total, unos 37 GB solo para tenerlo abierto.

Cómo se reparte la memoria
Contexto 196.608 medido ~33 GB
Contexto 262.144 al límite ~37 GB
pesos del modelo contexto libre
El techo no es tu RAM

En una Mac de 48 GB el límite real no son los 48: es cuánta memoria le permite macOS a la GPU, que ronda los 36 GB. Por eso 196.608 es el punto seguro y el contexto nativo completo se queda afuera por poco.

Subir ese techo se puede, pero es tocar el sistema. No hace falta para empezar.

Si querés fijarlo desde la terminal en vez de la interfaz:

lms load qwen3.8-27b-mlx --context-length 196608 --parallel 1 -y

El --parallel 1 importa: cada conversación simultánea reserva su propio contexto. Cuatro sesiones en paralelo a 196.000 tokens no entran en ninguna máquina.

Ojo con el «1M» de la ficha del modelo

La ficha oficial anuncia un millón de tokens de contexto. En esta build no aplica: no trae activada la técnica que lo habilita. Y aunque la trajera, ese contexto solo en memoria serían 64 GiB.

Qué esperar de verdad

El paso siguiente

Tener el modelo corriendo es la mitad. La otra mitad es darle trabajo: que las tareas mecánicas —resúmenes, borradores largos, transformaciones repetitivas— dejen de gastar tu plan pago y las haga el modelo local, que no cobra.

Eso es exactamente lo que hace este repo:

github.com/fvanlookeren-bit/llm-Intern