Guía · @vanlookeren
Lo que manda es la memoria, no el chip. Acá está qué modelos entran en cada tamaño, medido en mis equipos, y un botón para copiarla entera y pegarla en tu IA.
Entre el 2 de septiembre y el 1 de octubre de 2026 procesé 36,26 mil millones de tokens. Pagué 243,84 USD: ChatGPT Plus, Claude Max y la API de Qwen. A precio de API, ese uso costaría mucho más; mi estimación es de 10.000 USD al mes hacia arriba.
Esa diferencia hoy la paga el proveedor, y yo creo que no va a durar. Ya hay un caso: OpenAI bajó el plan Pro de 200 USD de 20 a 10 veces el uso de Plus, por el mismo precio (ayuda de OpenAI, revisado el 1 de octubre de 2026).
Hoy solo el 0,1 % de mis tokens corre en modelos locales. No compro hardware porque ya ahorre: lo compro para no depender de un precio que puede cambiar. Si usas IA de vez en cuando, no te conviene.
Un modelo local no se «instala mal»: entra en tu memoria o no entra. Si no entra, el computador empieza a usar el disco como memoria y el modelo queda inservible.
| Memoria | Qué entra | Para qué alcanza |
|---|---|---|
| 16 GB | Modelos de 2B a 4B: 2,8 a 4,4 GB | Tareas mecánicas: resumir, clasificar, reescribir. Es lo que corre mi Mac mini. |
| 32 GB | Modelos de 26B a 30B a 4 bits: 15,6 a 17,4 GB | Buen modelo, contexto corto. |
| 48 GB | Los mismos, con contexto largo: unos 33 GB con 196.608 tokens | Trabajo real con archivos largos. Acá medí la guía de Qwen. |
| 64 GB | Modelos de 35B: 20,4 GB más contexto largo (estimación) | Margen para un modelo grande y otro chico a la vez. |
| 128 GB | Modelos de 73 a 95 GB | Los modelos locales más grandes que uso. Es mi MacBook Pro M4 Max. |
Todo está medido en Mac con Apple Silicon, donde la memoria es compartida entre el sistema y la GPU. En un PC lo que manda es la memoria de la tarjeta de video, y eso no lo medí.
Menú Apple › Acerca de este Mac. Con ese número, busca tu fila en la tabla.
Es gratis: baja el modelo, lo corre y levanta un servidor local. Está en lmstudio.ai.
Dentro de la app, elige la variante MLX de 4 bits. MLX es el formato de Apple y los 4 bits son los que hacen que entre.
lms load <modelo> --context-length 32768 --parallel 1 -y
Parte con un contexto chico y súbelo mientras la memoria aguante.
Queda en tu propio equipo, y cualquier herramienta que hable el protocolo de OpenAI puede usarlo:
http://127.0.0.1:1234/v1
Un chip más rápido responde antes. Más memoria decide qué modelo puedes usar. Si hay que elegir, memoria.
Tenía un proceso que mantenía un modelo «caliente» por si acaso. Medí tres días: hacía el 58 % de 3.728 peticiones y dejaba esa memoria tomada todo el tiempo.
Para lo difícil sigo usando los modelos grandes de la nube. Lo local es para volumen, tareas repetitivas y lo que no quiero mandar afuera.