Qué equipo comprar para correr IA en tu casa

Guía · @vanlookeren

Qué equipo comprar para correr IA en tu casa

Lo que manda es la memoria, no el chip. Acá está qué modelos entran en cada tamaño, medido en mis equipos, y un botón para copiarla entera y pegarla en tu IA.

Primero la cuenta: ¿te conviene?

Entre el 2 de septiembre y el 1 de octubre de 2026 procesé 36,26 mil millones de tokens. Pagué 243,84 USD: ChatGPT Plus, Claude Max y la API de Qwen. A precio de API, ese uso costaría mucho más; mi estimación es de 10.000 USD al mes hacia arriba.

Esa diferencia hoy la paga el proveedor, y yo creo que no va a durar. Ya hay un caso: OpenAI bajó el plan Pro de 200 USD de 20 a 10 veces el uso de Plus, por el mismo precio (ayuda de OpenAI, revisado el 1 de octubre de 2026).

El matiz

Hoy solo el 0,1 % de mis tokens corre en modelos locales. No compro hardware porque ya ahorre: lo compro para no depender de un precio que puede cambiar. Si usas IA de vez en cuando, no te conviene.

Lo que importa es la memoria

Un modelo local no se «instala mal»: entra en tu memoria o no entra. Si no entra, el computador empieza a usar el disco como memoria y el modelo queda inservible.

Qué te entra según tu memoria

Pesos medidos en LM Studio el 4 de octubre de 2026
MemoriaQué entraPara qué alcanza
16 GBModelos de 2B a 4B: 2,8 a 4,4 GBTareas mecánicas: resumir, clasificar, reescribir. Es lo que corre mi Mac mini.
32 GBModelos de 26B a 30B a 4 bits: 15,6 a 17,4 GBBuen modelo, contexto corto.
48 GBLos mismos, con contexto largo: unos 33 GB con 196.608 tokensTrabajo real con archivos largos. Acá medí la guía de Qwen.
64 GBModelos de 35B: 20,4 GB más contexto largo (estimación)Margen para un modelo grande y otro chico a la vez.
128 GBModelos de 73 a 95 GBLos modelos locales más grandes que uso. Es mi MacBook Pro M4 Max.

Todo está medido en Mac con Apple Silicon, donde la memoria es compartida entre el sistema y la GPU. En un PC lo que manda es la memoria de la tarjeta de video, y eso no lo medí.

Paso a paso

  1. Mira cuánta memoria tienes

    Menú Apple › Acerca de este Mac. Con ese número, busca tu fila en la tabla.

  2. Instala LM Studio

    Es gratis: baja el modelo, lo corre y levanta un servidor local. Está en lmstudio.ai.

  3. Baja un modelo que entre

    Dentro de la app, elige la variante MLX de 4 bits. MLX es el formato de Apple y los 4 bits son los que hacen que entre.

  4. Cárgalo con un contexto que entre

    lms load <modelo> --context-length 32768 --parallel 1 -y

    Parte con un contexto chico y súbelo mientras la memoria aguante.

  5. Enciende el servidor local

    Queda en tu propio equipo, y cualquier herramienta que hable el protocolo de OpenAI puede usarlo:

    http://127.0.0.1:1234/v1

Lo que aprendí usándolo

01 · Memoria antes que chip

Un chip más rápido responde antes. Más memoria decide qué modelo puedes usar. Si hay que elegir, memoria.

02 · Un modelo cargado ocupa aunque no lo uses

Tenía un proceso que mantenía un modelo «caliente» por si acaso. Medí tres días: hacía el 58 % de 3.728 peticiones y dejaba esa memoria tomada todo el tiempo.

03 · No reemplaza a la nube

Para lo difícil sigo usando los modelos grandes de la nube. Lo local es para volumen, tareas repetitivas y lo que no quiero mandar afuera.