Ahora puedes ejecutar un modelo de 2,8 billones de parámetros con...

@_guillecasaus
Guillermo Casaus@_guillecasaus
39 views Aug 14, 2026 ~1 min read
Advertisement
1
Ahora puedes ejecutar un modelo de 2,8 billones de parámetros con menos de 4 GB de VRAM.

Han creado AirLLM, un proyecto que permite ejecutar modelos gigantes cargando únicamente las capas que necesitas en cada momento.

Es compatible con DeepSeek-V3, Llama 3.1, Kimi K3 y muchos otros.

Aquí te explico cómo funciona 👇
Media image
2
1/ ¿Qué hace exactamente AirLLM?

AirLLM utiliza una técnica llamada Layer-wise Inference para cambiar la forma en la que los modelos se cargan en la GPU.

En lugar de mantener todo el modelo en la VRAM, carga una capa cada vez, realiza los cálculos necesarios y la sustituye por la siguiente.

De esta forma, la memoria necesaria depende del tamaño de la capa más grande y no de los miles de millones de parámetros que tenga el modelo completo.

Y todo esto sin necesidad de recurrir a cuantización, distillation o pruning para reducir el tamaño del modelo.
3
2/ Algunos ejemplos de lo que permite ejecutar:

→ Kimi K3 (2,8T) con menos de 4 GB de VRAM
→ DeepSeek-V3 (671B) con ~12 GB
→ Llama 3.1 405B con ~8 GB
→ Llama 3.x 70B con ~4 GB
→ Qwen3-235B con ~3 GB

Además, funciona con prácticamente todas las familias open-source populares: Llama, Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma y muchas más.
4
3/ ¿Cómo instalarlo?

La instalación es bastante sencilla:

→ Instala AirLLM con pip install airllm
→ Elige el modelo que quieras utilizar desde Hugging Face
→ Cárgalo utilizando AutoModel.from_pretrained(...)
→ AirLLM divide automáticamente el modelo por capas y comienza la inferencia

Eso sí, necesitarás suficiente espacio en disco para almacenar el modelo y sus capas.
Actions
What You Can Do
  • Export as PDF or Markdown
  • Batch Export to Notion
  • Bookmark & Highlight
  • LinkedIn & Instagram Carousel Maker
Create Free Account

Includes 7-day Premium trial

Advertisement