Ahora puedes ejecutar un modelo de 2,8 billones de parámetros con...

Han creado AirLLM, un proyecto que permite ejecutar modelos gigantes cargando únicamente las capas que necesitas en cada momento.
Es compatible con DeepSeek-V3, Llama 3.1, Kimi K3 y muchos otros.
Aquí te explico cómo funciona 👇
AirLLM utiliza una técnica llamada Layer-wise Inference para cambiar la forma en la que los modelos se cargan en la GPU.
En lugar de mantener todo el modelo en la VRAM, carga una capa cada vez, realiza los cálculos necesarios y la sustituye por la siguiente.
De esta forma, la memoria necesaria depende del tamaño de la capa más grande y no de los miles de millones de parámetros que tenga el modelo completo.
Y todo esto sin necesidad de recurrir a cuantización, distillation o pruning para reducir el tamaño del modelo.
→ Kimi K3 (2,8T) con menos de 4 GB de VRAM
→ DeepSeek-V3 (671B) con ~12 GB
→ Llama 3.1 405B con ~8 GB
→ Llama 3.x 70B con ~4 GB
→ Qwen3-235B con ~3 GB
Además, funciona con prácticamente todas las familias open-source populares: Llama, Qwen, DeepSeek, Mistral, Mixtral, Phi, Gemma y muchas más.
La instalación es bastante sencilla:
→ Instala AirLLM con pip install airllm
→ Elige el modelo que quieras utilizar desde Hugging Face
→ Cárgalo utilizando AutoModel.from_pretrained(...)
→ AirLLM divide automáticamente el modelo por capas y comienza la inferencia
Eso sí, necesitarás suficiente espacio en disco para almacenar el modelo y sus capas.
