AirLLM là một gói chuyên cho suy luận, giúp các mô hình mở rất lớn chạy với ít VRAM hơn nhiều bằng cách chỉ nạp từng lớp hoặc từng expert khi cần thay vì giữ toàn bộ mô hình trong bộ nhớ.
AirLLM là một gói Python để chạy suy luận với các mô hình ngôn ngữ lớn, được truy cập qua một điểm vào AutoModel duy nhất. README cho biết nó có thể chạy các mô hình như Llama 3.1 405B, DeepSeek-V3 671B, Qwen3-235B và Kimi K3 trên mức VRAM rất thấp so với kích thước mô hình, đồng thời cũng nêu hỗ trợ suy luận trên CPU, MacOS và nhiều họ mô hình khác nhau.
Vấn đề mà nó nhắm tới là rào cản bộ nhớ, vốn thường khiến các mô hình rất lớn không thể chạy trên phần cứng phổ thông. AirLLM tìm cách giảm mức sử dụng bộ nhớ khi suy luận đủ nhiều để các mô hình vốn bị xem là cần GPU lớn vẫn có thể chạy trên một card nhỏ, mà không dựa vào các cách thu nhỏ mô hình như distillation hay pruning.
Về mặt khái niệm, AirLLM giảm áp lực bộ nhớ bằng cách không giữ toàn bộ mô hình trong RAM/VRAM cùng lúc. README mô tả việc tách mô hình theo từng lớp để suy luận, và với các mô hình sparse MoE thì chỉ truyền luồng các expert mà một token thực sự được định tuyến tới thay vì nạp tất cả expert cùng lúc; ngoài ra còn có tuỳ chọn nén mô hình theo khối ở mức 4-bit hoặc 8-bit để giảm kích thước khi nạp và tăng tốc độ. README không cung cấp chi tiết triển khai sâu hơn ngoài mô tả ở mức cao này.
Dự án đang thu hút chú ý vì README đưa ra các tuyên bố khá khác thường về khả năng suy luận với mức bộ nhớ rất thấp cho những mô hình mở cực lớn và đang được quan tâm, bao gồm các bản mới như Qwen3, DeepSeek-V3, Llama 3.1 405B và Kimi K3. README cũng cho thấy dự án được cập nhật thường xuyên và hỗ trợ nhiều họ mô hình, nên rất phù hợp với nhu cầu chạy mô hình quy mô lớn trên phần cứng hạn chế.
Chính README xem cách nạp mô hình kiểu Hugging Face tiêu chuẩn là mốc so sánh cơ bản, đồng thời cũng nhắc tới nén/quantization bằng bitsandbytes với tuỳ chọn 4-bit hoặc 8-bit. Dựa trên các topic của repository và nội dung README, những hướng liên quan gồm LoRA và QLoRA cho quy trình tinh chỉnh, nhưng chúng không được trình bày ở đây như cơ chế cốt lõi của AirLLM; thay vào đó, AirLLM được định vị như một cách giảm bộ nhớ khi suy luận.
Do AI giải thích · dựa trên README của từng kho