AirLLM là một gói chuyên cho suy luận, giúp các mô hình mở rất lớn chạy với ít VRAM hơn nhiều bằng cách chỉ nạp từng lớp hoặc từng expert khi cần thay vì giữ toàn bộ mô hình trong bộ nhớ.
Đăng nhập để đọc bản tóm tắt dành cho quản lý.
Đăng nhậpDo AI giải thích · dựa trên README của từng kho