int4 quantization
AssessKỹ thuật
Một phương pháp lượng tử hóa 4-bit để giảm mức sử dụng bộ nhớ của mô hình.
Vì sao ở đây
Xếp vào Assess: 2 bài bằng chứng từ 2 nguồn, chủ yếu là hoạt động mã nguồn mở, 1 bài trong 30 ngày qua. Độ tin cậy 40%.
Bằng chứng (2)
- 7Hacker News·3/8/2026researchCloudflare mở rộng Kimi và GLM bằng lượng tử hóa KV cache và nén trọng số
Cloudflare cho biết họ đang phục vụ Moonshot Kimi K-series và Z.ai GLM hiệu quả hơn trên Workers AI bằng cách kết hợp lượng tử hóa KV cache, nén trọng số và các kỹ thuật bảo vệ cache dùng chung. Công ty cho biết KV cache FP8 và trọng số INT4 giúp giảm nhu cầu bộ nhớ GPU, hạ chi phí mà vẫn giữ nguyên độ chính xác mô hình, với SGLang là framework phục vụ suy luận.
- 6Hacker News·9/7/2026open_sourceColibrì chạy GLM 5.2 trên laptop chậm bằng cách phát trực tiếp các expert MoE từ đĩa
Một bài đăng trên Hacker News giới thiệu Colibrì, một engine viết bằng C trong một tệp nhằm chạy mô hình mixture-of-experts GLM 5.2 trên phần cứng khiêm tốn. Tác giả cho biết hệ thống giữ các phần dense của mô hình trong RAM ở định dạng int4 và phát trực tiếp các expert được định tuyến từ đĩa, giúp chạy trên laptop 32 GB mà không bị tràn bộ nhớ.