FP8 KV cache quantization
HoldKỹ thuật
Lưu key và value của attention ở định dạng số thực 8-bit để giảm bộ nhớ cache.
Vì sao ở đây
Xếp vào Hold: 1 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 32%.
Bằng chứng (1)
- 7Hacker News·3/8/2026researchCloudflare mở rộng Kimi và GLM bằng lượng tử hóa KV cache và nén trọng số
Cloudflare cho biết họ đang phục vụ Moonshot Kimi K-series và Z.ai GLM hiệu quả hơn trên Workers AI bằng cách kết hợp lượng tử hóa KV cache, nén trọng số và các kỹ thuật bảo vệ cache dùng chung. Công ty cho biết KV cache FP8 và trọng số INT4 giúp giảm nhu cầu bộ nhớ GPU, hạ chi phí mà vẫn giữ nguyên độ chính xác mô hình, với SGLang là framework phục vụ suy luận.