Trendora

FP8 KV cache quantization

Hold

Kỹ thuật

Lưu key và value của attention ở định dạng số thực 8-bit để giảm bộ nhớ cache.

Vì sao ở đây

Xếp vào Hold: 1 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 32%.

Bằng chứng (1)

  • 7Hacker News·3/8/2026research
    Cloudflare mở rộng Kimi và GLM bằng lượng tử hóa KV cache và nén trọng số

    Cloudflare cho biết họ đang phục vụ Moonshot Kimi K-series và Z.ai GLM hiệu quả hơn trên Workers AI bằng cách kết hợp lượng tử hóa KV cache, nén trọng số và các kỹ thuật bảo vệ cache dùng chung. Công ty cho biết KV cache FP8 và trọng số INT4 giúp giảm nhu cầu bộ nhớ GPU, hạ chi phí mà vẫn giữ nguyên độ chính xác mô hình, với SGLang là framework phục vụ suy luận.