KV cache
AssessKỹ thuật
Bộ nhớ đệm các key và value của attention dùng để tăng tốc suy luận tự hồi quy của LLM.
Vì sao ở đây
Xếp vào Assess: 2 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 43%.
Bằng chứng (2)
- 7Hacker News·29/7/2026open_sourceBộ máy mã nguồn mở bằng Swift chạy Gemma 4 26B trên 2 GB RAM cho Mac M-series
Một tác giả trên Hacker News giới thiệu TurboFieldfare, bộ máy suy luận mã nguồn mở viết bằng Swift và Metal, có thể chạy mô hình Gemma 4 26B-A4B-IT 4-bit trên Mac M-series với khoảng 2 GB RAM. Hệ thống stream các expert được định tuyến từ SSD trong khi giữ phần dùng chung của mô hình và KV cache trong bộ nhớ; tác giả cho biết đạt 5–6 tok/s trên MacBook Air M2 và 31–35 tok/s trên MacBook Pro M5.
- 6Hugging Face Blog·14/5/2026researchHugging Face giải thích cơ chế batch liên tục bất đồng bộ cho suy luận LLM
Hugging Face đã đăng một bài viết kỹ thuật về cách tách phần chuẩn bị batch trên CPU khỏi phần tính toán trên GPU trong cơ chế batch liên tục khi suy luận LLM. Bài viết cho rằng batching bất đồng bộ có thể giảm thời gian nhàn rỗi giữa CPU và GPU, qua đó tăng thông lượng mà không cần thay đổi kernel hay mô hình.