Trendora

KV cache

Assess

Kỹ thuật

Bộ nhớ đệm các key và value của attention dùng để tăng tốc suy luận tự hồi quy của LLM.

Vì sao ở đây

Xếp vào Assess: 2 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 43%.

Bằng chứng (2)

  • 7Hacker News·29/7/2026open_source
    Bộ máy mã nguồn mở bằng Swift chạy Gemma 4 26B trên 2 GB RAM cho Mac M-series

    Một tác giả trên Hacker News giới thiệu TurboFieldfare, bộ máy suy luận mã nguồn mở viết bằng Swift và Metal, có thể chạy mô hình Gemma 4 26B-A4B-IT 4-bit trên Mac M-series với khoảng 2 GB RAM. Hệ thống stream các expert được định tuyến từ SSD trong khi giữ phần dùng chung của mô hình và KV cache trong bộ nhớ; tác giả cho biết đạt 5–6 tok/s trên MacBook Air M2 và 31–35 tok/s trên MacBook Pro M5.

  • 6Hugging Face Blog·14/5/2026research
    Hugging Face giải thích cơ chế batch liên tục bất đồng bộ cho suy luận LLM

    Hugging Face đã đăng một bài viết kỹ thuật về cách tách phần chuẩn bị batch trên CPU khỏi phần tính toán trên GPU trong cơ chế batch liên tục khi suy luận LLM. Bài viết cho rằng batching bất đồng bộ có thể giảm thời gian nhàn rỗi giữa CPU và GPU, qua đó tăng thông lượng mà không cần thay đổi kernel hay mô hình.