Grouped Query Attention
AssessKỹ thuật
Cơ chế attention giúp giảm chi phí KV cache bằng cách chia sẻ các head key/value giữa các nhóm query.
Vì sao ở đây
Xếp vào Assess: 2 bài bằng chứng từ 1 nguồn, chủ yếu là phát hành mô hình, 0 bài trong 30 ngày qua. Độ tin cậy 37%.
Bằng chứng (2)
- 7Hugging Face Blog·29/4/2026model_releaseGranite 4.1 LLM: Cách chúng được xây dựng
Nhóm Granite của IBM trình bày chi tiết quy trình huấn luyện Granite 4.1, từ kỹ thuật dữ liệu đến tinh chỉnh có giám sát và học tăng cường. Bộ mô hình gồm các biến thể dense decoder-only kích thước 3B, 8B và 30B, được huấn luyện trên khoảng 15 nghìn tỷ token và mở rộng ngữ cảnh lên 512K token; bản 8B instruct được cho là tương đương hoặc vượt Granite 4.0-H-Small trước đó dù dùng ít tham số hơn.
- 7Hugging Face Blog·20/1/2026researchDifferential Transformer V2
Hugging Face Blog giới thiệu Differential Transformer V2, một thiết kế attention mới tăng gấp đôi số query heads nhưng giữ nguyên số key-value heads. Bài viết cho rằng cách này giúp tốc độ suy luận tương đương Transformer tiêu chuẩn, không cần kernel attention tùy chỉnh, đồng thời vẫn giữ nguyên kích thước projection đầu ra với bước trừ vi phân giữa các cặp head.