Heavily Compressed Attention
AssessKỹ thuật
Cơ chế attention nén KV mạnh hơn rồi dùng dense attention trên các token đã nén.
Vì sao ở đây
Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là phát hành mô hình, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.
Bằng chứng (1)
- 8Hugging Face Blog·24/4/2026model_releaseDeepSeek-V4 mang ngữ cảnh 1 triệu token cho tác vụ tác nhân
DeepSeek đã phát hành V4 với hai checkpoint MoE là DeepSeek-V4-Pro và DeepSeek-V4-Flash, cả hai đều hỗ trợ ngữ cảnh 1 triệu token. Bản phát hành tập trung vào các lựa chọn kiến trúc và hậu huấn luyện nhằm giúp tác vụ tác nhân kéo dài chạy rẻ hơn và ổn định hơn, bao gồm thiết kế attention lai và giảm dung lượng KV cache.