Differential Transformer V2
HoldKỹ thuật
Biến thể attention của Transformer trừ đầu ra của các cặp query head để tạo kết quả attention cuối cùng.
Vì sao ở đây
Xếp vào Hold: 1 bài bằng chứng từ 1 nguồn, chủ yếu là tin nghiên cứu, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.
Bằng chứng (1)
- 7Hugging Face Blog·20/1/2026researchDifferential Transformer V2
Hugging Face Blog giới thiệu Differential Transformer V2, một thiết kế attention mới tăng gấp đôi số query heads nhưng giữ nguyên số key-value heads. Bài viết cho rằng cách này giúp tốc độ suy luận tương đương Transformer tiêu chuẩn, không cần kernel attention tùy chỉnh, đồng thời vẫn giữ nguyên kích thước projection đầu ra với bước trừ vi phân giữa các cặp head.