Trendora

Kimi Delta Attention

Assess

Kỹ thuật

Kiến trúc attention được dùng trong các mô hình Kimi để cải thiện luồng thông tin trên chuỗi dài.

Vì sao ở đây

Xếp vào Assess: 3 bài bằng chứng từ 3 nguồn, chủ yếu là phát hành mô hình, 3 bài trong 30 ngày qua. Độ tin cậy 49%.

Bằng chứng (3)

  • 4Hacker News·28/7/2026research
    Giải thích họ biến thể attention tuyến tính DeltaNet

    Bài viết trình bày cách suy ra họ phương pháp attention tuyến tính DeltaNet, bắt đầu từ causal softmax attention rồi dần đơn giản hóa thành các dạng attention tuyến tính. Nội dung cũng liên hệ các ý tưởng này với DeltaNet, Gated DeltaNet và Kimi Delta Attention, đồng thời nhấn mạnh các phép cập nhật trạng thái và cách triển khai theo kiểu recurrent và chunkwise.

  • 8Hacker News·28/7/2026model_release
    Kiến trúc Kimi K3 nổi bật với LatentMoE và NoPE

    Kimi K3 được giới thiệu như phiên bản sản xuất mở rộng của Kimi Linear, tăng từ 48B lên 2,8T tham số và được cho là mô hình mở có trọng số lớn nhất hiện nay. Kiến trúc này tập trung vào hiệu quả suy luận với các thành phần như LatentMoE, Kimi Delta Attention, residual attention và chuyển hoàn toàn sang NoPE, đồng thời bổ sung hỗ trợ đa phương thức gốc.

  • 8Simon Willison·16/7/2026model_release
    Kimi K3 ra mắt với tư cách mô hình mã nguồn mở lớp 3 nghìn tỷ tham số

    Kimi đã giới thiệu Kimi K3, một mô hình mở với 2,8 nghìn tỷ tham số, hỗ trợ thị giác gốc và cửa sổ ngữ cảnh 1 triệu token. Công ty cho biết mô hình được tối ưu cho lập trình dài hạn, suy luận và công việc tri thức, đồng thời sẽ phát hành đầy đủ trọng số vào ngày 27/7/2026.