Trendora

Rotary Positional Embedding

Assess

Kỹ thuật

Một phương pháp mã hóa vị trí đưa thông tin thứ tự token vào bằng các phép biến đổi xoay.

Vì sao ở đây

Xếp vào Assess: 3 bài bằng chứng từ 2 nguồn, chủ yếu là phát hành mô hình, 1 bài trong 30 ngày qua. Độ tin cậy 50%.

Bằng chứng (3)

  • 8Hacker News·28/7/2026model_release
    Kiến trúc Kimi K3 nổi bật với LatentMoE và NoPE

    Kimi K3 được giới thiệu như phiên bản sản xuất mở rộng của Kimi Linear, tăng từ 48B lên 2,8T tham số và được cho là mô hình mở có trọng số lớn nhất hiện nay. Kiến trúc này tập trung vào hiệu quả suy luận với các thành phần như LatentMoE, Kimi Delta Attention, residual attention và chuyển hoàn toàn sang NoPE, đồng thời bổ sung hỗ trợ đa phương thức gốc.

  • 7Hugging Face Blog·29/4/2026model_release
    Granite 4.1 LLM: Cách chúng được xây dựng

    Nhóm Granite của IBM trình bày chi tiết quy trình huấn luyện Granite 4.1, từ kỹ thuật dữ liệu đến tinh chỉnh có giám sát và học tăng cường. Bộ mô hình gồm các biến thể dense decoder-only kích thước 3B, 8B và 30B, được huấn luyện trên khoảng 15 nghìn tỷ token và mở rộng ngữ cảnh lên 512K token; bản 8B instruct được cho là tương đương hoặc vượt Granite 4.0-H-Small trước đó dù dùng ít tham số hơn.

  • 5Hugging Face Blog·3/2/2026research
    Bài học từ ablation khi huấn luyện mô hình chuyển văn bản thành ảnh

    Hugging Face đăng phần thứ hai trong loạt bài của Photoroom về cách huấn luyện từ đầu các mô hình nền tảng tạo ảnh từ văn bản hiệu quả. Bài viết xem lại cấu hình nền tảng Flow Matching cho mô hình PRX-1.2B và đánh giá những điều chỉnh huấn luyện nào thực sự giúp cải thiện hội tụ, độ ổn định và hiệu quả.