Trendora

MXFP4

Assess

Kỹ thuật

Định dạng lượng tử hóa số thực 4-bit để giảm kích thước mô hình và nâng hiệu quả suy luận.

Vì sao ở đây

Xếp vào Assess: 2 bài bằng chứng từ 3 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 47%.

Bằng chứng (2)

  • 8Simon Willison·27/7/2026model_release
    Moonshot công bố trọng số mở của Kimi K3, nhưng việc triển khai bị giới hạn

    Moonshot AI đã phát hành trọng số mở của Kimi K3 trên Hugging Face, đưa một trong những mô hình ngôn ngữ lớn nhất của hãng đến tay cộng đồng để tự triển khai. Mô hình hướng tới tác vụ lập trình dài hạn và xử lý tri thức đầu-cuối, nhưng kiến trúc MoE 2,8 nghìn tỷ tham số cùng yêu cầu phần cứng rất lớn khiến chỉ một số ít tổ chức có thể tự vận hành.

  • 6Hacker News·3/7/2026research
    Wafer công bố suy luận GLM5.2 nhanh hơn trên AMD MI355X

    Wafer cho biết đã chạy GLM5.2 trên AMD MI355X đạt 2626 token/giây/node ở mức 2,4 RPS, đồng thời khẳng định chi phí triển khai thấp hơn hơn 2 lần so với các lựa chọn dựa trên Blackwell. Bài viết cũng mô tả việc dùng lượng tử hóa MXFP4 với AMD Quark và phục vụ mô hình bằng sglang trên ROCm sau khi khắc phục hỗ trợ giải mã suy đoán.