Trendora

sglang

Assess

Công cụ

Khung phục vụ suy luận cho mô hình ngôn ngữ lớn, hỗ trợ các tính năng giải mã nâng cao.

Vì sao ở đây

Xếp vào Assess: 4 bài bằng chứng từ 3 nguồn, chủ yếu là tin nghiên cứu, 2 bài trong 30 ngày qua. Độ tin cậy 55%.

Bằng chứng (4)

  • 8Hacker News·12/8/2026model_release
    Phát hành mô hình mở Qwen3.8

    Qwen đã phát hành Qwen3.8-2.4T-A95B, một mô hình sau huấn luyện ở định dạng Hugging Face Transformers và tương thích với các công cụ như vLLM và SGLang. Mô hình này được giới thiệu là thế hệ open model mạnh nhất của Qwen từ trước đến nay, với cải thiện về lập trình, thực thi tác vụ tác tử, xử lý ngữ cảnh dài và khả năng điều khiển mức độ suy luận.

  • 7Hacker News·3/8/2026research
    Cloudflare mở rộng Kimi và GLM bằng lượng tử hóa KV cache và nén trọng số

    Cloudflare cho biết họ đang phục vụ Moonshot Kimi K-series và Z.ai GLM hiệu quả hơn trên Workers AI bằng cách kết hợp lượng tử hóa KV cache, nén trọng số và các kỹ thuật bảo vệ cache dùng chung. Công ty cho biết KV cache FP8 và trọng số INT4 giúp giảm nhu cầu bộ nhớ GPU, hạ chi phí mà vẫn giữ nguyên độ chính xác mô hình, với SGLang là framework phục vụ suy luận.

  • 7Hugging Face Blog·7/7/2026product_launch
    Mô hình Hugging Face có mặt trên Foundry Managed Compute của Microsoft

    Microsoft công bố các mô hình open-weight được tuyển chọn từ Hugging Face nay đã có trên Foundry Managed Compute, được cập nhật hằng tuần và triển khai chỉ với một lần nhấp. Dịch vụ bổ sung các năng lực doanh nghiệp như quét bảo mật, quản trị, quan sát vận hành, thanh toán và hỗ trợ triển khai GPU quản lý cho mô hình nguồn mở và tùy biến.

  • 6Hacker News·3/7/2026research
    Wafer công bố suy luận GLM5.2 nhanh hơn trên AMD MI355X

    Wafer cho biết đã chạy GLM5.2 trên AMD MI355X đạt 2626 token/giây/node ở mức 2,4 RPS, đồng thời khẳng định chi phí triển khai thấp hơn hơn 2 lần so với các lựa chọn dựa trên Blackwell. Bài viết cũng mô tả việc dùng lượng tử hóa MXFP4 với AMD Quark và phục vụ mô hình bằng sglang trên ROCm sau khi khắc phục hỗ trợ giải mã suy đoán.