Trendora

vLLM

Trial

Công cụ

Công cụ mã nguồn mở để phục vụ suy luận cho các mô hình ngôn ngữ lớn một cách hiệu quả.

Vì sao ở đây

Xếp vào Trial: 10 bài bằng chứng từ 5 nguồn, chủ yếu là cập nhật framework, 3 bài trong 30 ngày qua. Độ tin cậy 84%.

Bằng chứng (10)

  • 8The New Stack·10/8/2026model_release
    Meta ra mắt Muse Glimmer, mô hình đa phương thức mã nguồn mở chạy cục bộ

    Meta đã phát hành Muse Glimmer, mô hình đa phương thức 30 tỷ tham số được chưng cất cho các tác vụ tác tử chạy cục bộ và cấp phép Apache 2.0. Hugging Face cho biết đã hỗ trợ ngay từ ngày đầu trên transformers, llama.cpp, vLLM và Inference Endpoints, đồng thời công bố benchmark và chi tiết kiến trúc cho các ứng dụng ưu tiên quyền riêng tư như lập trình, phân tích tài liệu và trợ lý cá nhân.

  • 8Hugging Face Blog·4/8/2026model_release
    Hugging Face giới thiệu LFM2.5-2.6B cho tác tử chạy trực tiếp trên thiết bị

    Hugging Face công bố LFM2.5-2.6B, mô hình 2,6 tỷ tham số được thiết kế để vận hành tác tử trực tiếp trên thiết bị với khả năng gọi công cụ và thực hiện quy trình nhiều bước. Mô hình hướng tới máy tính xách tay và điện thoại, nhấn mạnh tính riêng tư, mức dùng bộ nhớ thấp và hiệu năng benchmark mạnh so với các mô hình lớn hơn nhiều.

  • 6InfoQ·27/7/2026framework_update
    Netflix chia sẻ về nền tảng phục vụ LLM nội bộ

    Netflix đã chia sẻ các bài học triển khai thực tế từ nền tảng phục vụ suy luận LLM nội bộ, đặc biệt là cách hỗ trợ nhiều kích thước mô hình và yêu cầu phần cứng khác nhau. Công ty cũng nhấn mạnh nhu cầu thích ứng nhanh khi các công cụ suy luận liên tục thay đổi, với Triton và vLLM là một phần của hệ thống.

  • 8Hugging Face Blog·8/7/2026framework_update
    Backend Transformers trong vLLM đạt tốc độ ngang native

    Hugging Face cho biết backend mô hình Transformers trong vLLM nay đã đạt hoặc vượt thông lượng của các bản triển khai native do vLLM tự viết cho một số mô hình Qwen3. Bản cập nhật cho phép tác giả mô hình chạy mô hình Transformers trong vLLM chỉ với một cờ cấu hình, đồng thời vẫn giữ nguyên các chế độ song song và quy trình phục vụ quen thuộc.

  • 7Hugging Face Blog·7/7/2026product_launch
    Mô hình Hugging Face có mặt trên Foundry Managed Compute của Microsoft

    Microsoft công bố các mô hình open-weight được tuyển chọn từ Hugging Face nay đã có trên Foundry Managed Compute, được cập nhật hằng tuần và triển khai chỉ với một lần nhấp. Dịch vụ bổ sung các năng lực doanh nghiệp như quét bảo mật, quản trị, quan sát vận hành, thanh toán và hỗ trợ triển khai GPU quản lý cho mô hình nguồn mở và tùy biến.

  • 5Hacker News·28/6/2026open_source
    Hướng dẫn thiết lập cụm RDMA cho AMD Strix Halo

    Tài liệu trên GitHub này hướng dẫn cách thiết lập cụm hỗ trợ RDMA bằng phần cứng AMD Strix Halo cho các tác vụ phân tán. Nội dung hướng tới nhà phát triển muốn thử nghiệm mạng hiệu năng cao và ghép cụm để chạy AI hoặc tính toán cục bộ, chứ không phải một sản phẩm mới.

  • 5Hugging Face Blog·26/6/2026product_launch
    Chạy vLLM Server trên HF Jobs chỉ với một lệnh

    Hugging Face hướng dẫn cách khởi chạy một endpoint vLLM riêng tư, tương thích OpenAI trên HF Jobs chỉ bằng một lệnh, sử dụng container có GPU và proxy jobs công khai. Bài viết cũng nêu cách truy vấn bằng curl hoặc OpenAI Python client, cùng cách dừng job và quản lý truy cập an toàn.

  • 7Hugging Face Blog·27/5/2026framework_update
    TRL bổ sung đồng bộ trọng số delta qua Hub Bucket của Hugging Face

    Hugging Face giới thiệu bản cập nhật TRL cho phép chỉ truyền phần chênh lệch trọng số thay vì toàn bộ checkpoint trong huấn luyện RL bất đồng bộ. Các sai khác dạng sparse safetensors được lưu trong Hugging Face Bucket để vLLM tự tải về, giúp giảm mạnh dung lượng truyền mỗi bước và hỗ trợ mô hình huấn luyện tách rời trên nhiều máy/Space.

  • 7Hugging Face Blog·6/5/2026framework_update
    Di chuyển sang vLLM V1: Sửa logprobs của rollout trước khi chỉnh mục tiêu RL

    Hugging Face mô tả quá trình chuyển từ vLLM V0 sang V1 trong một pipeline huấn luyện RL, trong đó logprobs của rollout không khớp ban đầu đã làm thay đổi hành vi huấn luyện. Nhóm đã khôi phục sự tương đương bằng cách bật processed logprobs, điều chỉnh các mặc định runtime của V1, sửa đường cập nhật trọng số inflight và dùng lm_head fp32 trước khi cân nhắc chỉnh sửa mục tiêu RL.

  • 7Hugging Face Blog·17/3/2026model_release
    Holotron-12B: Tác tử dùng máy tính thông lượng cao

    H Company đã phát hành Holotron-12B, một mô hình đa phương thức dành cho tác tử sử dụng máy tính trong các môi trường tương tác, nơi mô hình cần quan sát, ra quyết định và thực thi hành động. Mô hình được xây dựng trên NVIDIA Nemotron-Nano-2 VL, nhấn mạnh khả năng suy luận thông lượng cao, xử lý ngữ cảnh dài và sử dụng VRAM hiệu quả cho môi trường sản xuất.