Trendora

GRPO

Assess

Kỹ thuật

Một phương pháp tối ưu hóa học tăng cường cũng phụ thuộc vào tính nhất quán của logprob phía rollout.

Vì sao ở đây

Xếp vào Assess: 4 bài bằng chứng từ 2 nguồn, chủ yếu là cập nhật framework, 1 bài trong 30 ngày qua. Độ tin cậy 52%.

Bằng chứng (4)

  • 7Hacker News·28/7/2026research
    Fine-tune RL trị giá 500 USD vượt các mô hình tiên tiến trong rà soát danh mục

    Bài viết mô tả một bản fine-tune GRPO của mô hình nguồn mở 9B vượt qua nhiều cấu hình mô hình tiên tiến trên cùng quy trình rà soát danh mục, với cùng bộ công cụ, hình ảnh và cơ chế chấm điểm. Kết quả đạt chi phí khoảng 0,50 USD cho mỗi 1.000 listing, rẻ hơn đáng kể so với các phương án frontier được thử nghiệm.

  • 7Hugging Face Blog·6/5/2026framework_update
    Di chuyển sang vLLM V1: Sửa logprobs của rollout trước khi chỉnh mục tiêu RL

    Hugging Face mô tả quá trình chuyển từ vLLM V0 sang V1 trong một pipeline huấn luyện RL, trong đó logprobs của rollout không khớp ban đầu đã làm thay đổi hành vi huấn luyện. Nhóm đã khôi phục sự tương đương bằng cách bật processed logprobs, điều chỉnh các mặc định runtime của V1, sửa đường cập nhật trọng số inflight và dùng lm_head fp32 trước khi cân nhắc chỉnh sửa mục tiêu RL.

  • 7Hugging Face Blog·29/4/2026model_release
    Granite 4.1 LLM: Cách chúng được xây dựng

    Nhóm Granite của IBM trình bày chi tiết quy trình huấn luyện Granite 4.1, từ kỹ thuật dữ liệu đến tinh chỉnh có giám sát và học tăng cường. Bộ mô hình gồm các biến thể dense decoder-only kích thước 3B, 8B và 30B, được huấn luyện trên khoảng 15 nghìn tỷ token và mở rộng ngữ cảnh lên 512K token; bản 8B instruct được cho là tương đương hoặc vượt Granite 4.0-H-Small trước đó dù dùng ít tham số hơn.

  • 7Hugging Face Blog·31/3/2026framework_update
    TRL v1.0 đánh dấu bước chuyển sang ổn định cho công cụ hậu huấn luyện

    Hugging Face phát hành TRL v1.0, định vị đây là một thư viện ổn định hơn cho các quy trình hậu huấn luyện đang được dùng trong môi trường sản xuất. Bản cập nhật nhấn mạnh khả năng thích ứng với lĩnh vực thay đổi nhanh, với hơn 75 phương pháp hậu huấn luyện như PPO, các phương pháp kiểu DPO và RLVR như GRPO.