Trendora

PPO

Assess

Kỹ thuật

Một thuật toán học tăng cường theo chính sách có thể bị ảnh hưởng bởi sai lệch logprob của rollout.

Vì sao ở đây

Xếp vào Assess: 2 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 34%.

Bằng chứng (2)

  • 7Hugging Face Blog·6/5/2026framework_update
    Di chuyển sang vLLM V1: Sửa logprobs của rollout trước khi chỉnh mục tiêu RL

    Hugging Face mô tả quá trình chuyển từ vLLM V0 sang V1 trong một pipeline huấn luyện RL, trong đó logprobs của rollout không khớp ban đầu đã làm thay đổi hành vi huấn luyện. Nhóm đã khôi phục sự tương đương bằng cách bật processed logprobs, điều chỉnh các mặc định runtime của V1, sửa đường cập nhật trọng số inflight và dùng lm_head fp32 trước khi cân nhắc chỉnh sửa mục tiêu RL.

  • 7Hugging Face Blog·31/3/2026framework_update
    TRL v1.0 đánh dấu bước chuyển sang ổn định cho công cụ hậu huấn luyện

    Hugging Face phát hành TRL v1.0, định vị đây là một thư viện ổn định hơn cho các quy trình hậu huấn luyện đang được dùng trong môi trường sản xuất. Bản cập nhật nhấn mạnh khả năng thích ứng với lĩnh vực thay đổi nhanh, với hơn 75 phương pháp hậu huấn luyện như PPO, các phương pháp kiểu DPO và RLVR như GRPO.