Trendora

TRL

Assess

Công cụ

Thư viện của Hugging Face để huấn luyện và tinh chỉnh mô hình ngôn ngữ dựa trên transformer, bao gồm các quy trình RL.

Vì sao ở đây

Xếp vào Assess: 3 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 40%.

Bằng chứng (3)

  • 7Hugging Face Blog·27/5/2026framework_update
    TRL bổ sung đồng bộ trọng số delta qua Hub Bucket của Hugging Face

    Hugging Face giới thiệu bản cập nhật TRL cho phép chỉ truyền phần chênh lệch trọng số thay vì toàn bộ checkpoint trong huấn luyện RL bất đồng bộ. Các sai khác dạng sparse safetensors được lưu trong Hugging Face Bucket để vLLM tự tải về, giúp giảm mạnh dung lượng truyền mỗi bước và hỗ trợ mô hình huấn luyện tách rời trên nhiều máy/Space.

  • 7Hugging Face Blog·31/3/2026framework_update
    TRL v1.0 đánh dấu bước chuyển sang ổn định cho công cụ hậu huấn luyện

    Hugging Face phát hành TRL v1.0, định vị đây là một thư viện ổn định hơn cho các quy trình hậu huấn luyện đang được dùng trong môi trường sản xuất. Bản cập nhật nhấn mạnh khả năng thích ứng với lĩnh vực thay đổi nhanh, với hơn 75 phương pháp hậu huấn luyện như PPO, các phương pháp kiểu DPO và RLVR như GRPO.

  • 7Hugging Face Blog·9/3/2026framework_update
    Ulysses Sequence Parallelism cho huấn luyện ngữ cảnh triệu token

    Hugging Face giới thiệu cách Ulysses Sequence Parallelism phân phối cơ chế attention trên nhiều GPU để việc huấn luyện với ngữ cảnh rất dài trở nên khả thi hơn so với giới hạn của một GPU đơn lẻ. Bài viết cũng trình bày cách tích hợp vào Accelerate, Transformers Trainer và TRL’s SFTTrainer, đồng thời so sánh với Ring Attention và đưa ra khuyến nghị sử dụng.