TRL
AssessCông cụ
Thư viện của Hugging Face để huấn luyện và tinh chỉnh mô hình ngôn ngữ dựa trên transformer, bao gồm các quy trình RL.
Vì sao ở đây
Xếp vào Assess: 3 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 40%.
Bằng chứng (3)
- 7Hugging Face Blog·27/5/2026framework_updateTRL bổ sung đồng bộ trọng số delta qua Hub Bucket của Hugging Face
Hugging Face giới thiệu bản cập nhật TRL cho phép chỉ truyền phần chênh lệch trọng số thay vì toàn bộ checkpoint trong huấn luyện RL bất đồng bộ. Các sai khác dạng sparse safetensors được lưu trong Hugging Face Bucket để vLLM tự tải về, giúp giảm mạnh dung lượng truyền mỗi bước và hỗ trợ mô hình huấn luyện tách rời trên nhiều máy/Space.
- 7Hugging Face Blog·31/3/2026framework_updateTRL v1.0 đánh dấu bước chuyển sang ổn định cho công cụ hậu huấn luyện
Hugging Face phát hành TRL v1.0, định vị đây là một thư viện ổn định hơn cho các quy trình hậu huấn luyện đang được dùng trong môi trường sản xuất. Bản cập nhật nhấn mạnh khả năng thích ứng với lĩnh vực thay đổi nhanh, với hơn 75 phương pháp hậu huấn luyện như PPO, các phương pháp kiểu DPO và RLVR như GRPO.
- 7Hugging Face Blog·9/3/2026framework_updateUlysses Sequence Parallelism cho huấn luyện ngữ cảnh triệu token
Hugging Face giới thiệu cách Ulysses Sequence Parallelism phân phối cơ chế attention trên nhiều GPU để việc huấn luyện với ngữ cảnh rất dài trở nên khả thi hơn so với giới hạn của một GPU đơn lẻ. Bài viết cũng trình bày cách tích hợp vào Accelerate, Transformers Trainer và TRL’s SFTTrainer, đồng thời so sánh với Ring Attention và đưa ra khuyến nghị sử dụng.