Trendora

Direct Preference Optimization

Assess

Kỹ thuật

Phương pháp huấn luyện tối ưu mô hình từ các cặp lựa chọn được-chọn và bị-từ-chối.

Vì sao ở đây

Xếp vào Assess: 3 bài bằng chứng từ 1 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 41%.

Bằng chứng (3)

  • 6Hugging Face Blog·16/7/2026research
    DharmaOCR vượt các mô hình OCR mới hơn trên tiếng Bồ Đào Nha Brazil

    Hugging Face Blog cho biết DharmaOCR đã vượt Mistral OCR4 và Unlimited-OCR trên các bộ đánh giá tiếng Bồ Đào Nha Brazil, dù dùng kiến trúc cũ hơn. Bài viết cho rằng lợi thế này đến từ tinh chỉnh có giám sát theo miền dữ liệu kết hợp Direct Preference Optimization, giúp tăng chất lượng trích xuất và độ ổn định đầu ra.

  • 7Hugging Face Blog·3/6/2026research
    DPO giảm hiện tượng suy giảm văn bản trong mô hình OCR ngoài chatbot

    Bài viết trên Hugging Face Blog mô tả cách Dharma-AI sử dụng Direct Preference Optimization (DPO) sau khi fine-tune có giám sát để giảm hiện tượng lặp suy giảm trong các mô hình OCR có cấu trúc. Trên tất cả các họ mô hình được thử nghiệm, tỷ lệ suy giảm đều giảm, trung bình 59,4% và mức tốt nhất là 87,6%. Bài viết cho rằng DPO có thể tận dụng chính các đầu ra lỗi của mô hình làm cặp bị từ chối, mở rộng tối ưu hóa theo sở thích ra ngoài bài toán căn chỉnh chatbot.

  • 7Hugging Face Blog·31/3/2026framework_update
    TRL v1.0 đánh dấu bước chuyển sang ổn định cho công cụ hậu huấn luyện

    Hugging Face phát hành TRL v1.0, định vị đây là một thư viện ổn định hơn cho các quy trình hậu huấn luyện đang được dùng trong môi trường sản xuất. Bản cập nhật nhấn mạnh khả năng thích ứng với lĩnh vực thay đổi nhanh, với hơn 75 phương pháp hậu huấn luyện như PPO, các phương pháp kiểu DPO và RLVR như GRPO.