Trendora

Supervised Fine-Tuning

Hold

Kỹ thuật

Giai đoạn huấn luyện chuẩn cập nhật mô hình bằng các đầu ra mẫu đã gán nhãn.

Vì sao ở đây

Xếp vào Hold: 1 bài bằng chứng từ 1 nguồn, chủ yếu là tin nghiên cứu, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.

Bằng chứng (1)

  • 7Hugging Face Blog·3/6/2026research
    DPO giảm hiện tượng suy giảm văn bản trong mô hình OCR ngoài chatbot

    Bài viết trên Hugging Face Blog mô tả cách Dharma-AI sử dụng Direct Preference Optimization (DPO) sau khi fine-tune có giám sát để giảm hiện tượng lặp suy giảm trong các mô hình OCR có cấu trúc. Trên tất cả các họ mô hình được thử nghiệm, tỷ lệ suy giảm đều giảm, trung bình 59,4% và mức tốt nhất là 87,6%. Bài viết cho rằng DPO có thể tận dụng chính các đầu ra lỗi của mô hình làm cặp bị từ chối, mở rộng tối ưu hóa theo sở thích ra ngoài bài toán căn chỉnh chatbot.