Trendora

MMLU-Pro

Assess

Công cụ

Bộ benchmark để đánh giá năng lực tri thức và suy luận của mô hình.

Vì sao ở đây

Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.

Bằng chứng (1)

  • 8Hugging Face Blog·4/2/2026framework_update
    Hugging Face bổ sung bảng xếp hạng đánh giá do cộng đồng đóng góp

    Hugging Face đang triển khai mô hình báo cáo đánh giá phi tập trung trên Hub, cho phép các bộ dữ liệu benchmark tự vận hành bảng xếp hạng và các mô hình lưu trữ điểm đánh giá của riêng mình. Thành viên cộng đồng có thể gửi kết quả có thể tái lập qua pull request, kèm huy hiệu xác minh để cho biết kết quả đã được chứng minh là có thể tái hiện.