Agent’s Last Exam
AssessKỹ thuật
Một benchmark khác được nhắc đến như một bài kiểm tra cho tác tử AI.
Vì sao ở đây
Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.
Bằng chứng (1)
- 7The New Stack·9/7/2026framework_updateDevRev công bố bộ benchmark cho tác tử AI doanh nghiệp
DevRev giới thiệu bộ benchmark Enterprise AI Agent Benchmark mã nguồn mở nhằm đo lường tốt hơn hiệu năng của tác tử AI trong các tác vụ doanh nghiệp thực tế, đặc biệt khi làm việc với ngữ cảnh dữ liệu lớn và có phân quyền truy cập. Phiên bản đầu tiên mới bao gồm hai mức L1 và L2, đồng thời công bố bộ dữ liệu, bộ đánh giá, tiêu chí chấm điểm, kết quả và trace thô để bên khác có thể tái kiểm tra.