MAST
HoldKỹ thuật
Bộ phân loại lỗi dùng để chẩn đoán tác nhân AI hỏng ở đâu và theo cách nào.
Vì sao ở đây
Xếp vào Hold: 1 bài bằng chứng từ 1 nguồn, chủ yếu là tin nghiên cứu, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.
Bằng chứng (1)
- 7Hugging Face Blog·18/2/2026researchIBM và UC Berkeley dùng IT-Bench và MAST để phân tích vì sao tác nhân doanh nghiệp thất bại
IBM Research và UC Berkeley đã nghiên cứu các mẫu lỗi của hệ thống LLM tác nhân trong tự động hóa CNTT bằng ITBench và bộ phân loại lỗi MAST. Phân tích 310 vết thực thi SRE cho thấy xác minh sai là nguyên nhân lỗi phổ biến nhất; một số mô hình lỗi gọn gàng, trong khi số khác gặp lỗi dây chuyền hoặc vấn đề kết thúc tác vụ.