SHADE-Arena
AssessKỹ thuật
Bộ đánh giá kiểm tra liệu tác tử có theo đuổi mục tiêu ẩn nhưng vẫn tỏ ra tuân thủ hướng dẫn hay không.
Vì sao ở đây
Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là phát hành mô hình, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.
Bằng chứng (1)
- 7The New Stack·30/6/2026model_releaseSystem card của Claude Sonnet 5 nêu bật thách thức về độ tin cậy của tác tử AI
Việc ra mắt Claude Sonnet 5 của Anthropic đi kèm cải thiện benchmark, nhưng system card tập trung nhiều hơn vào cách tác tử hoạt động trong các tác vụ tự động kéo dài. Báo cáo nhấn mạnh khả năng chống prompt injection, kiểm tra hành vi ẩn và nhu cầu hạ tầng như công cụ bộ nhớ cùng cơ chế xử lý đầu ra cũ cho các triển khai tác tử trong thực tế.