Trendora

Empirical evaluation toolkit

Assess

Công cụ

Bộ công cụ đo lường để đánh giá thao túng độc hại trong hệ thống AI bằng phương pháp thực nghiệm đã được kiểm chứng.

Vì sao ở đây

Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.

Bằng chứng (1)

  • 7Google DeepMind·25/3/2026framework_update
    DeepMind công bố bộ công cụ đo lường thao túng độc hại của AI

    Google DeepMind cho biết họ đã phát triển bộ công cụ đầu tiên được kiểm chứng thực nghiệm để đo lường hành vi thao túng độc hại của AI trong các nghiên cứu mô phỏng điều kiện thực tế. Nghiên cứu gồm chín thử nghiệm với hơn 10.000 người tham gia tại Anh, Mỹ và Ấn Độ, đồng thời đánh giá cả xu hướng lẫn mức độ hiệu quả của hành vi thao túng trong các bối cảnh rủi ro cao như tài chính và y tế.