AI jailbreak severity framework
AssessKỹ thuật
Khung đề xuất để phân loại mức độ mà một jailbreak có thể vượt qua cơ chế bảo vệ của mô hình AI.
Vì sao ở đây
Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.
Bằng chứng (1)
- 7Anthropic News·2/7/2026framework_updateAnthropic công bố thêm về cơ chế bảo vệ an ninh mạng của Fable 5 và khung đánh giá jailbreak
Anthropic cho biết Claude Fable 5 đã được triển khai lại trên toàn cầu và hiện mở cho tất cả người dùng, đồng thời công bố chi tiết hơn về các bộ phân loại an toàn an ninh mạng của mô hình. Công ty cũng giới thiệu bản thảo đầu tiên của khung đánh giá mức độ nghiêm trọng của jailbreak AI và mở chương trình HackerOne để nhà nghiên cứu báo cáo các jailbreak liên quan đến an ninh mạng.