Trendora

AI jailbreak severity framework

Assess

Kỹ thuật

Khung đề xuất để phân loại mức độ mà một jailbreak có thể vượt qua cơ chế bảo vệ của mô hình AI.

Vì sao ở đây

Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là cập nhật framework, 0 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.

Bằng chứng (1)

  • 7Anthropic News·2/7/2026framework_update
    Anthropic công bố thêm về cơ chế bảo vệ an ninh mạng của Fable 5 và khung đánh giá jailbreak

    Anthropic cho biết Claude Fable 5 đã được triển khai lại trên toàn cầu và hiện mở cho tất cả người dùng, đồng thời công bố chi tiết hơn về các bộ phân loại an toàn an ninh mạng của mô hình. Công ty cũng giới thiệu bản thảo đầu tiên của khung đánh giá mức độ nghiêm trọng của jailbreak AI và mở chương trình HackerOne để nhà nghiên cứu báo cáo các jailbreak liên quan đến an ninh mạng.