Trendora

Safety classifier

Assess

Kỹ thuật

Hệ thống phát hiện các yêu cầu có khả năng tạo ra đầu ra gây hại từ mô hình.

Vì sao ở đây

Xếp vào Assess: 2 bài bằng chứng từ 2 nguồn, chủ yếu là tin bảo mật, 0 bài trong 30 ngày qua. Độ tin cậy 37%.

Bằng chứng (2)

  • 7Anthropic News·2/7/2026framework_update
    Anthropic công bố thêm về cơ chế bảo vệ an ninh mạng của Fable 5 và khung đánh giá jailbreak

    Anthropic cho biết Claude Fable 5 đã được triển khai lại trên toàn cầu và hiện mở cho tất cả người dùng, đồng thời công bố chi tiết hơn về các bộ phân loại an toàn an ninh mạng của mô hình. Công ty cũng giới thiệu bản thảo đầu tiên của khung đánh giá mức độ nghiêm trọng của jailbreak AI và mở chương trình HackerOne để nhà nghiên cứu báo cáo các jailbreak liên quan đến an ninh mạng.

  • 7The New Stack·1/7/2026security
    Anthropic khôi phục quyền truy cập Fable 5 với giới hạn an toàn chặt hơn

    Anthropic sẽ đưa Fable 5 trở lại các sản phẩm Claude từ ngày 1/7 sau khi các hạn chế xuất khẩu của Mỹ được gỡ bỏ, nhưng quyền truy cập ban đầu sẽ bị giới hạn với người dùng gói thuê bao và một số gói doanh nghiệp sẽ tính phí qua credit sử dụng. Công ty cho biết bộ phân loại an toàn mới hiện chặn kỹ thuật vượt cơ chế bảo vệ đứng sau sự cố này trong hơn 99% trường hợp, đồng thời vẫn giữ lại một phần khả năng phòng thủ mạng hợp lệ. Anthropic cũng nói báo cáo gốc không làm lộ năng lực tấn công mạng đặc biệt nào, và các mô hình khác được thử nghiệm như Claude Opus 4.8, GPT-5.5, Kimi K2.7 và Claude Haiku 4.5 cũng có thể nhận ra các lỗ hổng tương tự.