Trendora

red teaming

Trial

Kỹ thuật

Kiểm thử đối kháng nhằm phát hiện lỗi, lỗ hổng và hành vi không an toàn.

Vì sao ở đây

Xếp vào Trial: 5 bài bằng chứng từ 6 nguồn, chủ yếu là tin pháp lý, 3 bài trong 30 ngày qua. Độ tin cậy 81%.

Bằng chứng (5)

  • 9The New Stack·29/7/2026regulation
    Anthropic và các bên liên quan kêu gọi làm chậm phát triển AI tiên phong

    Hơn 1.100 nhà nghiên cứu và lãnh đạo AI đã ký thư ngỏ kêu gọi chính phủ thiết lập cơ chế chủ động làm chậm phát triển AI tiên phong nếu các biện pháp an toàn không theo kịp. Anthropic công khai ủng hộ kiến nghị này, dẫn chứng nghiên cứu về tự cải thiện lặp, trong khi OpenAI cũng bày tỏ đồng thuận và các nghị sĩ Mỹ đang xem xét luật kiểm soát khẩn cấp.

  • 3Simon Willison·25/7/2026research
    Boris Cherny về khả năng chống prompt injection của Opus 5

    Boris Cherny cho biết Opus 5 là mô hình khó bị prompt injection nhất mà ông từng thấy, dựa trên các đánh giá PI và hoạt động red-team. Ông xem đây là điểm nổi bật vượt ra ngoài các điểm số benchmark của mô hình và dẫn tới phần liên quan trong system card.

  • 7OpenAI Blog·15/7/2026research
    GPT-Red: Kiểm thử đối kháng tự động để tăng độ an toàn cho AI

    OpenAI giới thiệu GPT-Red, một hệ thống kiểm thử đối kháng tự động sử dụng cơ chế tự chơi để phát hiện điểm yếu trong các hệ thống AI. Cách tiếp cận này nhằm tăng khả năng chống prompt injection đồng thời hỗ trợ các nỗ lực an toàn và căn chỉnh AI.

  • 9The New Stack·12/6/2026regulation
    Anthropic buộc vô hiệu hóa Fable 5 và Mythos 5 sau chỉ đạo kiểm soát xuất khẩu của Mỹ

    Anthropic cho biết chính phủ Mỹ đã yêu cầu tạm dừng truy cập vào Fable 5 và Mythos 5 đối với mọi công dân nước ngoài, buộc công ty phải vô hiệu hóa hai mô hình này cho toàn bộ khách hàng để tuân thủ quy định. Anthropic nói chỉ đạo này dựa trên lo ngại về một dạng jailbreak, nhưng công ty cho rằng đó chỉ là lỗ hổng hẹp vốn cũng có thể thấy ở các mô hình công khai khác, không phải cơ chế vượt rào toàn diện.

  • 6OpenAI Blog·23/4/2026security
    Chương trình săn lỗi an toàn sinh học GPT-5.5

    OpenAI triển khai chương trình GPT-5.5 Bio Bug Bounty, một thử thách red-teaming nhằm tìm ra các jailbreak phổ quát có thể vượt qua cơ chế bảo vệ an toàn sinh học. Chương trình trao thưởng tối đa 25.000 USD cho các phát hiện hợp lệ.