red teaming
TrialKỹ thuật
Kiểm thử đối kháng nhằm phát hiện lỗi, lỗ hổng và hành vi không an toàn.
Vì sao ở đây
Xếp vào Trial: 5 bài bằng chứng từ 6 nguồn, chủ yếu là tin pháp lý, 3 bài trong 30 ngày qua. Độ tin cậy 81%.
Bằng chứng (5)
- 9The New Stack·29/7/2026regulationAnthropic và các bên liên quan kêu gọi làm chậm phát triển AI tiên phong
Hơn 1.100 nhà nghiên cứu và lãnh đạo AI đã ký thư ngỏ kêu gọi chính phủ thiết lập cơ chế chủ động làm chậm phát triển AI tiên phong nếu các biện pháp an toàn không theo kịp. Anthropic công khai ủng hộ kiến nghị này, dẫn chứng nghiên cứu về tự cải thiện lặp, trong khi OpenAI cũng bày tỏ đồng thuận và các nghị sĩ Mỹ đang xem xét luật kiểm soát khẩn cấp.
- 3Simon Willison·25/7/2026researchBoris Cherny về khả năng chống prompt injection của Opus 5
Boris Cherny cho biết Opus 5 là mô hình khó bị prompt injection nhất mà ông từng thấy, dựa trên các đánh giá PI và hoạt động red-team. Ông xem đây là điểm nổi bật vượt ra ngoài các điểm số benchmark của mô hình và dẫn tới phần liên quan trong system card.
- 7OpenAI Blog·15/7/2026researchGPT-Red: Kiểm thử đối kháng tự động để tăng độ an toàn cho AI
OpenAI giới thiệu GPT-Red, một hệ thống kiểm thử đối kháng tự động sử dụng cơ chế tự chơi để phát hiện điểm yếu trong các hệ thống AI. Cách tiếp cận này nhằm tăng khả năng chống prompt injection đồng thời hỗ trợ các nỗ lực an toàn và căn chỉnh AI.
- 9The New Stack·12/6/2026regulationAnthropic buộc vô hiệu hóa Fable 5 và Mythos 5 sau chỉ đạo kiểm soát xuất khẩu của Mỹ
Anthropic cho biết chính phủ Mỹ đã yêu cầu tạm dừng truy cập vào Fable 5 và Mythos 5 đối với mọi công dân nước ngoài, buộc công ty phải vô hiệu hóa hai mô hình này cho toàn bộ khách hàng để tuân thủ quy định. Anthropic nói chỉ đạo này dựa trên lo ngại về một dạng jailbreak, nhưng công ty cho rằng đó chỉ là lỗ hổng hẹp vốn cũng có thể thấy ở các mô hình công khai khác, không phải cơ chế vượt rào toàn diện.
- 6OpenAI Blog·23/4/2026securityChương trình săn lỗi an toàn sinh học GPT-5.5
OpenAI triển khai chương trình GPT-5.5 Bio Bug Bounty, một thử thách red-teaming nhằm tìm ra các jailbreak phổ quát có thể vượt qua cơ chế bảo vệ an toàn sinh học. Chương trình trao thưởng tối đa 25.000 USD cho các phát hiện hợp lệ.