Guardrails
AssessKỹ thuật
Các cơ chế an toàn và kiểm soát chính sách nhằm hạn chế hành vi gây hại của mô hình.
Vì sao ở đây
Xếp vào Assess: 2 bài bằng chứng từ 1 nguồn, chủ yếu là tin bảo mật, 1 bài trong 30 ngày qua. Độ tin cậy 31%.
Bằng chứng (2)
- 6Ars Technica AI·13/7/2026securityPhòng thủ dùng prompt injection để chặn tác nhân tấn công AI
Các nhà nghiên cứu tại Tracebit cho biết việc đặt prompt injection cạnh mật khẩu, khóa mã hóa và các bí mật khác trên AWS đôi khi có thể khiến tác nhân tấn công bằng AI dừng lại. Nội dung được chèn yêu cầu mô hình thực hiện một hành động bị rào chắn an toàn chặn, từ đó làm tác nhân tự tắt thay vì tiếp tục tấn công.
- 7Ars Technica AI·8/7/2026securityGiới nghiên cứu cảnh báo rủi ro prompt injection trong các công cụ AI phổ biến
Ars Technica cho biết prompt injection đã trở thành một trong những mối đe dọa an ninh hàng đầu đối với các mô hình ngôn ngữ lớn, vì chúng không thể phân biệt đáng tin cậy giữa chỉ dẫn hợp lệ và nội dung độc hại được nhúng trong email, mã nguồn hoặc dữ liệu bên thứ ba khác. Bài viết nêu rằng điểm yếu này có thể khiến kẻ tấn công che giấu lệnh để hệ thống AI vô tình làm theo, buộc các nhà phát triển phải dựa vào lớp phòng vệ thay vì có được ranh giới thật sự giữa nguồn tin cậy và không tin cậy.