Trendora

Guardrails

Assess

Kỹ thuật

Các cơ chế an toàn và kiểm soát chính sách nhằm hạn chế hành vi gây hại của mô hình.

Vì sao ở đây

Xếp vào Assess: 2 bài bằng chứng từ 1 nguồn, chủ yếu là tin bảo mật, 1 bài trong 30 ngày qua. Độ tin cậy 31%.

Bằng chứng (2)

  • 6Ars Technica AI·13/7/2026security
    Phòng thủ dùng prompt injection để chặn tác nhân tấn công AI

    Các nhà nghiên cứu tại Tracebit cho biết việc đặt prompt injection cạnh mật khẩu, khóa mã hóa và các bí mật khác trên AWS đôi khi có thể khiến tác nhân tấn công bằng AI dừng lại. Nội dung được chèn yêu cầu mô hình thực hiện một hành động bị rào chắn an toàn chặn, từ đó làm tác nhân tự tắt thay vì tiếp tục tấn công.

  • 7Ars Technica AI·8/7/2026security
    Giới nghiên cứu cảnh báo rủi ro prompt injection trong các công cụ AI phổ biến

    Ars Technica cho biết prompt injection đã trở thành một trong những mối đe dọa an ninh hàng đầu đối với các mô hình ngôn ngữ lớn, vì chúng không thể phân biệt đáng tin cậy giữa chỉ dẫn hợp lệ và nội dung độc hại được nhúng trong email, mã nguồn hoặc dữ liệu bên thứ ba khác. Bài viết nêu rằng điểm yếu này có thể khiến kẻ tấn công che giấu lệnh để hệ thống AI vô tình làm theo, buộc các nhà phát triển phải dựa vào lớp phòng vệ thay vì có được ranh giới thật sự giữa nguồn tin cậy và không tin cậy.