Radar đã đẩy OpenAI tools từ trial sang adopt. Các bài viết về sandbox escapes, runaway agents, và lo ngại quanh benchmark cho thấy rủi ro vận hành đã đủ rõ để test phải đi sâu hơn kiểm thử truyền thống.
Với việc OpenAI tools đang được adopt, test cần chuyển trọng tâm từ kiểm thử chức năng sang kiểm thử hành vi, giới hạn, và thoát khỏi sandbox. Các case về agent vượt rào và benchmark breach cho thấy QA phải bổ sung test cho quyền truy cập, dữ liệu nhạy cảm, và các đường đi lỗi không còn nằm trong happy path.