alignment
AssessKỹ thuật
Các phương pháp giúp hệ thống AI hành xử phù hợp với mục tiêu và giá trị đặt ra.
Vì sao ở đây
Xếp vào Assess: 4 bài bằng chứng từ 2 nguồn, chủ yếu là tin gọi vốn, 1 bài trong 30 ngày qua. Độ tin cậy 53%.
Bằng chứng (4)
- 6OpenAI Blog·20/7/2026researchOpenAI chia sẻ bài học an toàn từ các mô hình AI chạy dài
OpenAI trình bày các bài học về an toàn và căn chỉnh rút ra từ việc triển khai các mô hình AI có khả năng hoạt động trong thời gian dài và thực hiện nhiều bước liên tiếp. Bài viết nêu các rủi ro mới, những dạng lỗi quan sát được, và các biện pháp bảo vệ được cải thiện qua quá trình triển khai lặp lại.
- 4Anthropic News·19/5/2026framework_updateAnthropic mở rộng đối thoại về AI biên
Anthropic cho biết hãng đã bắt đầu các phiên đối thoại với học giả, giáo sĩ, triết gia, nhà đạo đức học và nhiều nhóm khác để định hướng việc phát triển các hệ thống AI biên. Công ty kỳ vọng các cuộc trao đổi này sẽ góp phần định hình hiến chương của Claude, các giá trị huấn luyện và tiêu chí đánh giá, với trọng tâm là hình thành “tính cách” và triển khai có trách nhiệm.
- 5OpenAI Blog·6/4/2026fundingOpenAI ra mắt chương trình thử nghiệm Safety Fellowship
OpenAI công bố chương trình thử nghiệm Safety Fellowship nhằm hỗ trợ nghiên cứu độc lập về an toàn và căn chỉnh AI. Chương trình cũng hướng tới việc phát triển thế hệ nhân tài tiếp theo trong lĩnh vực an toàn AI.
- 7OpenAI Blog·19/2/2026fundingOpenAI tài trợ nghiên cứu độc lập về căn chỉnh AI
OpenAI cam kết tài trợ 7,5 triệu USD cho The Alignment Project nhằm hỗ trợ nghiên cứu độc lập về căn chỉnh AI. Khoản tài trợ này hướng tới việc tăng cường các nỗ lực toàn cầu về an toàn và an ninh trước rủi ro từ AGI.