Trendora

alignment

Assess

Kỹ thuật

Các phương pháp giúp hệ thống AI hành xử phù hợp với mục tiêu và giá trị đặt ra.

Vì sao ở đây

Xếp vào Assess: 4 bài bằng chứng từ 2 nguồn, chủ yếu là tin gọi vốn, 1 bài trong 30 ngày qua. Độ tin cậy 53%.

Bằng chứng (4)

  • 6OpenAI Blog·20/7/2026research
    OpenAI chia sẻ bài học an toàn từ các mô hình AI chạy dài

    OpenAI trình bày các bài học về an toàn và căn chỉnh rút ra từ việc triển khai các mô hình AI có khả năng hoạt động trong thời gian dài và thực hiện nhiều bước liên tiếp. Bài viết nêu các rủi ro mới, những dạng lỗi quan sát được, và các biện pháp bảo vệ được cải thiện qua quá trình triển khai lặp lại.

  • 4Anthropic News·19/5/2026framework_update
    Anthropic mở rộng đối thoại về AI biên

    Anthropic cho biết hãng đã bắt đầu các phiên đối thoại với học giả, giáo sĩ, triết gia, nhà đạo đức học và nhiều nhóm khác để định hướng việc phát triển các hệ thống AI biên. Công ty kỳ vọng các cuộc trao đổi này sẽ góp phần định hình hiến chương của Claude, các giá trị huấn luyện và tiêu chí đánh giá, với trọng tâm là hình thành “tính cách” và triển khai có trách nhiệm.

  • 5OpenAI Blog·6/4/2026funding
    OpenAI ra mắt chương trình thử nghiệm Safety Fellowship

    OpenAI công bố chương trình thử nghiệm Safety Fellowship nhằm hỗ trợ nghiên cứu độc lập về an toàn và căn chỉnh AI. Chương trình cũng hướng tới việc phát triển thế hệ nhân tài tiếp theo trong lĩnh vực an toàn AI.

  • 7OpenAI Blog·19/2/2026funding
    OpenAI tài trợ nghiên cứu độc lập về căn chỉnh AI

    OpenAI cam kết tài trợ 7,5 triệu USD cho The Alignment Project nhằm hỗ trợ nghiên cứu độc lập về căn chỉnh AI. Khoản tài trợ này hướng tới việc tăng cường các nỗ lực toàn cầu về an toàn và an ninh trước rủi ro từ AGI.