ARC-AGI
AssessNền tảng
Bộ benchmark dùng để đánh giá trí tuệ tổng quát và khả năng thích ứng giải quyết vấn đề của AI.
Vì sao ở đây
Xếp vào Assess: 3 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 3 bài trong 30 ngày qua. Độ tin cậy 42%.
Bằng chứng (3)
- 8Hacker News·7/8/2026researchDeepSeek V4 Flash 0731 đạt kết quả cao trên các bài kiểm tra ARC-AGI
DeepSeek công bố V4 Flash 0731 với ba biến thể suy luận và đăng kết quả kiểm thử trên ARC-AGI-1 và ARC-AGI-2. Ở mức tối đa, mô hình được cho là đạt 89,0% trên ARC-AGI-1 và 61,4% trên ARC-AGI-2, với chi phí thấp cho mỗi tác vụ. Bài đăng kèm bảng kết quả từng nhiệm vụ và liên kết tới bài báo cùng trang mô hình.
- 7OpenAI Blog·29/7/2026researchHai thiết lập giúp điểm số GPT-5.6 trên ARC-AGI-3 tăng gấp ba
OpenAI cho biết hai thiết lập API đã cải thiện đáng kể hiệu năng của GPT-5.6 trên chuẩn ARC-AGI-3 bằng cách giữ lại trạng thái suy luận và bật cơ chế nén ngữ cảnh. Thay đổi này giúp tăng điểm số và hiệu suất, cho thấy cấu hình ở giai đoạn suy luận có thể ảnh hưởng mạnh đến kết quả benchmark.
- 6Hacker News·25/7/2026researchBảng xếp hạng ARC-AGI theo dõi hiệu quả suy luận của AI
Bảng xếp hạng ARC-AGI so sánh các hệ thống AI trên ARC-AGI-1, ARC-AGI-2 và ARC-AGI-3, đồng thời nhấn mạnh mối quan hệ giữa hiệu năng và chi phí cho mỗi tác vụ. Nội dung cũng cho thấy cách các hệ thống suy luận, LLM cơ bản và bài nộp từ Kaggle hoạt động dưới các ràng buộc tính toán khác nhau.