Trendora

APEX-Agents

Assess

Công cụ

Một bộ benchmark đánh giá hiệu năng tác vụ agent và khả năng thực thi trong thời gian dài.

Vì sao ở đây

Xếp vào Assess: 1 bài bằng chứng từ 1 nguồn, chủ yếu là phát hành mô hình, 1 bài trong 30 ngày qua. Độ tin cậy 24%. Bằng chứng còn ít nên xếp thận trọng, chờ thêm tín hiệu.

Bằng chứng (1)

  • 7Hacker News·12/8/2026model_release
    SpaceXAI ra mắt Grok 4.6 với cải thiện về tác vụ lập trình dài

    SpaceXAI phát hành Grok 4.6 chưa đầy một tháng sau Grok 4.5, với trọng tâm huấn luyện vào tự kiểm tra, sửa lỗi và duy trì tiến độ trên các tác vụ lập trình và tác vụ agent dài hơn. Kết quả benchmark cho thấy mức cải thiện rõ rệt so với Grok 4.5, nhưng Grok 4.6 vẫn đứng sau các mô hình dẫn đầu ở một số bài kiểm tra về coding và terminal.