Trendora

Frontier-Bench

Assess

Công cụ

Bộ đánh giá dùng để đo năng lực mô hình trong các tác vụ lập trình và công việc tri thức.

Vì sao ở đây

Xếp vào Assess: 1 bài bằng chứng từ 4 nguồn, chủ yếu là phát hành mô hình, 1 bài trong 30 ngày qua. Độ tin cậy 46%.

Bằng chứng (1)

  • 8Anthropic News·24/7/2026model_release
    Anthropic ra mắt Claude Opus 5

    Anthropic đã giới thiệu Claude Opus 5, mẫu mặc định mới cho Claude Max và là mẫu mạnh nhất trên Claude Pro. Theo Anthropic, mô hình này cải thiện đáng kể về lập trình, công việc tri thức, tự động hóa và nghiên cứu khoa học, đồng thời hiệu quả chi phí tốt hơn Opus 4.8, nhưng vẫn kém Mythos 5 ở các bài đánh giá an ninh mạng.