Artificial Analysis
TrialNền tảng
Nguồn so sánh và benchmark về hiệu năng, giá của mô hình.
Vì sao ở đây
Xếp vào Trial: 5 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 4 bài trong 30 ngày qua. Độ tin cậy 51%.
Bằng chứng (5)
- 6Hacker News·6/8/2026researchQwen3.8 Max đứng đầu bảng xếp hạng agentic của Artificial Analysis
Artificial Analysis đã cập nhật Intelligence Index lên v4.1.1 và công bố đánh giá mới cho Qwen3.8 Max. Mô hình này hiện được xếp hạng là tốt nhất trên agentic index theo bộ benchmark độc lập của trang. Bản cập nhật cũng đi kèm thay đổi phương pháp và điểm số mới cho một số mô hình khác, nhưng điểm đáng chú ý nhất là Qwen3.8 Max vươn lên vị trí dẫn đầu.
- 5Hacker News·31/7/2026model_releaseDeepSeek V4 Flash 0731 đạt thứ hạng cao trong phân tích mô hình
Artificial Analysis cho biết DeepSeek V4 Flash 0731 (Reasoning, Max Effort) đạt điểm cao trên Intelligence Index, nằm trong nhóm mô hình open-weight dẫn đầu ở cùng phân khúc kích thước. Mô hình có ngữ cảnh 1 triệu token, 13 tỷ tham số hoạt động trên tổng 284 tỷ tham số, và mức giá đầu vào/đầu ra khá cạnh tranh so với các đối thủ cùng loại.
- 6Hacker News·24/7/2026researchOpus 5 đứng đầu bảng xếp hạng Artificial Analysis Intelligence
Artificial Analysis cho biết Claude Opus 5 là mô hình có điểm cao nhất trên bảng xếp hạng Intelligence, với các biến thể Opus 5 đứng trên các hệ thống dẫn đầu khác như Claude Fable 5 và GPT-5.6 Sol. Trang này so sánh các mô hình theo trí tuệ, tốc độ, độ trễ, chi phí và cửa sổ ngữ cảnh dựa trên bộ phương pháp đánh giá nhiều tiêu chí của hãng.
- 4Hacker News·19/7/2026researchCách một nhà nghiên cứu giảm chi phí token của AI agents bằng các gói thuê bao sẵn có
Một nhà nghiên cứu tại Quesma mô tả việc xây dựng pipeline deep research để tìm hiểu kinh tế học của AI agent sau khi lần chạy đầu tiên làm cạn hạn mức Claude Max chỉ trong 30 phút. Thiết lập mới dùng Claude Code làm bộ điều phối chính, bổ sung Codex và Antigravity như các subagent không giao diện, cùng chia sẻ bộ nhớ qua claude-mem, đồng thời phân vai cho các mô hình rẻ hơn để giảm chi phí và tăng khả năng যাচ thực.
- 8Simon Willison·17/6/2026model_releaseMô hình mã nguồn mở GLM-5.2 ra mắt với ngữ cảnh 1 triệu token
Z.ai đã phát hành GLM-5.2 dưới dạng open weights theo giấy phép MIT sau giai đoạn triển khai sớm cho người dùng gói coding. Đây là mô hình Mixture-of-Experts chỉ nhận văn bản với cửa sổ ngữ cảnh 1 triệu token và đang được đánh giá là mô hình open weights dẫn đầu trên các benchmark độc lập, dù mức tiêu thụ token đầu ra khá cao.