Trendora

Terminal Bench

Trial

Công cụ

Bộ công cụ đánh giá dùng để chạy và chấm điểm các tác vụ benchmark.

Vì sao ở đây

Xếp vào Trial: 5 bài bằng chứng từ 3 nguồn, chủ yếu là phát hành mô hình, 3 bài trong 30 ngày qua. Độ tin cậy 58%.

Bằng chứng (5)

  • 7Hacker News·12/8/2026model_release
    SpaceXAI ra mắt Grok 4.6 với cải thiện về tác vụ lập trình dài

    SpaceXAI phát hành Grok 4.6 chưa đầy một tháng sau Grok 4.5, với trọng tâm huấn luyện vào tự kiểm tra, sửa lỗi và duy trì tiến độ trên các tác vụ lập trình và tác vụ agent dài hơn. Kết quả benchmark cho thấy mức cải thiện rõ rệt so với Grok 4.5, nhưng Grok 4.6 vẫn đứng sau các mô hình dẫn đầu ở một số bài kiểm tra về coding và terminal.

  • 7Hacker News·21/7/2026model_release
    Poolside ra mắt mô hình lập trình Laguna S 2.1

    Poolside đã phát hành Laguna S 2.1, một mô hình lập trình Mixture-of-Experts với 118B tham số tổng và 8B tham số được kích hoạt mỗi token, đồng thời hỗ trợ ngữ cảnh tối đa 1 triệu token. Công ty cho biết mô hình được tối ưu cho các tác vụ lập trình tác nhân dài hơi và công bố kết quả tốt trên các bộ đánh giá như Terminal-Bench 2.1, SWE-Bench Multilingual, SWE-Bench Pro, DeepSWE, SWE Atlas và Toolathlon Verified.

  • 4Hacker News·19/7/2026research
    Cách một nhà nghiên cứu giảm chi phí token của AI agents bằng các gói thuê bao sẵn có

    Một nhà nghiên cứu tại Quesma mô tả việc xây dựng pipeline deep research để tìm hiểu kinh tế học của AI agent sau khi lần chạy đầu tiên làm cạn hạn mức Claude Max chỉ trong 30 phút. Thiết lập mới dùng Claude Code làm bộ điều phối chính, bổ sung Codex và Antigravity như các subagent không giao diện, cùng chia sẻ bộ nhớ qua claude-mem, đồng thời phân vai cho các mô hình rẻ hơn để giảm chi phí và tăng khả năng যাচ thực.

  • 7The New Stack·9/7/2026framework_update
    DevRev công bố bộ benchmark cho tác tử AI doanh nghiệp

    DevRev giới thiệu bộ benchmark Enterprise AI Agent Benchmark mã nguồn mở nhằm đo lường tốt hơn hiệu năng của tác tử AI trong các tác vụ doanh nghiệp thực tế, đặc biệt khi làm việc với ngữ cảnh dữ liệu lớn và có phân quyền truy cập. Phiên bản đầu tiên mới bao gồm hai mức L1 và L2, đồng thời công bố bộ dữ liệu, bộ đánh giá, tiêu chí chấm điểm, kết quả và trace thô để bên khác có thể tái kiểm tra.

  • 8Hugging Face Blog·17/6/2026model_release
    GLM-5.2 ra mắt với hỗ trợ lập trình dài hạn và ngữ cảnh 1 triệu token

    Z.AI giới thiệu GLM-5.2, mẫu flagship mới cho các tác vụ dài hạn, với ngữ cảnh 1 triệu token ổn định và năng lực lập trình được cải thiện. Bản phát hành còn bổ sung mức effort linh hoạt, kiến trúc IndexShare để giảm chi phí tính toán và giấy phép mã nguồn mở MIT.