Trendora

SWE-bench

Trial

Kỹ thuật

Một bộ benchmark cho các tác vụ sửa lỗi phần mềm thực tế.

Vì sao ở đây

Xếp vào Trial: 4 bài bằng chứng từ 3 nguồn, chủ yếu là tin nghiên cứu, 3 bài trong 30 ngày qua. Độ tin cậy 52%.

Bằng chứng (4)

  • 5GitHub Blog·22/7/2026product_launch
    GitHub giải thích Copilot bao gồm gì so với truy cập API thô

    GitHub nêu rõ sự khác biệt giữa việc trả phí cho Copilot và dùng API mô hình trực tiếp, cho rằng Copilot bao gồm cả quy trình phát triển, kiểm soát chính sách và khả năng theo dõi chi phí, chứ không chỉ quyền truy cập mô hình. Bài viết cũng cho biết harness tác tử của Copilot có thể đạt mức hoàn thành tác vụ tương đương với ít token hơn trong nhiều cấu hình benchmark, trong khi API thô phù hợp hơn với các đội tự xây hệ thống riêng.

  • 7Hacker News·21/7/2026research
    Kimi K3 ngang Fable trên tác vụ agent, kết hợp định tuyến cho kết quả tốt hơn

    Một nghiên cứu benchmark trên khoảng 1.030 tác vụ agent thực tế cho thấy Kimi K3 và Fable 5 có chất lượng tổng thể tương đương, nhưng mỗi mô hình mạnh ở các nhóm tác vụ khác nhau. Bài viết cho biết việc định tuyến giữa hai mô hình đạt độ chính xác 93% và có thể giảm chi phí tới 50 lần so với chỉ dùng Fable trong các vòng lặp agent dài.

  • 7Hacker News·21/7/2026model_release
    Poolside ra mắt mô hình lập trình Laguna S 2.1

    Poolside đã phát hành Laguna S 2.1, một mô hình lập trình Mixture-of-Experts với 118B tham số tổng và 8B tham số được kích hoạt mỗi token, đồng thời hỗ trợ ngữ cảnh tối đa 1 triệu token. Công ty cho biết mô hình được tối ưu cho các tác vụ lập trình tác nhân dài hơi và công bố kết quả tốt trên các bộ đánh giá như Terminal-Bench 2.1, SWE-Bench Multilingual, SWE-Bench Pro, DeepSWE, SWE Atlas và Toolathlon Verified.

  • 7OpenAI Blog·8/7/2026research
    OpenAI đặt nghi vấn về độ tin cậy của SWE-Bench Pro

    OpenAI công bố một phân tích cho thấy SWE-Bench Pro, một bộ chuẩn đánh giá lập trình được dùng rộng rãi, tồn tại nhiều vấn đề. Kết quả này làm dấy lên lo ngại rằng benchmark này có thể không phản ánh đáng tin cậy hiệu năng mô hình hoặc cung cấp tín hiệu chính xác khi đánh giá các hệ thống AI viết mã.