DeepSWE
AssessCông cụ
Bộ đánh giá cho các bài toán kỹ nghệ phần mềm khó.
Vì sao ở đây
Xếp vào Assess: 3 bài bằng chứng từ 2 nguồn, chủ yếu là phát hành mô hình, 3 bài trong 30 ngày qua. Độ tin cậy 43%.
Bằng chứng (3)
- 7The New Stack·12/8/2026model_releaseSpaceXAI ra mắt Grok 4.6 với cải thiện về tác vụ lập trình dài
SpaceXAI phát hành Grok 4.6 chưa đầy một tháng sau Grok 4.5, với trọng tâm huấn luyện vào tự kiểm tra, sửa lỗi và duy trì tiến độ trên các tác vụ lập trình và tác vụ agent dài hơn. Kết quả benchmark cho thấy mức cải thiện rõ rệt so với Grok 4.5, nhưng Grok 4.6 vẫn đứng sau các mô hình dẫn đầu ở một số bài kiểm tra về coding và terminal.
- 7The New Stack·5/8/2026researchMeta dùng các bản sửa mã của kỹ sư để huấn luyện công cụ viết mã AI nội bộ
Meta đang yêu cầu kỹ sư nộp các bản sửa mã phát sinh khi dùng tác nhân viết mã nội bộ MetaCode để các chỉnh sửa này phục vụ huấn luyện và hậu huấn luyện các mô hình tương lai. Đã có hơn 800 bản sửa từ 7.000 người dùng hoạt động hằng tuần, và Meta cho biết dữ liệu này đã cải thiện Muse Spark 1.1 đồng thời sẽ hỗ trợ huấn luyện một mô hình sắp ra mắt có mật danh Watermelon.
- 7Hacker News·21/7/2026model_releasePoolside ra mắt mô hình lập trình Laguna S 2.1
Poolside đã phát hành Laguna S 2.1, một mô hình lập trình Mixture-of-Experts với 118B tham số tổng và 8B tham số được kích hoạt mỗi token, đồng thời hỗ trợ ngữ cảnh tối đa 1 triệu token. Công ty cho biết mô hình được tối ưu cho các tác vụ lập trình tác nhân dài hơi và công bố kết quả tốt trên các bộ đánh giá như Terminal-Bench 2.1, SWE-Bench Multilingual, SWE-Bench Pro, DeepSWE, SWE Atlas và Toolathlon Verified.