harness
AssessKỹ thuật
Lớp thực thi chạy model, xử lý lời gọi công cụ và quyết định khi nào dừng.
Vì sao ở đây
Xếp vào Assess: 8 bài bằng chứng từ 4 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 73%.
Bằng chứng (8)
- 6The New Stack·22/7/2026product_launchHarness ra mắt dịch vụ AI Agent Development Lifecycle để triển khai tác tử có kiểm soát
Harness đã ra mắt dịch vụ AI Agent Development Lifecycle (DLC) nhằm giúp các nhóm triển khai tác tử AI qua các quy trình quản trị, kiểm thử và bảo mật quen thuộc. Công ty cho biết cách tiếp cận này tập trung vào việc làm cho pipeline triển khai trở nên có tính quyết định với các cổng chất lượng, điểm đánh giá và bản ghi kiểm toán đầy đủ, thay vì cố làm cho hành vi của tác tử trở nên lặp lại hoàn toàn.
- 5The New Stack·6/7/2026researchJetBrains cho thấy chế độ 'caveman' của Claude Code tiết kiệm ít token hơn nhiều so với quảng cáo
Khi các công cụ lập trình bằng AI ngày càng tính phí theo mức sử dụng, các nhà phát triển tìm cách giảm token bằng cách khiến phản hồi của trợ lý ngắn gọn hơn. JetBrains đã kiểm thử một skill phổ biến của Claude Code buộc đầu ra theo kiểu cộc lốc, “caveman”, và ghi nhận mức giảm token chỉ khoảng 8,5% trong các tác vụ lập trình thực tế, thấp hơn nhiều so với mức quảng cáo 65% vì phần lớn đầu ra của agent vẫn là mã, diff và kết quả công cụ chính xác.
- 5Martin Fowler·6/7/2026researchHội thảo Thoughtworks cho thấy sự chuyển dịch sang phát triển phần mềm theo tác tử
Martin Fowler tường thuật về hội thảo Future of Software Development Retreat lần thứ hai của Thoughtworks tại châu Âu, nơi đa số người tham dự cho rằng phát triển theo tác tử đã trở thành thực tế và đang được triển khai trong sản xuất. Trọng tâm thảo luận đã chuyển từ việc liệu AI tác tử có làm thay đổi kỹ nghệ phần mềm hay không sang cách sử dụng chúng hiệu quả, bao gồm harness engineering, chi phí token, kiến trúc, và nhu cầu về các trừu tượng tốt hơn cùng sự “cảm nhận cơ học” với mô hình.
- 7The New Stack·30/6/2026product_launchHarness ra mắt tác nhân lao động tự động có kiểm soát cho môi trường sản xuất
Harness đã giới thiệu Autonomous Worker Agents, cho phép doanh nghiệp thay thế các kịch bản cố định trong pipeline bằng tác nhân AI thực hiện các tác vụ như triển khai, kiểm thử và quét bảo mật. Các tác nhân này chạy trên hạ tầng do khách hàng kiểm soát và thừa hưởng các cơ chế quản trị, kiểm toán, danh tính và chính sách sẵn có để tăng độ tin cậy khi dùng trong sản xuất.
- 6Hacker News·29/6/2026open_sourceHackerRank mã nguồn mở hệ thống ATS, cho thấy điểm số LLM biến động
Một bài đăng trên Hacker News bàn về hệ thống theo dõi ứng viên (ATS) mã nguồn mở của HackerRank và cho thấy cùng một bản CV có thể nhận điểm rất khác nhau qua nhiều lần chạy. Tác giả cho rằng việc chấm điểm CV bằng LLM có độ bất định cao ở một số hạng mục, khiến các ngưỡng tuyển dụng trở nên thiếu tin cậy.
- 4Hugging Face Blog·25/5/2026researchHugging Face làm rõ thuật ngữ về tác nhân AI
Hugging Face đã công bố một bảng thuật ngữ giải thích các khái niệm thường bị nhầm lẫn trong tác nhân AI như model, scaffolding và harness. Bài viết nhằm cung cấp một ngôn ngữ chung thực dụng cho việc xây dựng, triển khai và đánh giá tác nhân, đồng thời lưu ý rằng nhiều định nghĩa vẫn khác nhau giữa các framework.
- 6Martin Fowler·29/4/2026framework_updateLập trình bằng AI chuyển sang kỹ thuật khung kiểm chứng
Martin Fowler giới thiệu bản cập nhật hướng dẫn của Chris Parsons cùng các bài viết về harness engineering, nhấn mạnh việc thay đổi nhỏ, thiết lập rào chắn tốt và kiểm chứng tự động trước khi phát hành mã. Nội dung cũng cho thấy các công cụ và kỹ thuật như Claude Code, Codex CLI, phân tích tĩnh và kiểm thử đang trở thành trọng tâm của phát triển phần mềm với tác nhân AI.
- 5Martin Fowler·2/4/2026researchThiết kế harness cho người dùng tác nhân lập trình
Bài viết đề xuất một mô hình tư duy về harness engineering cho các tác nhân lập trình nhằm tăng độ tin cậy của mã do AI tạo ra. Tác giả cho rằng cần kết hợp các cơ chế dẫn hướng trước và phản hồi sau, dùng cả công cụ xác định lẫn đánh giá ngữ nghĩa để giảm lỗi trước khi con người xem xét.