Mixture of Experts
AdoptKỹ thuật
Kiến trúc mạng nơ-ron thưa, định tuyến mỗi token tới một tập nhỏ các mạng con chuyên gia.
Vì sao ở đây
Xếp vào Adopt: 15 bài bằng chứng từ 4 nguồn, chủ yếu là phát hành mô hình, 6 bài trong 30 ngày qua. Độ tin cậy 83%.
Bằng chứng (15)
- 7Hacker News·5/8/2026product_launchDiscovery Loop ra mắt nhằm tự động hóa quá trình khám phá khoa học và kỹ thuật
Discovery Loop giới thiệu một hệ thống tự động hóa các vòng lặp thí nghiệm, sử dụng các mô hình AI tiên tiến và hạ tầng tính toán quy mô lớn để đề xuất, chạy và đánh giá thí nghiệm song song. Công ty cho biết sẽ bắt đầu từ nghiên cứu và kỹ thuật học máy, sau đó mở rộng sang các bài toán khoa học và kỹ thuật rộng hơn.
- 8The New Stack·3/8/2026model_releaseAlibaba ra mắt Qwen3.8-Max cho các tác vụ tác nhân kéo dài
Alibaba đã ra mắt Qwen3.8-Max, một mô hình đa phương thức với tổng cộng 2,4 nghìn tỷ tham số, được thiết kế cho các tác vụ phức tạp có thể kéo dài nhiều ngày. Theo công ty, mô hình sẽ được cung cấp qua QwenCloud và Alibaba Cloud Model Studio, weights sẽ được phát hành tuần tới và một demo lập trình kéo dài 16 ngày có dấu vết công khai trên GitHub. Alibaba chưa công bố đủ thông tin để bên ngoài tự kiểm chứng các kết quả thử nghiệm kéo dài này.
- 7Hacker News·23/7/2026open_sourcePetals cho phép chạy mô hình ngôn ngữ lớn tại nhà
Petals là một hệ thống suy luận và tinh chỉnh phân tán, cho phép người dùng chạy một phần mô hình ngôn ngữ lớn trên GPU phổ thông rồi chia sẻ phần còn lại qua mạng ngang hàng theo kiểu BitTorrent. Hệ thống hỗ trợ các mô hình như Llama 3.1, Mixtral, Falcon và BLOOM, đồng thời cung cấp trải nghiệm gần giống API nhưng vẫn cho phép tùy biến sâu ở mức mô hình.
- 7Hacker News·21/7/2026model_releasePoolside ra mắt mô hình lập trình Laguna S 2.1
Poolside đã phát hành Laguna S 2.1, một mô hình lập trình Mixture-of-Experts với 118B tham số tổng và 8B tham số được kích hoạt mỗi token, đồng thời hỗ trợ ngữ cảnh tối đa 1 triệu token. Công ty cho biết mô hình được tối ưu cho các tác vụ lập trình tác nhân dài hơi và công bố kết quả tốt trên các bộ đánh giá như Terminal-Bench 2.1, SWE-Bench Multilingual, SWE-Bench Pro, DeepSWE, SWE Atlas và Toolathlon Verified.
- 8Simon Willison·16/7/2026model_releaseKimi K3 ra mắt với tư cách mô hình mã nguồn mở lớp 3 nghìn tỷ tham số
Kimi đã giới thiệu Kimi K3, một mô hình mở với 2,8 nghìn tỷ tham số, hỗ trợ thị giác gốc và cửa sổ ngữ cảnh 1 triệu token. Công ty cho biết mô hình được tối ưu cho lập trình dài hạn, suy luận và công việc tri thức, đồng thời sẽ phát hành đầy đủ trọng số vào ngày 27/7/2026.
- 8Hugging Face Blog·15/7/2026model_releasePhát hành mô hình đa phương thức Inkling mở trọng số
Thinking Machines đã phát hành Inkling, một mô hình Mixture-of-Experts mở trọng số được huấn luyện từ đầu và cung cấp đầy đủ trọng số để tùy biến. Mô hình hỗ trợ ngữ cảnh tối đa 1 triệu token, xử lý tự nhiên văn bản, hình ảnh và âm thanh, đồng thời có thể tinh chỉnh trên Tinker; bản xem trước Inkling-Small cũng được công bố.
- 6Hacker News·9/7/2026open_sourceColibrì chạy GLM 5.2 trên laptop chậm bằng cách phát trực tiếp các expert MoE từ đĩa
Một bài đăng trên Hacker News giới thiệu Colibrì, một engine viết bằng C trong một tệp nhằm chạy mô hình mixture-of-experts GLM 5.2 trên phần cứng khiêm tốn. Tác giả cho biết hệ thống giữ các phần dense của mô hình trong RAM ở định dạng int4 và phát trực tiếp các expert được định tuyến từ đĩa, giúp chạy trên laptop 32 GB mà không bị tràn bộ nhớ.
- 8Hugging Face Blog·8/7/2026framework_updateBackend Transformers trong vLLM đạt tốc độ ngang native
Hugging Face cho biết backend mô hình Transformers trong vLLM nay đã đạt hoặc vượt thông lượng của các bản triển khai native do vLLM tự viết cho một số mô hình Qwen3. Bản cập nhật cho phép tác giả mô hình chạy mô hình Transformers trong vLLM chỉ với một cờ cấu hình, đồng thời vẫn giữ nguyên các chế độ song song và quy trình phục vụ quen thuộc.
- 8Simon Willison·6/7/2026model_releaseTencent phát hành mô hình mở Hy3
Tencent đã phát hành Hy3, một mô hình Mixture-of-Experts được cấp phép Apache 2.0 với 295 tỷ tham số tổng và 21 tỷ tham số hoạt động. Theo Tencent, mô hình được cải thiện nhờ phản hồi từ hơn 50 sản phẩm và cho thấy hiệu năng tốt trên các tác vụ tiện ích và năng suất, đồng thời được dùng miễn phí trên OpenRouter đến ngày 21/7.
- 7Hacker News·30/6/2026model_releaseLongCat-2.0: mô hình MoE 1,6 nghìn tỷ tham số với 48 tỷ tham số hoạt động
LongCat-2.0 là một mô hình ngôn ngữ Mixture-of-Experts quy mô lớn, được công bố với 1,6 nghìn tỷ tham số tổng cộng và 48 tỷ tham số hoạt động trong mỗi lần suy luận. Bản phát hành nhấn mạnh thiết kế nhằm mở rộng năng lực mô hình nhưng vẫn giữ chi phí tính toán khi suy luận thấp hơn so với mô hình đặc hơn có quy mô tương đương.
- 7Hugging Face Blog·24/6/2026framework_updateNVIDIA NeMo AutoModel tăng tốc tinh chỉnh MoE trên Transformers v5
Hugging Face giới thiệu cách NVIDIA NeMo AutoModel tận dụng Transformers v5 để cải thiện hiệu năng tinh chỉnh các mô hình Mixture-of-Experts. Với cùng API from_pretrained(), giải pháp này bổ sung Expert Parallelism, cơ chế all-to-all DeepEP và các kernel TransformerEngine, giúp tăng thông lượng và giảm mức dùng bộ nhớ GPU.
- 8Simon Willison·17/6/2026model_releaseMô hình mã nguồn mở GLM-5.2 ra mắt với ngữ cảnh 1 triệu token
Z.ai đã phát hành GLM-5.2 dưới dạng open weights theo giấy phép MIT sau giai đoạn triển khai sớm cho người dùng gói coding. Đây là mô hình Mixture-of-Experts chỉ nhận văn bản với cửa sổ ngữ cảnh 1 triệu token và đang được đánh giá là mô hình open weights dẫn đầu trên các benchmark độc lập, dù mức tiêu thụ token đầu ra khá cao.
- 6Hugging Face Blog·1/6/2026model_releaseJetBrains ra mắt Mellum2, mô hình MoE 12 tỷ tham số
JetBrains đã phát hành Mellum2, một mô hình mixture-of-experts mã nguồn mở với 12 tỷ tham số, được huấn luyện từ đầu trên ngôn ngữ tự nhiên và mã nguồn. Mô hình chỉ kích hoạt 2,5 tỷ tham số cho mỗi token, hướng tới suy luận độ trễ thấp và thông lượng cao, đồng thời được phát hành theo giấy phép Apache 2.0. JetBrains cho biết mô hình phù hợp cho các tác vụ định tuyến, RAG, tóm tắt, tác tử con, quy trình lập trình và triển khai riêng tư.
- 7Hugging Face Blog·26/2/2026researchMô hình Mixture of Experts trong Transformers
Hugging Face giải thích cách kiến trúc Mixture of Experts (MoE) thay thế các lớp feed-forward dày đặc bằng cơ chế định tuyến thưa tới các chuyên gia để tăng hiệu quả tính toán. Bài viết nhấn mạnh việc MoE có thể đạt chất lượng tương đương mô hình dày đặc nhưng với ít tham số hoạt động hơn khi suy luận, đồng thời cho thấy mức độ phổ biến ngày càng tăng trong các mô hình mã nguồn mở gần đây và hệ sinh thái Transformers.
- 6Hugging Face Blog·27/1/2026researchHệ sinh thái AI mã nguồn mở của Trung Quốc tiến xa hơn DeepSeek
Bài viết của Hugging Face tổng quan cách cộng đồng AI mã nguồn mở Trung Quốc trong năm 2025 chuyển sang kiến trúc Mixture-of-Experts, mở rộng sang các hệ thống đa phương thức và ưu tiên các mô hình nhỏ dễ triển khai, tinh chỉnh hơn. Bài viết cũng ghi nhận việc gia tăng sử dụng phần cứng nội địa Trung Quốc và chú trọng vào các tài sản kỹ thuật tái sử dụng như hạ tầng suy luận, bộ dữ liệu, công cụ đánh giá và quy trình tác tử.