GGUF
AssessCông cụ
Định dạng tệp thường dùng để lưu trọng số mô hình LLM đã được lượng tử hóa.
Vì sao ở đây
Xếp vào Assess: 4 bài bằng chứng từ 3 nguồn, chủ yếu là phát hành mô hình, 2 bài trong 30 ngày qua. Độ tin cậy 57%.
Bằng chứng (4)
- 7The New Stack·12/8/2026model_releaseMeta phát hành pipeline chưng cất của riêng mình với Muse Glimmer
Meta đã phát hành Muse Glimmer, một mô hình mã nguồn mở trọng số 30 tỷ tham số được chưng cất từ Muse Spark và cấp phép Apache 2.0. Bản phát hành này đóng gói cả phần mô hình “giáo viên” lẫn “học trò” trong quy trình chưng cất, kèm các bản dựng lượng tử hóa và thành phần drafting, cho thấy chưng cất đang trở thành một pipeline triển khai cho doanh nghiệp chứ không chỉ là vấn đề sao chép mô hình.
- 5Hacker News·28/7/2026model_releasePhát hành mô hình Neutrino-1 8B kèm bộ nhị phân và gói triển khai
Neutrino-1 8B đã được phát hành cùng với trọng số mô hình, bản nhị phân gốc, gói GGUF và gói MLX. Người dùng có thể chạy qua công cụ chat của Fermion sau khi cài gói fermion-research; lần chạy đầu sẽ tải gói truyền tải 2,56 GB, kiểm tra SHA-256 rồi giải nén cục bộ để các lần sau dùng từ bộ nhớ đệm.
- 6Hacker News·29/6/2026model_releaseQwen 3.6 27B được xem là mô hình phù hợp để phát triển cục bộ
Bài viết cho rằng Qwen 3.6 27B là mô hình chạy cục bộ thuyết phục nhất mà tác giả từng thử, cho thấy kết quả tốt hơn các lựa chọn local trước đây trong các bài kiểm tra viết có ràng buộc và lập trình. Bài cũng hướng dẫn cách chạy mô hình trên máy cá nhân bằng llama.cpp và bản GGUF đã lượng tử hóa từ Hugging Face để chat tương tác và làm việc theo kiểu agent.
- 8Hugging Face Blog·2/6/2026model_releaseHolo3.1 bổ sung tác nhân sử dụng máy tính chạy cục bộ, đa môi trường
Hugging Face Blog giới thiệu Holo3.1, bộ mô hình computer-use mới được thiết kế để hoạt động ổn định hơn trên web, desktop và mobile, đồng thời tương thích tốt hơn với nhiều framework tác tử. Bản phát hành cũng bổ sung các checkpoint lượng tử hóa như FP8, Q4 GGUF và NVFP4 để suy luận cục bộ nhanh hơn trên thiết bị người dùng.