Gemma 4 12B
TrialNgôn ngữ & Framework
Mô hình đa phương thức thống nhất 12 tỷ tham số của Google DeepMind.
Vì sao ở đây
Xếp vào Trial: 7 bài bằng chứng từ 4 nguồn, chủ yếu là ra mắt sản phẩm, 2 bài trong 30 ngày qua. Độ tin cậy 71%.
Bằng chứng (7)
- 5Hacker News·20/7/2026product_launchNativ cho phép chạy mô hình mở cục bộ trên Mac
Nativ là một thư viện được tuyển chọn để chọn và chạy các mô hình AI mã nguồn mở trực tiếp trên máy Mac. Ứng dụng gợi ý mô hình phù hợp theo cấu hình máy và giới thiệu các lựa chọn từ Google, Cohere và Liquid AI với nhiều mức dung lượng và cửa sổ ngữ cảnh khác nhau.
- 5Hacker News·15/7/2026open_sourceGemma 4 chạy trên Xeon 13 năm tuổi với tối ưu hóa chỉ dùng CPU
Một bài đăng trên Hacker News mô tả việc chạy mô hình mixture-of-experts Gemma 4 26B của Google trên một máy chủ HP tái sử dụng đã 13 năm tuổi, dùng hai Xeon Ivy Bridge và không có GPU. Sau khi điều chỉnh mã suy luận để tương thích với CPU trước AVX2, mô hình đạt khoảng 5,2 token mỗi giây trên chiếc máy này.
- 7Hugging Face Blog·1/7/2026product_launchHugging Face và Cerebras đưa Gemma 4 vào AI giọng nói thời gian thực
Hugging Face và Cerebras giới thiệu bản demo chuyển giọng nói sang giọng nói theo thời gian thực dựa trên Gemma 4 31B, nhằm giảm độ trễ trong AI giọng nói. Chuỗi xử lý mở và mô-đun này kết hợp Parakeet cho nhận dạng giọng nói, Cerebras để suy luận mô hình nhanh, và Qwen3TTS cho chuyển văn bản thành giọng nói; hệ thống cũng đang được dùng trong robot Reachy Mini.
- 6Hugging Face Blog·9/6/2026model_releaseGoogle DeepMind giới thiệu Gemma 4 12B, mô hình đa phương thức thống nhất
Google DeepMind đã giới thiệu Gemma 4 12B, một mô hình đa phương thức thống nhất được thiết kế không cần bộ mã hóa riêng. Mô hình này được định vị như một cách tiếp cận tích hợp hơn để xử lý nhiều loại đầu vào trong cùng một kiến trúc.
- 6Hugging Face Blog·27/5/2026product_launchReachy Mini giờ có thể chạy hoàn toàn cục bộ
Hugging Face cho biết bộ xử lý hội thoại của Reachy Mini giờ có thể chạy hoàn toàn trên phần cứng cục bộ thay vì gửi âm thanh lên máy chủ. Giải pháp này dùng chuỗi speech-to-speech gồm llama.cpp, Silero VAD, Parakeet-TDT 0.6B v3 cho STT và Qwen3-TTS, cho phép trò chuyện riêng tư, ngoại tuyến với robot.
- 6Hugging Face Blog·23/4/2026open_sourceCách dùng Transformers.js trong tiện ích Chrome
Hugging Face đăng hướng dẫn xây dựng tiện ích Chrome chạy các tính năng AI cục bộ bằng Transformers.js trong khuôn khổ Manifest V3. Bài viết mô tả kiến trúc với service worker ở nền để chạy mô hình, side panel cho giao diện chat và content script cho trích xuất, tô sáng nội dung trang. Nội dung cũng nêu các lưu ý thực tế về giới hạn runtime, tải mô hình và cơ chế nhắn tin giữa các thành phần của tiện ích.
- 8Google DeepMind·22/4/2026researchGoogle DeepMind giới thiệu Decoupled DiLoCo cho huấn luyện AI phân tán bền bỉ
Google DeepMind công bố Decoupled DiLoCo, một kiến trúc huấn luyện phân tán tách các cụm tính toán thành nhiều “đảo” độc lập, hoạt động không đồng bộ và cần băng thông thấp hơn. Cách tiếp cận này nhằm duy trì quá trình huấn luyện khi xảy ra lỗi phần cứng hoặc gián đoạn trung tâm dữ liệu, đồng thời đạt hiệu năng tương đương phương pháp truyền thống trong các thử nghiệm với Gemma 4.