Trendora

llama.cpp

Trial

Công cụ

Bộ công cụ và runtime mã nguồn mở để chạy mô hình ngôn ngữ lớn trên máy cục bộ.

Vì sao ở đây

Xếp vào Trial: 9 bài bằng chứng từ 4 nguồn, chủ yếu là phát hành mô hình, 5 bài trong 30 ngày qua. Độ tin cậy 76%.

Bằng chứng (9)

  • 6Hacker News·12/8/2026open_source
    llama.cpp thúc đẩy AI chạy hoàn toàn cục bộ trên thiết bị cá nhân

    llama.cpp được giới thiệu như một cách mã nguồn mở, ưu tiên quyền riêng tư để chạy các mô hình AI tiên tiến hoàn toàn trên phần cứng cục bộ, không cần API key, telemetry hay phụ thuộc đám mây. Bài viết cũng nêu các tùy chọn cài đặt, tích hợp tác nhân lập trình cục bộ qua pi-llama và Pi, cùng khả năng hỗ trợ rộng trên CPU và GPU từ laptop đến cụm máy chủ.

  • 6Hacker News·11/8/2026open_source
    Máy ảo macOS trên Apple Silicon tăng tốc suy luận LLM

    Bài viết mô tả việc dùng GPU passthrough trên máy ảo macOS chạy trên Apple Silicon để cải thiện hiệu năng suy luận mô hình ngôn ngữ lớn cục bộ. Nội dung nhấn mạnh llama.cpp là công cụ suy luận và cho thấy việc truy cập GPU của máy chủ có thể giảm đáng kể độ trễ so với môi trường ảo hóa hoàn toàn.

  • 8Hugging Face Blog·10/8/2026model_release
    Meta ra mắt Muse Glimmer, mô hình đa phương thức mã nguồn mở chạy cục bộ

    Meta đã phát hành Muse Glimmer, mô hình đa phương thức 30 tỷ tham số được chưng cất cho các tác vụ tác tử chạy cục bộ và cấp phép Apache 2.0. Hugging Face cho biết đã hỗ trợ ngay từ ngày đầu trên transformers, llama.cpp, vLLM và Inference Endpoints, đồng thời công bố benchmark và chi tiết kiến trúc cho các ứng dụng ưu tiên quyền riêng tư như lập trình, phân tích tài liệu và trợ lý cá nhân.

  • 8Hugging Face Blog·4/8/2026model_release
    Hugging Face giới thiệu LFM2.5-2.6B cho tác tử chạy trực tiếp trên thiết bị

    Hugging Face công bố LFM2.5-2.6B, mô hình 2,6 tỷ tham số được thiết kế để vận hành tác tử trực tiếp trên thiết bị với khả năng gọi công cụ và thực hiện quy trình nhiều bước. Mô hình hướng tới máy tính xách tay và điện thoại, nhấn mạnh tính riêng tư, mức dùng bộ nhớ thấp và hiệu năng benchmark mạnh so với các mô hình lớn hơn nhiều.

  • 4Hacker News·13/7/2026research
    Đo hiệu năng GPU Tesla cũ trên các tác vụ AI và kết xuất hiện đại

    Một người đam mê phần cứng đã đo hiệu năng 15 GPU NVIDIA Tesla doanh nghiệp đã ngừng sử dụng, gồm các mẫu K80, P100 và V100, trên nhiều tác vụ hiện đại như ResNet50, vision transformers, Blender và llama.cpp. Bài viết cho rằng các GPU giá rẻ, đã hết vòng đời này vẫn có thể hữu ích trong môi trường homelab nếu người dùng chấp nhận mức tiêu thụ điện cao hơn và các bộ phần mềm cũ hơn.

  • 8Hacker News·3/7/2026model_release
    Leanstral 1.5 nâng cấp khả năng chứng minh trong Lean 4

    Leanstral 1.5 là mô hình mới miễn phí, cấp phép Apache-2.0 từ Mistral AI, tập trung vào xác minh hình thức và kỹ thuật chứng minh trong Lean 4. Mô hình cho biết đạt bước tiến lớn trên các benchmark như miniF2F, PutnamBench, FATE-H và FATE-X, đồng thời phát hiện lỗi trong các mã nguồn mở.

  • 6Hacker News·29/6/2026model_release
    Qwen 3.6 27B được xem là mô hình phù hợp để phát triển cục bộ

    Bài viết cho rằng Qwen 3.6 27B là mô hình chạy cục bộ thuyết phục nhất mà tác giả từng thử, cho thấy kết quả tốt hơn các lựa chọn local trước đây trong các bài kiểm tra viết có ràng buộc và lập trình. Bài cũng hướng dẫn cách chạy mô hình trên máy cá nhân bằng llama.cpp và bản GGUF đã lượng tử hóa từ Hugging Face để chat tương tác và làm việc theo kiểu agent.

  • 6Hugging Face Blog·27/5/2026product_launch
    Reachy Mini giờ có thể chạy hoàn toàn cục bộ

    Hugging Face cho biết bộ xử lý hội thoại của Reachy Mini giờ có thể chạy hoàn toàn trên phần cứng cục bộ thay vì gửi âm thanh lên máy chủ. Giải pháp này dùng chuỗi speech-to-speech gồm llama.cpp, Silero VAD, Parakeet-TDT 0.6B v3 cho STT và Qwen3-TTS, cho phép trò chuyện riêng tư, ngoại tuyến với robot.

  • 8Hugging Face Blog·20/2/2026open_source
    GGML và llama.cpp gia nhập Hugging Face

    Hugging Face thông báo GGML, nhóm đứng sau llama.cpp, sẽ gia nhập công ty để hỗ trợ sự phát triển dài hạn của AI cục bộ. Dự án sẽ tiếp tục là mã nguồn mở và do cộng đồng dẫn dắt, trong khi đội ngũ vẫn giữ quyền tự chủ kỹ thuật và Hugging Face cung cấp nguồn lực bền vững cùng các cải tiến về đóng gói.