transcribe.cpp
TrialCông cụ
Thư viện chuyển giọng nói thành văn bản dựa trên ggml để chạy các mô hình ASR trên nhiều nền tảng.
Vì sao ở đây
Xếp vào Trial: 18 bài bằng chứng từ 3 nguồn, chủ yếu là tin nghiên cứu, 3 bài trong 30 ngày qua. Độ tin cậy 78%.
Bằng chứng (18)
- 8The New Stack·5/8/2026researchGoogle tái cơ cấu lãnh đạo DeepMind khi bốn kỹ sư kỳ cựu lập Discovery Loop
Google đang tái cấu trúc lãnh đạo DeepMind, trong đó Demis Hassabis chuyển sang vai trò chủ tịch kiêm giám đốc khoa học, còn Koray Kavukcuoglu phụ trách rộng hơn việc phát triển mô hình Gemini và các sản phẩm liên quan. Cùng lúc, Jeff Dean, Sanjay Ghemawat, Oriol Vinyals và Quoc Le rời Google để lập Discovery Loop, một công ty vì lợi ích cộng đồng tập trung vào việc dùng AI để tự động hóa nghiên cứu khoa học và kỹ thuật; Google vẫn là nhà đầu tư sáng lập và nhà cung cấp cloud.
- 7Hacker News·19/7/2026open_sourcetranscribe.cpp ra mắt như thư viện chuyển giọng nói thành văn bản dựa trên ggml
transcribe.cpp là một thư viện chuyển đổi giọng nói thành văn bản phiên bản v0.1.0 xây dựng trên ggml, hướng tới hỗ trợ nhiều mô hình ASR hiện đại với tăng tốc GPU. Tác giả cho biết mỗi mô hình đều được kiểm chứng số học và kiểm tra WER so với bản tham chiếu, đồng thời dự án có các binding cho Python, JavaScript/TypeScript, Rust và Swift/ObjC.
- 5Hacker News·14/7/2026researchLeMario huấn luyện mô hình thế giới JEPA trên Super Mario Bros
Một nhà phát triển đã tái tạo kiến trúc LeWorldModel và huấn luyện một mô hình Joint-Embedding Predictive Architecture (JEPA) trên Super Mario Bros. Bài viết cho biết mô hình dự đoán được các diễn tiến ngắn hạn và hỗ trợ lập kế hoạch không cần phần thưởng ở mức độ hạn chế, nhưng không thể tiến triển ổn định qua các chướng ngại dài trong trò chơi.
- 8Hugging Face Blog·8/7/2026framework_updateBackend Transformers trong vLLM đạt tốc độ ngang native
Hugging Face cho biết backend mô hình Transformers trong vLLM nay đã đạt hoặc vượt thông lượng của các bản triển khai native do vLLM tự viết cho một số mô hình Qwen3. Bản cập nhật cho phép tác giả mô hình chạy mô hình Transformers trong vLLM chỉ với một cờ cấu hình, đồng thời vẫn giữ nguyên các chế độ song song và quy trình phục vụ quen thuộc.
- 7Hacker News·2/7/2026researchMột lớp Transformer duy nhất bắt kịp huấn luyện RL đầy đủ
Một bài nghiên cứu trên arXiv cho thấy một lớp Transformer duy nhất có thể đạt hiệu năng tương đương với cấu hình huấn luyện reinforcement learning toàn tham số trong bài toán được khảo sát. Kết quả này gợi ý rằng phần lớn lợi ích có thể đến từ một phần nhỏ của mô hình hơn dự đoán, dù đây vẫn là phát hiện nghiên cứu ban đầu.
- 6Hugging Face Blog·29/6/2026researchDiScoFormer hợp nhất ước lượng mật độ và score trong một transformer
Hugging Face giới thiệu DiScoFormer, một mô hình dựa trên transformer có thể ước lượng đồng thời mật độ và score của một phân phối từ một mẫu dữ liệu chỉ với một lượt suy luận. Cách tiếp cận này dùng một backbone chung với hai đầu ra riêng và một hàm mất mát nhất quán; nhóm tác giả cũng cho thấy attention có thể tái hiện kernel density estimation như một trường hợp đặc biệt và mở rộng lên các không gian nhiều chiều.
- 7Hugging Face Blog·24/6/2026framework_updateNVIDIA NeMo AutoModel tăng tốc tinh chỉnh MoE trên Transformers v5
Hugging Face giới thiệu cách NVIDIA NeMo AutoModel tận dụng Transformers v5 để cải thiện hiệu năng tinh chỉnh các mô hình Mixture-of-Experts. Với cùng API from_pretrained(), giải pháp này bổ sung Expert Parallelism, cơ chế all-to-all DeepEP và các kernel TransformerEngine, giúp tăng thông lượng và giảm mức dùng bộ nhớ GPU.
- 5Hugging Face Blog·23/6/2026framework_updateTransformers.js thử nghiệm Cross-Origin Storage API đề xuất để chia sẻ bộ nhớ đệm
Hugging Face giới thiệu các thử nghiệm trong Transformers.js với Cross-Origin Storage API đang được đề xuất nhằm giảm việc tải xuống và lưu trữ trùng lặp giữa các origin khác nhau. Bài viết cho thấy các tệp mô hình và tài nguyên WebAssembly dùng chung có thể được lưu một lần và tái sử dụng, thay vì bị tải lại cho từng trang web dùng cùng tài nguyên.
- 5Hugging Face Blog·18/6/2026researchHugging Face đặt câu hỏi liệu có thể vượt qua LoRA hay không
Hugging Face đăng bài phân tích các phương pháp fine-tuning hiệu quả về tham số và đặt câu hỏi liệu LoRA có thực sự là lựa chọn tốt nhất hay không. Bài viết nêu vai trò của PEFT, cho thấy LoRA đang áp đảo về mức độ sử dụng, và cho rằng sự phổ biến này có thể được củng cố bởi độ hiển thị và hệ sinh thái hỗ trợ chứ không chỉ bởi hiệu năng.
- 7Hugging Face Blog·19/5/2026model_releaseOlmoEarth v1.1 giảm chi phí tính toán của mô hình vệ tinh tới 3 lần
Allen Institute for AI đã phát hành OlmoEarth v1.1, một họ mô hình quan sát Trái Đất mới nhằm tăng hiệu quả mà vẫn giữ hiệu năng trên các bộ đánh giá và bài toán cùng đối tác. Bản cập nhật tập trung vào việc rút ngắn chuỗi token khi xử lý ảnh vệ tinh, giúp giảm chi phí tính toán, tăng tốc suy luận và triển khai với chi phí thấp hơn ở quy mô lớn.
- 8Hugging Face Blog·14/5/2026model_releaseIBM Granite Ra mắt Mô hình Nhúng Đa ngôn ngữ R2
IBM đã phát hành hai mô hình nhúng đa ngôn ngữ giấy phép Apache 2.0 dựa trên ModernBERT: một mô hình gọn 97 triệu tham số và một mô hình đầy đủ 311 triệu tham số. Các mô hình hỗ trợ hơn 200 ngôn ngữ, ngữ cảnh 32K token và truy xuất mã nguồn trên chín ngôn ngữ lập trình, đồng thời mô hình lớn có hỗ trợ Matryoshka và đạt kết quả benchmark truy xuất tốt.
- 6Hugging Face Blog·23/4/2026open_sourceCách dùng Transformers.js trong tiện ích Chrome
Hugging Face đăng hướng dẫn xây dựng tiện ích Chrome chạy các tính năng AI cục bộ bằng Transformers.js trong khuôn khổ Manifest V3. Bài viết mô tả kiến trúc với service worker ở nền để chạy mô hình, side panel cho giao diện chat và content script cho trích xuất, tô sáng nội dung trang. Nội dung cũng nêu các lưu ý thực tế về giới hạn runtime, tải mô hình và cơ chế nhắn tin giữa các thành phần của tiện ích.
- 8Hugging Face Blog·9/3/2026framework_updateLeRobot v0.5.0 mở rộng hỗ trợ robot trên phần cứng, chính sách và dữ liệu
LeRobot v0.5.0 là bản phát hành lớn với hỗ trợ humanoid Unitree G1, phần cứng OpenArm, bộ điều khiển động cơ CAN bus mới và thêm nhiều tích hợp robot khác. Bản này cũng bổ sung các chính sách mới như Pi0-FAST và Real-Time Chunking, mã hóa video streaming nhanh hơn cho bộ dữ liệu, EnvHub để tải môi trường mô phỏng từ Hugging Face Hub, cùng nền tảng mã nguồn được hiện đại hóa với Python 3.12 và Transformers v5.
- 7Hugging Face Blog·9/3/2026framework_updateUlysses Sequence Parallelism cho huấn luyện ngữ cảnh triệu token
Hugging Face giới thiệu cách Ulysses Sequence Parallelism phân phối cơ chế attention trên nhiều GPU để việc huấn luyện với ngữ cảnh rất dài trở nên khả thi hơn so với giới hạn của một GPU đơn lẻ. Bài viết cũng trình bày cách tích hợp vào Accelerate, Transformers Trainer và TRL’s SFTTrainer, đồng thời so sánh với Ring Attention và đưa ra khuyến nghị sử dụng.
- 7Hugging Face Blog·26/2/2026researchMô hình Mixture of Experts trong Transformers
Hugging Face giải thích cách kiến trúc Mixture of Experts (MoE) thay thế các lớp feed-forward dày đặc bằng cơ chế định tuyến thưa tới các chuyên gia để tăng hiệu quả tính toán. Bài viết nhấn mạnh việc MoE có thể đạt chất lượng tương đương mô hình dày đặc nhưng với ít tham số hoạt động hơn khi suy luận, đồng thời cho thấy mức độ phổ biến ngày càng tăng trong các mô hình mã nguồn mở gần đây và hệ sinh thái Transformers.
- 7Hugging Face Blog·13/2/2026open_sourceClaude và Codex có thêm kỹ năng viết CUDA kernel
Hugging Face giới thiệu một agent skill giúp các tác nhân lập trình viết CUDA kernel cho môi trường sản xuất và tích hợp với các dự án dựa trên PyTorch. Bài viết cho biết Claude và Codex đã được dùng để tạo kernel hoạt động cho một pipeline diffusers và một mô hình transformers, bao gồm cả binding và benchmark hoàn chỉnh.
- 7Hugging Face Blog·9/2/2026framework_updateTransformers.js v4 chính thức có trên npm
Transformers.js v4 đã được phát hành trên npm sau một năm phát triển. Bản mới giới thiệu WebGPU runtime viết lại bằng C++, mở rộng hỗ trợ mô hình và cải thiện hiệu năng trên trình duyệt, Node, Bun và Deno.
- 8Hugging Face Blog·5/1/2026model_releaseHugging Face ra mắt Falcon-H1-Arabic
Hugging Face công bố Falcon-H1-Arabic, một họ mô hình ngôn ngữ tiếng Ả Rập mới được xây dựng trên kiến trúc lai Mamba-Transformer. Bộ mô hình gồm các phiên bản 3B, 7B và 34B với ngữ cảnh mở rộng մինչև 256K token, hướng tới cải thiện khả năng hiểu ngữ cảnh dài, xử lý phương ngữ và suy luận trong NLP tiếng Ả Rập.