ModernBERT
AssessNgôn ngữ & Framework
Kiến trúc encoder kiểu BERT được dùng làm nền tảng cho các reranker Ettin.
Vì sao ở đây
Xếp vào Assess: 4 bài bằng chứng từ 1 nguồn, chủ yếu là phát hành mô hình, 1 bài trong 30 ngày qua. Độ tin cậy 45%.
Bằng chứng (4)
- 7Hugging Face Blog·28/7/2026model_releaseLiquidAI phát hành bộ mã hóa LFM2.5 cho suy luận ngữ cảnh dài nhanh trên CPU
Hugging Face giới thiệu hai mô hình encoder mới, LFM2.5-Encoder-230M và LFM2.5-Encoder-350M, hướng tới suy luận với ngữ cảnh dài, độ chính xác cao và độ trễ thấp trên CPU. Các mô hình hỗ trợ tối đa 8.192 token, được huấn luyện bằng masked language modeling và phù hợp cho các tác vụ như phân loại, điều phối ý định, lọc an toàn và phát hiện PII.
- 7Hugging Face Blog·19/5/2026model_releaseHugging Face phát hành bộ reranker Ettin
Hugging Face giới thiệu sáu mô hình reranker Sentence Transformers CrossEncoder mới dựa trên bộ mã hóa Ettin ModernBERT, với quy mô từ 17M đến 1B tham số. Bản phát hành đi kèm mô hình, dữ liệu huấn luyện và quy trình huấn luyện đầy đủ, hướng tới các पाइplline truy hồi rồi xếp hạng lại kết hợp với mô hình embedding.
- 8Hugging Face Blog·14/5/2026model_releaseIBM Granite Ra mắt Mô hình Nhúng Đa ngôn ngữ R2
IBM đã phát hành hai mô hình nhúng đa ngôn ngữ giấy phép Apache 2.0 dựa trên ModernBERT: một mô hình gọn 97 triệu tham số và một mô hình đầy đủ 311 triệu tham số. Các mô hình hỗ trợ hơn 200 ngôn ngữ, ngữ cảnh 32K token và truy xuất mã nguồn trên chín ngôn ngữ lập trình, đồng thời mô hình lớn có hỗ trợ Matryoshka và đạt kết quả benchmark truy xuất tốt.
- 7Hugging Face Blog·31/3/2026researchHuấn luyện mô hình ngôn ngữ mRNA trên 25 loài với chi phí 165 USD
OpenMed công bố một quy trình kỹ thuật protein toàn diện gồm dự đoán cấu trúc, thiết kế trình tự và tối ưu hóa codon. Ở phần tối ưu hóa mRNA, nhóm cho biết CodonRoBERTa-large-v2 đạt kết quả tốt nhất, sau đó mở rộng lên 25 loài với 4 mô hình sản xuất được huấn luyện trong 55 giờ GPU.