Vision-Language Model
AssessKỹ thuật
Mô hình kết hợp nhận thức thị giác với hiểu ngôn ngữ.
Vì sao ở đây
Xếp vào Assess: 3 bài bằng chứng từ 2 nguồn, chủ yếu là tin nghiên cứu, 1 bài trong 30 ngày qua. Độ tin cậy 49%.
Bằng chứng (3)
- 8Hacker News·20/7/2026researchXiaomi Robotics 1 mở rộng mô hình chính sách robot bằng dữ liệu
Xiaomi-Robotics-1 là mô hình chính sách robot được huấn luyện bằng giai đoạn tiền huấn luyện quy mô lớn trên 100.000 giờ quỹ đạo UMI không phụ thuộc hiện thân, sau đó hậu huấn luyện bằng dữ liệu robot thực. Nhóm tác giả cho biết cả hiệu quả tiền huấn luyện lẫn tỷ lệ thành công trên robot thực đều tăng ổn định theo quy mô dữ liệu và kích thước mô hình, cho thấy hành vi mở rộng có thể dự đoán được trong robot học.
- 4Hugging Face Blog·6/7/2026researchPRX Phần 4: Chiến lược dữ liệu
Nhóm PRX của Photoroom mô tả cách họ xây dựng bộ dữ liệu tiền huấn luyện cho PRX từ các nguồn công khai và nội bộ, sau đó tạo lại chú thích ảnh bằng mô hình thị giác-ngôn ngữ. Bài viết nhấn mạnh độ phủ rộng, chú thích dài và chính xác, lọc tối thiểu, và đóng gói dữ liệu thành định dạng có thể stream cho huấn luyện phân tán.
- 5Hugging Face Blog·5/3/2026researchHướng dẫn của NXP về triển khai AI robot trên nền tảng nhúng
NXP công bố hướng dẫn đưa các mô hình Vision-Language-Action cho robot lên nền tảng nhúng, tập trung vào ghi dữ liệu, fine-tuning và các ràng buộc triển khai thời gian thực. Bài viết nêu các thực hành tốt như dùng camera cố định, kiểm soát ánh sáng, camera gắn trên kẹp và suy luận bất đồng bộ, đồng thời đề cập kết quả hiệu năng trên SoC i.MX 95.