Trendora

Reinforcement learning

Adopt

Kỹ thuật

Phương pháp học máy tối ưu mô hình thông qua tín hiệu thưởng từ tương tác hoặc đánh giá.

Vì sao ở đây

Xếp vào Adopt: 15 bài bằng chứng từ 7 nguồn, chủ yếu là tin nghiên cứu, 5 bài trong 30 ngày qua. Độ tin cậy 100%.

Bằng chứng (15)

  • 7Hugging Face Blog·12/8/2026model_release
    LiquidAI ra mắt LFM2.5-VL-3B cho thị giác biên nhanh hơn

    LiquidAI giới thiệu LFM2.5-VL-3B, mô hình thị giác-ngôn ngữ được thiết kế để chạy trên phần cứng cục bộ với phản hồi nhanh, phù hợp cho ứng dụng thời gian thực và trên thiết bị. Mô hình cải thiện khả năng hiểu màn hình và tài liệu, định vị đối tượng, suy luận trên nhiều ảnh và gọi hàm, đồng thời được công bố kèm kết quả benchmark cho thấy hiệu năng mạnh trong cùng phân khúc kích thước.

  • 6Hugging Face Blog·21/7/2026research
    Tổng quan về mô phỏng cho AI vật lý

    Bài viết giải thích vì sao mô phỏng đang trở thành thành phần thiết yếu trong AI vật lý và robot, đặc biệt để tạo dữ liệu huấn luyện, kiểm thử chính sách và mở rộng thu thập trải nghiệm vượt quá giới hạn của thế giới thực. Bài cũng mô tả mô hình ba máy tính gồm cụm huấn luyện, hệ thống mô phỏng và thiết bị biên khi triển khai, đồng thời nêu cách nhà phát triển chọn công cụ mô phỏng theo độ chân thực, cảm biến và yêu cầu tác vụ.

  • 7NVIDIA GenAI·17/7/2026research
    NVIDIA Vera Rubin hướng tới hiệu quả trí tuệ trên mỗi đô la tốt hơn cho huấn luyện AI tác tử

    NVIDIA cho rằng hậu huấn luyện đã trở thành khối công việc trung tâm trong kỷ nguyên AI tác tử, khi mô hình liên tục thích nghi thông qua học tăng cường, dùng công cụ và khôi phục sau lỗi. Hãng nhấn mạnh các thư viện NeMo và mô hình mở Nemotron 3 Ultra như ví dụ về hạ tầng và thiết kế mô hình nhằm nâng cao hiệu quả trí tuệ trên mỗi đô la, đồng thời giảm chi phí trên mỗi token trong suy luận.

  • 5NVIDIA GenAI·14/7/2026model_release
    NVIDIA cho rằng các mô hình mở Nemotron giúp doanh nghiệp xây dựng AI tùy chỉnh

    Bài viết Nemotron Labs của NVIDIA cho rằng các mô hình mở có thể giúp doanh nghiệp và chính phủ kiểm soát, tin cậy và tùy biến AI tốt hơn mô hình đóng. Bài viết nêu các ví dụ doanh nghiệp tinh chỉnh Nemotron cho hội thoại lâm sàng, tìm kiếm nội bộ, tác vụ sử dụng máy tính, quy trình pháp lý và AI ngôn ngữ địa phương.

  • 4Hacker News·14/7/2026open_source
    Show HN: Tác nhân được huấn luyện bằng RL để huấn luyện mô hình bằng RL

    Dự án giới thiệu một tác nhân được huấn luyện bằng reinforcement learning để thực hiện các tác vụ huấn luyện mô hình bằng RL, với chi phí khoảng 1.300 USD. Bài đăng được chia sẻ theo dạng Show HN kèm mã nguồn trên GitHub, nhấn mạnh hướng thử nghiệm chi phí thấp nhằm tự động hóa một phần quy trình RL. Đây là một demo kỹ thuật mã nguồn mở hơn là một sản phẩm thương mại hay bài báo nghiên cứu chính thức.

  • 7Anthropic News·14/7/2026funding
    Anthropic cam kết 10 triệu CAD cho nghiên cứu AI tại Canada

    Anthropic cam kết 10 triệu CAD để hỗ trợ các cơ sở nghiên cứu tại Canada phát triển các ứng dụng AI có lợi và có trách nhiệm. Khoản tài trợ này bao gồm hợp tác với Amii, Mila, Vector Institute, CHEO, CAMH, Université Laval, Đại học Toronto và Đại học Saskatchewan, cùng các khoản Claude credits và hỗ trợ nghiên cứu trong các lĩnh vực như an toàn, y tế, bền vững, robot và ngôn ngữ.

  • 7Hacker News·8/7/2026model_release
    Cognition ra mắt mô hình lập trình SWE-1.7

    Cognition công bố SWE-1.7, mô hình lập trình mới nhất của hãng, với tuyên bố đạt hiệu năng tiệm cận nhóm đầu nhưng có chi phí thấp hơn, đồng thời cải thiện các bài toán kỹ thuật phần mềm tác tử. Công ty cho biết mô hình được huấn luyện với các cải tiến trong pipeline RL, dữ liệu chất lượng cao hơn, huấn luyện đa cụm và cơ chế tự nén ngữ cảnh cho các tác vụ dài hạn, hiện đã có trong Devin qua Cerebras.

  • 8Hacker News·8/7/2026model_release
    Mistral ra mắt Robostral Navigate cho điều hướng robot

    Mistral đã giới thiệu Robostral Navigate, mô hình điều hướng hiện thân 8B sử dụng một camera RGB duy nhất và hướng dẫn bằng ngôn ngữ tự nhiên để điều khiển robot đi qua các môi trường phức tạp. Theo công ty, mô hình đạt tỷ lệ thành công 76,6% trên tập kiểm thử R2R-CE chưa thấy trước đó, vượt các baseline đa cảm biến và đơn camera mạnh hơn, đồng thời được huấn luyện hoàn toàn trong mô phỏng.

  • 6InfoQ·3/7/2026research
    Tinh chỉnh doanh nghiệp bằng học tăng cường

    Bài trình bày giới thiệu Agent RFT, nền tảng của OpenAI để tinh chỉnh các mô hình suy luận bằng tương tác công cụ theo thời gian thực và tín hiệu thưởng tùy chỉnh. Các diễn giả cho rằng học tăng cường có thể giải quyết bài toán phân bổ công lao trong toàn bộ ngữ cảnh và nâng cao hiệu quả bằng cách loại bỏ các vòng lặp token dài trong quy trình doanh nghiệp.

  • 7Hacker News·2/7/2026research
    Một lớp Transformer duy nhất bắt kịp huấn luyện RL đầy đủ

    Một bài nghiên cứu trên arXiv cho thấy một lớp Transformer duy nhất có thể đạt hiệu năng tương đương với cấu hình huấn luyện reinforcement learning toàn tham số trong bài toán được khảo sát. Kết quả này gợi ý rằng phần lớn lợi ích có thể đến từ một phần nhỏ của mô hình hơn dự đoán, dù đây vẫn là phát hiện nghiên cứu ban đầu.

  • 6The New Stack·29/6/2026model_release
    Base44 ra mắt Base One, mô hình được tinh chỉnh cho vibe coding

    Base44 đã phát hành Base One, mô hình AI độc quyền đầu tiên của mình, được tinh chỉnh từ một LLM mã nguồn mở để xây dựng ứng dụng web từ mô tả ngôn ngữ tự nhiên. Công ty cho biết mô hình được huấn luyện bằng reinforcement learning trên các tác vụ thực tế của nền tảng để cải thiện chất lượng và giảm chi phí suy luận, và hiện đã được triển khai cho người dùng.

  • 7Hugging Face Blog·8/6/2026open_source
    OpenEnv mở rộng quản trị mở cho RL tác nhân

    Hugging Face cho biết OpenEnv, một thư viện cho các môi trường thực thi phục vụ tác nhân, sẽ được điều phối bởi một ủy ban rộng hơn gồm Meta-PyTorch, Unsloth, Nvidia, Microsoft và nhiều bên khác. Dự án này được định vị như một lớp giao thức cho các môi trường reinforcement learning có khả năng tương tác, với API chuẩn hóa, đóng gói thống nhất và hỗ trợ HTTP, WebSocket, Docker và MCP.

  • 6Hugging Face Blog·10/3/2026research
    Bài học từ 16 thư viện RL mã nguồn mở

    Hugging Face đã phân tích 16 thư viện reinforcement learning mã nguồn mở để so sánh cách chúng xử lý huấn luyện bất đồng bộ, bộ đệm rollout, đồng bộ trọng số và độ trễ dữ liệu. Bài viết cho thấy xu hướng chung của ngành là tách inference và training để giảm thời gian GPU nhàn rỗi trong các bài toán RL quy mô lớn.

  • 6Google DeepMind·9/3/2026research
    Mười năm tác động lâu dài của AlphaGo

    Google DeepMind đánh dấu 10 năm ảnh hưởng của AlphaGo, hệ thống đã cho thấy tiềm năng của học tăng cường và mạng nơ-ron sâu trong việc chinh phục cờ vây. Dấu mốc này nhấn mạnh cách AlphaGo đã tác động đến nghiên cứu và ứng dụng trong AI, sinh học và nhiều lĩnh vực khác.

  • 9Anthropic News·23/2/2026security
    Anthropic cho biết đã phát hiện các cuộc tấn công chưng cất Claude quy mô lớn

    Anthropic cho biết ba phòng thí nghiệm AI — DeepSeek, Moonshot và MiniMax — đã dùng tài khoản gian lận và truy cập qua proxy để tiến hành các chiến dịch chưng cất Claude ở quy mô công nghiệp. Công ty nói hoạt động này nhằm trích xuất các năng lực như suy luận, sử dụng công cụ và lập trình, làm dấy lên lo ngại về cơ chế an toàn, kiểm soát xuất khẩu và nguy cơ lạm dụng tiếp theo.