Retrieval-Augmented Generation
AdoptKỹ thuật
Phương pháp kết hợp truy xuất và sinh nội dung để trả lời dựa trên ngữ cảnh bên ngoài.
Vì sao ở đây
Xếp vào Adopt: 15 bài bằng chứng từ 4 nguồn, chủ yếu là tin nghiên cứu, 6 bài trong 30 ngày qua. Độ tin cậy 81%.
Bằng chứng (15)
- 7The New Stack·30/7/2026product_launchOpenAI và Elastic tăng cường tích hợp AI doanh nghiệp
OpenAI và Elastic công bố mở rộng hợp tác, kết hợp các mô hình suy luận của OpenAI với khả năng tìm kiếm, truy xuất và kiểm soát truy cập của Elasticsearch. Tích hợp này nhắm vào ba mảng: bối cảnh cho AI doanh nghiệp, khả năng quan sát hệ thống và bảo mật, đồng thời Elastic cho biết các thử nghiệm nội bộ cho thấy cải thiện về truy xuất, giảm token và tăng độ chính xác.
- 6The New Stack·23/7/2026researchDùng prompt caching và pipeline theo lô để giảm chi phí RAG
Bài viết cho rằng các kiến trúc retrieval-augmented generation (RAG) đơn giản thường thất bại khi triển khai thực tế vì xử lý đồng bộ, giới hạn thời gian chờ và giới hạn tốc độ không đáp ứng được tải doanh nghiệp. Tác giả đề xuất tải lên bất đồng bộ, chia lô nhỏ và kiểm soát worker tạo embedding, đồng thời xem prompt caching là một cách giảm chi phí mà không làm giảm độ chính xác.
- 6The New Stack·18/7/2026researchTác nhân AI cần lớp ngữ cảnh tốt hơn, không chỉ mô hình thông minh hơn
Bài viết cho rằng nhiều vấn đề về độ tin cậy của tác nhân AI bắt nguồn từ hạ tầng xung quanh mô hình yếu, chứ không phải do bản thân mô hình. Tác giả lấy quy trình của Karpathy làm ví dụ: chuyển dữ liệu thô thành ngữ cảnh có cấu trúc, truy vấn được, rồi dùng truy xuất và công cụ để tác nhân hoạt động ổn định hơn.
- 5The New Stack·16/7/2026researchVì sao caching AI thông minh hơn đôi khi làm hệ thống chậm đi
Bài viết cho thấy caching khớp chính xác bằng Redis từng giúp cải thiện các tải AI ban đầu, nhưng kém hiệu quả khi lưu lượng và biến thể ngôn ngữ tăng lên. Bài cũng bàn về caching ngữ nghĩa bằng cơ sở dữ liệu vector như một hướng thay thế tiềm năng, nhưng lưu ý rằng trong thực tế triển khai, nó có thể làm tăng độ trễ, gây khớp sai và phức tạp vận hành.
- 6The New Stack·15/7/2026product_launchĐiều gì hỏng khi bộ nhớ của AI ghi chú mở rộng
Bài viết phân tích cách AI notetaker của Plaud gặp vấn đề khi mở rộng không phải ở chất lượng chuyển lời nói thành văn bản, mà ở khâu trả dữ liệu đã lưu cho người dùng một cách nhanh chóng. Kiến trúc ban đầu tách MySQL cho metadata và S3 cho file âm thanh, transcript hoạt động tốt lúc đầu, nhưng dần tạo ra độ trễ và vấn đề đồng bộ khi sản phẩm phải vận hành như một hệ thống bộ nhớ thời gian thực.
- 6The New Stack·14/7/2026product_launchValantor ra mắt nền tảng trí tuệ hình ảnh doanh nghiệp sau khi mua lại EyeLevel
Valantor đã mua lại EyeLevel để ra mắt nền tảng Enterprise Visual Intelligence, kết hợp năng lực phân tích tài liệu với vận hành dữ liệu doanh nghiệp phi cấu trúc. Nền tảng này hướng tới các tệp phức tạp như PDF, PPTX và DOCX, đồng thời hỗ trợ triển khai trên private cloud, on-premises, sovereign và môi trường air-gapped.
- 6The New Stack·10/7/2026researchChất lượng truy xuất trở thành thách thức then chốt trong kiến trúc tác nhân AI
Bài viết cho rằng nhiều lỗi của tác nhân AI thực chất xuất phát từ khâu truy xuất và xây dựng ngữ cảnh, không phải từ mô hình sinh. Tác giả nhấn mạnh nhu cầu cải thiện xếp hạng, ghi vết và đánh giá trong các quy trình truy xuất, đặc biệt khi tác nhân tìm kiếm trên lịch sử hội thoại, tài liệu, mã nguồn và các nguồn dữ liệu phức tạp khác.
- 6The New Stack·9/7/2026researchLỗi nhập liệu tự động làm nhiễm độc vector database
Một nhóm làm việc cho khách hàng fintech cho biết pipeline nhập PDF tự động đã ghi sai metadata vào vector database, khiến chatbot trích dẫn dữ liệu tài chính cũ và sai. Bài phân tích nguyên nhân cho rằng lỗi xuất phát từ việc coi quá trình trích xuất mang tính xác suất của LLM là tất định, trong khi bước kiểm tra bằng LLM thứ hai cũng thất bại do thiên kiến xác nhận lẫn nhau.
- 8The New Stack·8/7/2026model_releaseRefiant ra mắt mô hình Protea với cửa sổ ngữ cảnh 10 triệu token và tối ưu bầy đàn
Refiant đã ra mắt Protea, một mô hình có cửa sổ ngữ cảnh 10 triệu token, sử dụng tối ưu hóa kiểu bầy đàn và quản lý ngữ cảnh để xử lý các tập dữ liệu rất lớn trong một lượt. Công ty cho rằng cách tiếp cận này có thể nâng cao hiệu quả suy luận, giảm ảo giác và thay thế RAG cho mã nguồn doanh nghiệp hoặc kho dữ liệu dài như email hay hồ sơ thử nghiệm lâm sàng.
- 6InfoQ·7/7/2026product_launchHubSpot mở rộng tìm kiếm ngữ nghĩa lên 20 tỷ vector
HubSpot cho biết hệ thống tìm kiếm ngữ nghĩa của họ đã phát triển từ giai đoạn thử nghiệm thành một nền tảng nội bộ được hơn 38 nhóm sử dụng và hiện lưu trữ hơn 20 tỷ vector. Dịch vụ này hỗ trợ tác tử, truy xuất tăng cường sinh (RAG) và khử trùng lặp liên hệ, trong bối cảnh chất lượng truy xuất và độ trễ ngày càng quan trọng khi mức sử dụng tác tử tăng lên.
- 6The New Stack·2/7/2026framework_updateVì sao các cổng CI/CD thất bại với quy trình LLM
Bài viết cho rằng các cổng CI/CD truyền thống không đủ cho hệ thống LLM chạy الإنتاج vì hành vi của mô hình mang tính xác suất và có thể lệch dần mà không tạo ra lỗi rõ ràng. Tác giả đề xuất các cổng phát hành dựa trên bộ đánh giá nền, phát hiện drift, kiểm tra shadow và giới hạn chi phí/độ trễ để chặn các suy giảm âm thầm trước khi đến tay người dùng.
- 4InfoQ·1/7/2026researchBài trình bày về GraphRAG và truy xuất thông minh hơn bằng đồ thị tri thức
Cassie Shum trình bày quá trình tiến hóa kiến trúc của GraphRAG và cho rằng nền tảng dữ liệu vững chắc là yếu tố then chốt cho các quy trình AI nâng cao. Bài nói so sánh GraphRAG với RAG dựa trên vector truyền thống, nhấn mạnh ưu thế về ngữ cảnh toàn cục, suy luận nhiều bước và truy vết nguồn gốc nhờ đồ thị tri thức được cấu trúc ngữ nghĩa.
- 5Martin Fowler·16/6/2026researchCách Bayer xây dựng hệ thống AI tác tử đáng tin cậy cho nghiên cứu tiền lâm sàng
Bài viết mô tả PRINCE, một nền tảng chạy trên đám mây do Bayer và Thoughtworks xây dựng nhằm cải thiện khả năng truy cập dữ liệu an toàn tiền lâm sàng. Hệ thống đã phát triển từ tìm kiếm theo từ khóa thành một trợ lý dùng RAG tác tử và Text-to-SQL, có thể trả lời câu hỏi phức tạp và soạn tài liệu pháp lý, đồng thời được thiết kế chú trọng minh bạch, khả năng phục hồi, quan sát hệ thống và giám sát của con người.
- 6Hugging Face Blog·1/6/2026model_releaseJetBrains ra mắt Mellum2, mô hình MoE 12 tỷ tham số
JetBrains đã phát hành Mellum2, một mô hình mixture-of-experts mã nguồn mở với 12 tỷ tham số, được huấn luyện từ đầu trên ngôn ngữ tự nhiên và mã nguồn. Mô hình chỉ kích hoạt 2,5 tỷ tham số cho mỗi token, hướng tới suy luận độ trễ thấp và thông lượng cao, đồng thời được phát hành theo giấy phép Apache 2.0. JetBrains cho biết mô hình phù hợp cho các tác vụ định tuyến, RAG, tóm tắt, tác tử con, quy trình lập trình và triển khai riêng tư.
- 7Hugging Face Blog·9/4/2026framework_updateSentence Transformers bổ sung embedding và reranking đa phương thức
Sentence Transformers v5.4 bổ sung khả năng mã hóa và so sánh văn bản, hình ảnh, âm thanh và video qua cùng một API. Bản cập nhật này mở ra các quy trình embedding và reranking đa phương thức cho các trường hợp như tìm kiếm xuyên phương thức, truy xuất tài liệu trực quan và RAG đa phương thức.