Các mô hình ngôn ngữ lớn thường rất tự tin ngay cả khi chúng sai, bởi vì theo mặc định, chúng trả lời dựa trên các mẫu đã học được trong quá trình huấn luyện chứ không phải dữ kiện thực tế của bạn. Retrieval-augmented generation, hay RAG, thay đổi điều đó bằng cách truy xuất các đoạn văn liên quan từ một cơ sở tri thức mà bạn kiểm soát và cung cấp chúng cho mô hình làm ngữ cảnh trước khi nó viết một từ nào. Khi quá trình truy xuất hoạt động hiệu quả, kết quả sẽ là một câu trả lời được neo gốc trong các nguồn thực tế, có thể trích dẫn được thay vì là phỏng đoán tốt nhất của mô hình. RAG không nâng cấp trí thông minh của mô hình; nó cung cấp cho mô hình các dữ kiện liên quan, cập nhật để câu trả lời có tính xác thực chứ không phải tự đoán.
Bản chất thực sự của RAG
RAG là một mô hình gồm hai phần kết hợp một retriever với một generator. Khi nhận được câu hỏi, retriever sẽ tìm kiếm trong cơ sở tri thức các đoạn văn liên quan nhất, các đoạn văn đó được thêm vào prompt, và sau đó mô hình ngôn ngữ sẽ viết câu trả lời bằng cách sử dụng ngữ cảnh được cung cấp đó. Thuật ngữ và phương pháp tiếp cận chính thức này đến từ nghiên cứu năm 2020 của Patrick Lewis và các đồng nghiệp tại Facebook AI Research, kết hợp kiến thức tích hợp sẵn của mô hình đã được huấn luyện trước (pretrained model) với một tập hợp dữ liệu lớn (corpus) có thể tìm kiếm từ bên ngoài.
Cách thức neo gốc dữ liệu giúp giảm thiểu sai sót
Một mô hình không có truy xuất dữ liệu sẽ lấp đầy các khoảng trống bằng văn bản nghe có vẻ hợp lý, đó là nguồn gốc của các câu trả lời ngụy tạo. Bằng cách đặt văn bản nguồn thực tế trực tiếp trước mô hình tại thời điểm trả lời, RAG thu hẹp nhiệm vụ của mô hình từ việc truy xuất ký ức về các dữ kiện thành việc tóm tắt các tài liệu mà nó vừa được cung cấp. Các nghiên cứu và thực tiễn ngành liên tục ghi nhận ít thông tin ngụy tạo hơn khi các câu trả lời bị giới hạn trong phạm vi nội dung có thể kiểm chứng được truy xuất.
Cách thức truy xuất tìm ra đoạn văn chính xác
Hầu hết các hệ thống RAG hoạt động thực tế đều tìm kiếm theo ý nghĩa, không chỉ bằng từ khóa. Tài liệu được chia thành các phân đoạn (chunks) và chuyển đổi thành các vector số gọi là embeddings, được lưu trữ trong cơ sở dữ liệu vector, nhờ đó một truy vấn có thể khớp với các đoạn văn có cùng ý nghĩa ngay cả khi chúng sử dụng các từ khác nhau. Nhiều hệ thống cũng kết hợp tìm kiếm từ khóa truyền thống để nắm bắt các thuật ngữ chính xác như mã sản phẩm hoặc tên gọi.
RAG so với việc huấn luyện lại mô hình
RAG bổ sung tri thức mà không làm thay đổi trọng số (weights) của mô hình, vì vậy bạn có thể cập nhật những gì hệ thống biết bằng cách chỉnh sửa cơ sở tri thức, chứ không phải bằng cách chạy một quy trình huấn luyện tốn kém. Điều đó giúp nó rất phù hợp với thông tin thay đổi thường xuyên hoặc mang tính nội bộ của doanh nghiệp. Ngược lại, fine-tuning tích hợp các mẫu và phong cách vào chính mô hình và phù hợp hơn cho việc thay đổi hành vi hơn là cập nhật thông tin thực tế mới nhất.
Những trường hợp RAG vẫn thất bại
RAG làm giảm hiện tượng ảo giác (hallucination) nhưng không loại bỏ hoàn toàn, và độ chính xác của nó hoàn toàn phụ thuộc vào kết quả mà retriever trả về. Nếu tài liệu chính xác bị thiếu, lỗi thời hoặc sai lệch, mô hình vẫn có thể tự tin lặp lại thông tin không chuẩn xác đó, và nếu quá trình truy xuất không tìm ra nội dung liên quan, mô hình có thể quay lại việc phán đoán. RAG cũng chuyển dịch một số lỗi từ mô hình sang bước truy xuất (retrieval), nơi mà việc bỏ sót một tài liệu quan trọng trong âm thầm có thể khó phát hiện hơn là một dữ kiện ngụy tạo rõ ràng.
- RAG kết hợp một bộ truy xuất dữ liệu với một mô hình ngôn ngữ để các câu trả lời được viết từ các tài liệu bạn kiểm soát, chứ không chỉ từ dữ liệu đào tạo.
- Grounding hoạt động bằng cách đưa văn bản nguồn thực tế vào prompt, chuyển đổi nhiệm vụ từ truy hồi thông tin sang tóm tắt và giảm bớt các câu trả lời thêu dệt.
- Cập nhật kiến thức bằng cách chỉnh sửa cơ sở tri thức, không cần đào tạo lại, đây là giải pháp lý tưởng cho các dữ liệu bảo mật hoặc thay đổi nhanh chóng.
- RAG làm giảm hiện tượng ảo giác nhưng không loại bỏ hoàn toàn, và chất lượng câu trả lời phụ thuộc trực tiếp vào chất lượng cũng như tính cập nhật từ các nguồn của bạn.
- Một cơ sở tri thức được kiểm chứng tốt và chính xác là đòn bẩy lớn nhất quyết định liệu hệ thống RAG có đưa ra thông tin chính xác hay không.
