Dữ liệu của bạn, dễ dàng truy xuất và đáng tin cậy.
Chúng tôi xây dựng các hệ thống tăng cường truy xuất giúp xác thực các câu trả lời của LLM dựa trên chính tài liệu, chính sách và dữ liệu của bạn, tích hợp sẵn nguồn trích dẫn, kiểm soát quyền truy cập và quy trình đánh giá.
Các dịch vụ cốt lõi bao gồm
Nạp và phân mảnh (chunking) cơ sở tri thức
Đường ống (pipeline) truy xuất và tìm kiếm vector
Tạo câu trả lời xác thực (grounded generation) kèm trích dẫn
Kiểm soát quyền truy cập và xử lý PII
Đánh giá và kiểm thử ảo giác (hallucination)
Triển khai và liên tục tinh chỉnh (tuning)
Định nghĩa
What is Custom LLM & RAG (Retrieval-Augmented Generation) Systems?
Một hệ thống Custom LLM & RAG là một trợ lý AI riêng tư giúp trả lời các câu hỏi bằng cách sử dụng chính tài liệu và dữ liệu của bạn thay vì Internet công cộng, truy xuất các tài liệu nguồn liên quan tại thời điểm đặt câu hỏi và sử dụng một mô hình ngôn ngữ lớn để viết câu trả lời có cơ sở và được trích dẫn nguồn rõ ràng.
Cách thức hoạt động
Nội dung, tài liệu, bài viết hướng dẫn, thông số sản phẩm, phiếu yêu cầu hỗ trợ, chính sách của bạn sẽ được chia thành các đoạn văn, chuyển đổi thành các embeddings và lưu trữ trong một vector database; khi ai đó đặt câu hỏi, hệ thống sẽ truy xuất các đoạn văn phù hợp nhất và đưa chúng vào mô hình ngôn ngữ để câu trả lời được dựa trên chính tài liệu của bạn và có thể trích dẫn nguồn rõ ràng.
Công cụ này dành cho ai
Dành cho các tổ chức sở hữu kho tri thức nội bộ khổng lồ, các đội ngũ hỗ trợ, công ty dịch vụ chuyên nghiệp, hay các hoạt động kỹ thuật và tuân thủ nghiêm ngặt cần nhân viên cùng khách hàng có được câu trả lời nhanh chóng, chính xác từ những nguồn nội bộ đáng tin cậy. Kết quả mang lại là hiệu suất và sự tiết kiệm thời gian: ít thời gian lục tìm tài liệu hơn, giảm tỷ lệ chuyển cấp yêu cầu hỗ trợ và bớt đi những câu trả lời sai, vì các phản hồi được thiết kế để luôn bám sát vào nội dung đã được bạn phê duyệt.
Trong thực tế
Một doanh nghiệp kết nối các hướng dẫn sử dụng sản phẩm, chính sách bảo hành và các phiếu yêu cầu hỗ trợ trước đây với một trợ lý riêng tư, nhờ đó nhân viên hỗ trợ có thể hỏi "chính sách bảo hành mở rộng cho mẫu máy này bao gồm những gì?" và nhận được câu trả lời trích dẫn chính xác đoạn chính sách kèm liên kết trực tiếp đến tài liệu nguồn.
Các hệ thống Custom LLM and RAG Systems chúng tôi xây dựng và vận hành
Chúng tôi xây dựng các hệ thống truy xuất trên dữ liệu riêng tư của bạn và vận hành chúng trực tiếp (production) cho các đội ngũ thuộc phân khúc tầm trung và doanh nghiệp lớn. Các kỹ sư cao cấp của chúng tôi thiết kế các lớp ingestion, chunking, embedding và retrieval, sau đó kết nối chúng với Claude, GPT, hoặc các mô hình mở như Llama, Qwen và Mistral tùy thuộc vào nhu cầu của bạn về độ chính xác, bảo mật dữ liệu và chi phí. Chúng tôi quản lý hệ thống từ đầu đến cuối, bao gồm cả các cấu phần giúp giữ cho câu trả lời luôn có cơ sở dữ liệu xác thực và cập nhật mới nhất.
Chúng tôi tiến hành đánh giá liên tục dựa trên các câu hỏi thực tế của bạn và liên tục cập nhật lớp truy xuất để giúp hệ thống duy trì độ chính xác khi kho tri thức của bạn ngày càng mở rộng.
Chúng tôi xây dựng toàn bộ pipeline: ingestion, embeddings, vector search, reranking, và grounded generation
Chúng tôi triển khai với các mô hình riêng tư hoặc mã nguồn mở khi quyền lưu trữ dữ liệu cục bộ (data residency) và quyền kiểm soát dữ liệu là điều quan trọng
Chúng tôi tích hợp các lớp đánh giá, trích dẫn và guardrails nhằm giảm thiểu các câu trả lời thiếu căn cứ cũng như đảm bảo mọi tuyên bố đều có thể truy cập nguồn gốc
Chúng tôi giữ cho chỉ mục dữ liệu (index) luôn mới và duy trì bảo trì hệ thống khi tài liệu và dữ liệu của bạn có sự thay đổi
Xem cách thức hoạt động
Câu trả lời có căn cứ xác thực, được trích dẫn trực tiếp từ chính tài liệu của bạn.
Thương hiệu của bạn · Trợ lý tri thứcCó cơ sở xác thực · Giới hạn qua cổng SSO
Khách hàng doanh nghiệp lớn có thể hủy hợp đồng giữa kỳ hạn không, và chính sách hoàn tiền nào được áp dụng?
Có, kèm thông báo bằng văn bản trước 60 ngày MSA §7.2. Số tháng chưa sử dụng sẽ được hoàn lại theo tỷ lệ, trừ đi khoản phí onboarding Refund Policy trang 3. Các hợp đồng trước năm 2025 vẫn giữ nguyên thời hạn 30 ngày cũ.
ĐƯỢC TRUY XUẤT TỪ CÁC NGUỒN ĐÃ PHÊ DUYỆT
Enterprise-MSA-2025.pdf · §7.20.94
Refund-Policy-v4.docx · trang 30.91
Biên bản pháp lý · wiki nội bộ0.87
98.4% được xác thực nguồn, lần đánh giá gần nhất1.283 tài liệu được phê duyệtTừ chối phái đoán khi không chắc chắn
Ví dụ minh họa, được thiết kế để trình bày loại kết quả chúng tôi mang lại.
Dự án tiêu biểu
Các dự án tiêu biểu.
Biến sự cường điệu về AI thành một kế hoạch được cấp ngân sách và một use case hoạt động đầu tiên.
Nhà phân phối tầm trung đang khám phá AI
Nhiều sự cường điệu, không có kế hoạch, các chương trình thí điểm phân tán.
Những gì chúng tôi đã làm
Đã thực hiện đánh giá cơ hội + rủi ro
Ưu tiên lộ trình theo ROI
Triển khai một use case đầu tiên được quản trị chặt chẽ
Kết quả Thay thế các thử nghiệm phân tán bằng một lộ trình được cấp ngân sách và một chương trình thí điểm hoạt động thực tế.
Doanh nghiệp SaaS có lượng yêu cầu hỗ trợ lớn
Muốn có các câu trả lời dựa trên tài liệu của chính họ, tránh hiện tượng ảo giác.
Những gì chúng tôi đã làm
Xây dựng hệ thống RAG trên cơ sở tri thức của họ
Đã thêm trích dẫn + khung đánh giá
Kiểm soát truy cập + giám sát
Kết quả Giảm thiểu các ticket phổ biến bằng những câu trả lời có nguồn trích dẫn đáng tin cậy.
Các ví dụ được ẩn danh để tuân thủ NDA của khách hàng và được chỉnh sửa để minh họa phạm vi công việc điển hình, kết quả thực tế sẽ khác nhau tùy theo thị trường, ngân sách và điểm xuất phát.
Cách thức & lý do phương pháp này hiệu quả
Được đối chiếu từ nguồn của bạn, không phải từ bộ nhớ của mô hình.
Hệ thống sẽ truy xuất các đoạn văn bản có liên quan từ tài liệu của bạn và yêu cầu mô hình đối chiếu câu trả lời dựa trên các đoạn văn đó, giúp giảm bớt sự phụ thuộc vào kiến thức đã được huấn luyện trước không được hỗ trợ. Tại thời điểm truy vấn, chúng tôi truy xuất các đoạn văn từ chính nguồn của bạn vốn thực sự giải quyết được câu hỏi và hướng dẫn mô hình trả lời từ các đoạn văn đó, kèm theo trích dẫn cho mỗi khẳng định, nhờ đó câu trả lời được dẫn dắt bởi tài liệu nguồn của bạn, đi kèm các trích dẫn và rào chắn bảo vệ để giảm thiểu các khẳng định không có căn cứ.
Nạp, phân mảnh và nhúng vectorChúng tôi đưa các nguồn dữ liệu của bạn (PDFs, wiki, tickets, CRM, cơ sở dữ liệu) qua một đường ống nạp dữ liệu giúp làm sạch và chia nhỏ từng tài liệu thành các phân mảnh (chunks) có cấu trúc, thường khoảng vài trăm tokens, được ngắt theo các tiêu đề và phần để đảm bảo nội dung mỗi đoạn văn được trọn vẹn, sau đó nhúng (embed) từng phân mảnh vào kho lưu trữ vector cùng với các siêu dữ liệu (metadata) như nguồn, phần, ngày và cấp độ truy cập. Một lịch trình tái lập chỉ mục (re-index) tự động giúp cập nhật liên tục khi tài liệu thay đổi, và các phiên bản cũ sẽ bị thay thế thay vì bị trùng lặp.
Truy xuất hỗn hợp + xếp hạng lại (reranking)Với mỗi câu hỏi, chúng tôi thực hiện tìm kiếm vector dày đặc (độ tương đồng ngữ nghĩa) song song với tìm kiếm từ khóa BM25, để các định danh chính xác, SKU, mã chính sách, chuỗi lỗi không bị bỏ sót bởi các lượt nhúng mờ (fuzzy embeddings). Tập hợp ứng viên được hợp nhất sau đó sẽ được chuyển qua một bộ xếp hạng lại (reranker) cross-encoder để đọc đồng thời truy vấn và đoạn văn, từ đó tính điểm độ liên quan thực tế, thu hẹp hàng chục ứng viên xuống còn một vài đoạn văn thực sự giá trị để đưa vào prompt. Chất lượng truy xuất là yếu tố chính quyết định chất lượng câu trả lời, vì vậy bước này cực kỳ quan trọng để giảm thiểu các phản hồi không liên quan hoặc không có căn cứ; đây là nơi chúng tôi tập trung phần lớn nỗ lực đánh giá và tối ưu hóa nhằm đẩy độ chính xác truy xuất lên cao nhất có thể.
Tạo câu trả lời được xác thực và lọc theo quyền truy cậpMỗi phân mảnh (chunk) đều được lọc dựa trên quyền hạn của người dùng thông qua siêu dữ liệu (metadata), nhờ đó ngữ cảnh nguồn cung cấp cho mô hình chỉ giới hạn ở những tài liệu mà người dùng đó được phép truy cập, đi kèm các rào chắn bảo vệ và kiểm thử để giảm thiểu các câu trả lời không có căn cứ. Các đoạn văn được chọn lọc sẽ được ráp vào prompt cùng hướng dẫn yêu cầu mô hình chỉ trả lời nghiêm ngặt dựa trên đó, trích dẫn rõ các phân mảnh cụ thể đã dùng, và trả lời không biết nếu tài liệu nguồn không đề cập đến câu hỏi, biến câu trả lời 'Tôi không tìm thấy thông tin này' thành một kết quả chính xác, an toàn thay vì một câu trả lời tự bịa đặt.
Đánh giá trước và sau khi ra mắtChúng tôi xây dựng một tập đánh giá gồm các câu hỏi thực tế đi kèm câu trả lời chuẩn xác đã biết, và chấm điểm cho mỗi thay đổi dựa trên độ trung thực (mỗi khẳng định có được hỗ trợ bởi đoạn văn truy xuất được không?), độ liên quan ngữ cảnh (việc truy xuất có hiển thị đúng các đoạn văn cần thiết không?), và tính chính xác của câu trả lời, thường thông qua bộ chấm điểm LLM-as-judge kết hợp kiểm tra xác suất bằng con người. Không có gì được triển khai chỉ dựa trên cảm tính; một thay đổi về truy xuất hoặc prompt nếu không cải thiện các chỉ số đó thì sẽ bị đảo ngược.
Giám sát và tinh chỉnh trong môi trường vận hànhSau khi hệ thống đi vào hoạt động, chúng tôi ghi nhật ký các truy vấn, các đoạn văn được truy xuất và độ tin cậy, đồng thời xem xét các tương tác có độ tin cậy thấp hoặc bị đánh giá không tốt (thumbs-down) để tìm ra các lỗ hổng: một tài liệu bị thiếu, một phân mảnh chia đôi câu trả lời, hay một cách diễn đạt truy vấn mà bộ truy xuất bỏ sót. Những lỗi đó sẽ được khắc phục trong quy trình nạp, phân mảnh hoặc truy xuất, và được bổ sung trở lại vào tập đánh giá; nhờ đó, nếu lỗi tương tự tái diễn, khả năng cao nó sẽ bị phát hiện trong quá trình kiểm thử hồi quy trước khi đến tay người dùng.
Ví dụ thực tếMột nhà cung cấp bảo hiểm quy mô vừa, có các đội ngũ hỗ trợ và thẩm định phải trả lời cùng một câu hỏi về chính sách và quy trình hàng chục lần mỗi ngày, phải lục tìm qua hàng trăm tệp PDF, wiki nội bộ và các luồng email.
Nạp các tệp PDF chính sách, wiki nội bộ và các SOP quy trình xử lý khiếu nại; phân mảnh theo cấu trúc tài liệu (khoảng vài trăm tokens và giữ nguyên ngữ cảnh của tiêu đề) và nhúng vào kho lưu trữ vector, với tiến trình tái lập chỉ mục (re-index) chạy hàng đêm để các cập nhật thường xuất hiện trong vòng một ngày
Quy trình truy xuất chạy ở chế độ hỗn hợp (hybrid): tìm kiếm vector dày đặc kết hợp đối sánh từ khóa BM25 để nắm bắt chính xác các mã chính sách và số biểu mẫu, sau đó một bộ cross-encoder sẽ xếp hạng lại các ứng viên hàng đầu để chọn ra một số ít đoạn văn thực sự được gửi đến mô hình
Mỗi câu trả lời phải trích dẫn các phân mảnh nguồn đã sử dụng, và các bộ lọc siêu dữ liệu (metadata) giới hạn phạm vi truy xuất ở những gì từng vai trò được phép xem, nhờ đó các tài liệu chỉ dành cho thẩm định viên sẽ không hiển thị với các nhân viên hỗ trợ tuyến đầu
Độ trung thực và sự trích dẫn chính xác được đo lường dựa trên một tập đánh giá được thiết kế riêng cho mỗi lần lặp (ví dụ minh họa: việc tinh chỉnh kích thước phân mảnh và thêm bộ xếp hạng lại (reranker) đã giúp tỷ lệ các câu trả lời được đánh giá là hoàn toàn xác thực tăng từ khoảng mức thấp 70% lên mức cao 80%, với các khẳng định không có căn cứ trên tập dữ liệu đó giảm đi rõ rệt), đây là kết quả ví dụ từ phương pháp đánh giá của một dự án cụ thể, không phải là kết quả đảm bảo hoặc kết quả điển hình
Tại sao phương pháp này hiệu quả
Độ chính xác trong các hệ thống này phần lớn được quyết định bởi khâu truy xuất, chứ không chỉ ở việc mô hình lớn hay thông minh như thế nào: nếu đoạn văn chính xác nằm trong prompt, một mô hình khiêm tốn cũng có xu hướng trả lời đúng, còn nếu không, ngay cả một mô hình mạnh cũng dễ phán đoán mò. Đó là lý do tại sao phần lớn đòn bẩy nằm ở việc chia nhỏ phân mảnh (chunking), tìm kiếm hỗn hợp (hybrid search), xếp hạng lại (reranking) và trích dẫn, chứ không chỉ nằm ở cách viết prompt, và tại sao một hệ thống khung đánh giá lại quan trọng, bởi vì nó biến cảm giác "AI hoạt động chính xác" thành một điểm số độ trung thực đo lường được mà bạn có thể bảo vệ, cải thiện một cách chủ động và theo dõi các lỗi hồi quy khi tài liệu và mục đích sử dụng thay đổi.
Việc dán tài liệu vào cửa sổ chat là một quy trình thủ công, nhanh chóng chạm giới hạn ngữ cảnh và quên sạch mọi thứ giữa các phiên làm việc. Một hệ thống RAG lập chỉ mục toàn bộ kho kiến thức của bạn vào kho lưu trữ vector, chỉ truy xuất các đoạn văn bản liên quan nhất cho mỗi câu hỏi và cung cấp chúng cho mô hình để các câu trả lời luôn được xác thực dựa trên tài liệu nguồn của bạn kèm theo trích dẫn. Ví dụ, một đội ngũ hỗ trợ có thể đặt câu hỏi trên hàng ngàn tài liệu sản phẩm và SOP cùng một lúc, đồng thời nhận về câu trả lời có chứa liên kết dẫn tới chính xác trang tài liệu gốc, thay vì một ai đó phải sao chép-dán thủ công từng tệp PDF một.
Chúng tôi cấu hình mô hình để ưu tiên ngữ cảnh được truy xuất và hướng dẫn nó trả lời là không biết khi tài liệu nguồn không đề cập đến câu hỏi, thay vì tự ý phỏng đoán. Chúng tôi thêm các biện pháp kiểm soát chất lượng truy xuất, các yêu cầu trích dẫn để mọi khẳng định đều có thể truy vết lại tài liệu nguồn, và các tập đánh giá để kiểm thử hiện tượng ảo tưởng trước khi ra mắt. Chúng tôi cũng tinh chỉnh chính bước truy xuất, bởi vì phần lớn các câu trả lời sai đều xuất phát từ việc lấy sai đoạn văn chứ không phải do mô hình, vì thế chúng tôi đo lường và cải thiện những gì được truy xuất trước tiên.
Kho kiến thức, các bản nhúng (embeddings) và nhật ký cuộc trò chuyện của bạn luôn nằm trong cơ sở hạ tầng do bạn kiểm soát, cho dù đó là tài khoản đám mây của bạn hay một môi trường biệt lập mà chúng tôi quản lý cho bạn. Nội dung của bạn không bao giờ được sử dụng để huấn luyện các mô hình nền tảng công cộng. Tùy thuộc vào mức độ nhạy cảm, chúng tôi có thể chạy hoàn toàn các mô hình nguồn mở như Llama hoặc Mistral trong môi trường của bạn để không có dữ liệu nào lọt ra ngoài, hoặc sử dụng các mô hình API như Claude hoặc GPT theo các điều khoản doanh nghiệp loại trừ việc huấn luyện trên dữ liệu của bạn; trong trường hợp đó, chỉ prompt và các đoạn văn được truy xuất cho mỗi câu hỏi được gửi đến nhà cung cấp đó tại thời điểm suy luận (inference time), trong khi kho kiến thức được lưu trữ, các bản nhúng và nhật ký của bạn vẫn được giữ nguyên trong môi trường của bạn. Chúng tôi sẽ xác định phạm vi này trong cuộc trao đổi đầu tiên dựa trên nhu cầu tuân thủ của bạn.
Một dự án thí điểm tập trung vào một nguồn kiến thức và một tình huống sử dụng (use case) thường mất vài tuần, trong khi một hệ thống vận hành thực tế trên nhiều nguồn dữ liệu, đi kèm kiểm soát quyền truy cập và các tích hợp sẽ mất nhiều thời gian hơn. Chúng tôi bắt đầu bằng việc xác định phạm vi sử dụng và kiểm kê các nguồn của bạn, sau đó xây dựng một đường ống nạp (ingestion pipeline) và truy xuất dữ liệu, tinh chỉnh nó dựa trên các câu hỏi thực tế từ đội ngũ của bạn, và xác thực độ chính xác trước khi triển khai. Bạn sẽ sớm thấy một bản mẫu thử nghiệm (prototype) hoạt động thực tế để chúng ta tinh chỉnh dựa trên chính nội dung thực tế và các trường hợp biên của bạn, chứ không phải một bản demo chung chung.
Kiến thức liên tục thay đổi, vì vậy hệ thống cần được tái lập chỉ mục (re-indexing) liên tục khi các tài liệu được thêm vào hoặc cập nhật, cộng thêm việc giám sát những gì mọi người hỏi và những chỗ câu trả lời chưa đáp ứng yêu cầu. NYFTY không chỉ bàn giao một sản phẩm đã xây dựng xong, chúng tôi có thể vận hành và quản lý thay bạn, bao gồm cập nhật chỉ mục, xem xét các truy vấn bị lỗi hoặc có độ tin cậy thấp, và tinh chỉnh lại khâu truy xuất khi nhu cầu sử dụng tăng lên. Nếu bạn muốn tự sở hữu hệ thống nội bộ, chúng tôi sẽ xây dựng nó trên cơ sở hạ tầng mà đội ngũ của bạn kiểm soát và ghi chép lại tài liệu đường ống (pipeline) để các kỹ sư của bạn có thể trực tiếp bảo trì.