Khi bạn đặt câu hỏi cho một trợ lý AI, nó hiếm khi chỉ thực hiện một lượt tìm kiếm và đọc duy nhất một trang. Các công cụ trả lời hiện đại vận hành một quy trình pipeline: chúng quyết định xem có nên tìm kiếm hay không, chia tách câu hỏi của bạn thành nhiều truy vấn nhỏ hơn, truy xuất và xếp hạng lại các trang tiềm năng, đóng gói những phân đoạn tốt nhất vào ngữ cảnh (context) của mô hình, sau đó viết câu trả lời và đính kèm trích dẫn. Việc hiểu rõ từng giai đoạn sẽ giải thích sự thật quan trọng nhất đối với bất kỳ thương hiệu nào: được nhắc tên trong câu trả lời và được trích dẫn làm nguồn là hai kết quả riêng biệt, và bạn hoàn toàn có thể giành được một trong hai mà không cần cái còn lại. Đây là bộ máy hoạt động đã được ghi nhận tài liệu đằng sau "chiếc hộp đen," với thực trạng thực tế của ngành được đánh dấu như vậy.
Giai đoạn một: công cụ quyết định xem có nên tìm kiếm hay không
Trước khi bất kỳ hoạt động truy xuất nào diễn ra, mô hình sẽ đưa ra quyết định định tuyến: trả lời từ dữ liệu đào tạo của nó, hoặc đi truy xuất thông tin trực tuyến. Trong thực tế, các công cụ có xu hướng tìm kiếm đối với các truy vấn nhạy cảm với thời gian, mang tính so sánh hoặc thực tế (giá cả, tin tức, đánh giá) và nghiêu về kiến thức nội bộ đối với các câu hỏi ổn định, không chịu ảnh hưởng bởi thời gian. Quyết định định tuyến này mang tính tình huống và khác nhau tùy theo nền tảng: Perplexity định vị hầu như mọi phản hồi dựa trên các nguồn trực tuyến, trong khi ChatGPT tìm kiếm một cách chọn lọc hơn. Bài học rút ra là nếu công cụ không bao giờ tìm kiếm, nội dung của bạn sẽ không thể được trích dẫn dù nó có tốt đến đâu đi nữa.
Giai đoạn hai: fan-out biến một câu hỏi thành nhiều câu hỏi khác
Thay vì tìm kiếm cụm từ chính xác của bạn, công cụ sẽ phân rã prompt thành nhiều truy vấn phụ liên quan và chạy chúng song song, một kỹ thuật được Google gọi một cách công khai là "query fan-out" trong thông báo AI Mode của mình, được cung cấp bởi một phiên bản tùy chỉnh của Gemini (Gemini 2.5 tại buổi ra mắt AI Mode vào tháng 5 năm 2025), một dòng mô hình liên tục được cập nhật các phiên bản mới. Các truy vấn phụ khác nhau có thể được định tuyến đến các nguồn khác nhau: web mở, sơ đồ tri thức (knowledge graph), dữ liệu mua sắm hoặc dữ liệu địa phương và các nguồn dữ liệu có cấu trúc. Hệ quả thực tế là bạn không còn cạnh tranh cho một từ khóa duy nhất nữa. Bạn đang cạnh tranh trên một dải các câu hỏi phụ mà người dùng chưa bao giờ nhập vào.
Giai đoạn ba: truy xuất, xếp hạng lại và đóng gói ngữ cảnh
Mỗi truy vấn phụ trả về một tập hợp các trang ứng viên. Hầu hết các công cụ được cho là sẽ xếp hạng lại các ứng viên đó theo mức độ liên quan và chất lượng và chỉ giữ lại một nhóm nhỏ, loại bỏ hầu hết những gì chúng truy xuất được. Các đoạn văn sống sót, chứ không phải toàn bộ trang, sau đó được đóng gói vào cửa sổ ngữ cảnh của mô hình dưới dạng bằng chứng mà nó sẽ đọc. Các phân tích ngành liên tục chỉ ra rằng phần lớn các trang được truy xuất không bao giờ được sử dụng, vì vậy việc chỉ có thể truy xuất được là điều kiện cần nhưng còn lâu mới đủ.
Giai đoạn bốn: tạo câu trả lời, sau đó đính kèm trích dẫn
Mô hình viết câu trả lời từ các đoạn văn được đóng gói, và việc trích dẫn có thể diễn ra theo một trong hai cách. Một số hệ thống tạo câu trả lời và nguồn của nó cùng nhau để văn bản được gắn liền với bằng chứng khi nó được viết; những hệ thống khác tạo câu trả lời trước rồi đính kèm các liên kết hỗ trợ sau đó, một phương pháp được ghi nhận trong nghiên cứu về các hệ thống như RARR. Phương pháp thứ hai, đôi khi được gọi là gán nguồn sau thực tế (post-hoc attribution), có thể tạo ra một trích dẫn hỗ trợ cho một tuyên bố mà không phải là nguồn gốc thực sự của cách diễn đạt. Đây là lý do tại sao một liên kết được trích dẫn không phải lúc nào cũng có nghĩa là trang đó là nơi trợ lý "học" được sự thật.
Thông tin cốt lõi: được nêu tên không đồng nghĩa với được trích dẫn
Hai điều khác biệt có thể xảy ra với thương hiệu của bạn trong một câu trả lời của AI. Bạn có thể được nhắc đến, khi mô hình nêu tên bạn ngay trong chính đề xuất, hoặc bạn có thể được trích dẫn, khi URL của bạn xuất hiện dưới dạng một nguồn được liên kết. Những điều này được quyết định ở các giai đoạn khác nhau bởi các tín hiệu khác nhau, vì vậy chúng không đi cùng nhau. Các phân tích ngành về khả năng hiển thị của AI cho thấy tương đối ít thương hiệu liên tục đạt được cả hai, nghĩa là nghiên cứu của bạn có thể cung cấp thông tin cho một câu trả lời nhưng sau đó lại đề xuất đích danh một đối thủ cạnh tranh.
- Các câu trả lời của AI đến từ một quy trình (pipeline) khép kín, không phải một tìm kiếm đơn lẻ: quyết định tìm kiếm, mở rộng (fan-out) thành các truy vấn phụ, truy xuất, xếp hạng lại, đóng gói, tạo phản hồi, và gán nguồn. Hãy tối ưu hóa cho toàn bộ chuỗi quy trình, chứ không chỉ một từ khóa đơn lẻ.
- Fan-out có nghĩa là bạn được đánh giá qua nhiều câu hỏi phụ mà người dùng chưa bao giờ nhập. Google tài liệu hóa điều này dưới dạng "query fan-out" trong AI Mode, chạy trên một mô hình Gemini tùy chỉnh.
- Hầu hết các trang được truy xuất không bao giờ được sử dụng. Việc có thể tìm thấy chỉ đưa bạn vào nhóm ứng viên; vượt qua vòng xếp hạng lại (re-rank) và lọt vào phần ngữ cảnh được đóng gói mới là rào cản khó khăn hơn.
- Trích dẫn không phải lúc nào cũng là bằng chứng về nguồn gốc. Một số công cụ đính kèm nguồn sau khi viết câu trả lời, vì vậy một liên kết được trích dẫn có thể hỗ trợ một tuyên bố mà không phải là nơi xuất phát của cách diễn đạt.
- Được NÊU TÊN trong câu trả lời và được TRÍCH DẪN làm nguồn là những kết quả riêng biệt được chi phối bởi các tín hiệu khác nhau. Hãy theo dõi cả hai, bởi vì bạn có thể thắng một bên và thua bên còn lại, và thương hiệu được nêu tên thường sẽ thu hút được người mua.
