Khi ai đó hỏi trợ lý AI về công ty của bạn, câu trả lời thường được tạo ra thay vì được tra cứu từ một hồ sơ cố định. Điều đó có nghĩa là mô hình có thể tuyên bố một cách đầy tự tin những thông tin sai lệch: một sản phẩm bạn chưa từng bán, một năm thành lập sai lệch, hoặc tính năng của đối thủ cạnh tranh được gán cho bạn. Đây không phải là do AI có ác ý. Đó là một kết quả có thể dự đoán được từ cách các hệ thống này được xây dựng và tối ưu hóa. Tin vui là những yếu tố tạo ra các lỗi này hoàn toàn có thể được điều hướng. Bằng cách biến thương hiệu của bạn thành một thực thể rõ ràng, được mô tả chi tiết và được hỗ trợ bởi các nguồn bên thứ ba nhất quán, bạn sẽ cung cấp cho các mô hình nguồn tài liệu sạch hơn để khai thác và ít có cơ hội tự suy đoán hơn.
Tại sao ngay từ đầu các mô hình lại tự bịa ra các dữ liệu
Các mô hình ngôn ngữ lớn tạo ra những từ tiếp theo có khả năng xảy ra cao nhất về mặt thống kê, chứ không phải các sự thật được xác chứng, vì vậy một câu trả lời trôi chảy nhưng sai lệch có thể đọc y hệt như một câu trả lời đúng. Một bài nghiên cứu năm 2025 của OpenAI, "Why Language Models Hallucinate," lập luận rằng cách tính điểm của các mô hình trên hầu hết các hệ quy chuẩn (benchmarks) ưu tiên việc phỏng đoán hơn là thừa nhận sự mơ hồ, bởi vì hầu hết các hệ quy chuẩn đều chấm điểm một câu trả lời sai đầy tự tin tương đương với câu trả lời "Tôi không biết". Kết quả là nhiều mô hình được tối ưu hóa theo cách khuyến khích chúng lấp đầy khoảng trống thay vì báo cáo sự không chắc chắn. Đối với các thương hiệu, các khoảng trống xuất hiện ở bất cứ nơi nào dữ liệu đào tạo bị thiếu hụt, không nhất quán hoặc lỗi thời.
Các thương hiệu ít tên tuổi và mơ hồ phải gánh chịu hậu quả nặng nề nhất
Nghiên cứu về nhận thức kiến thức trong các mô hình ngôn ngữ chỉ ra rằng các mô hình có hành vi nội bộ khác nhau đối với các thực thể mà chúng có thể truy xuất thông tin thực tế so với những thực thể không thể, và tỷ lệ lỗi tăng cao đối với các thực thể có ít dữ liệu huấn luyện bao phủ. Trên thực tế, điều này có nghĩa là các công ty nhỏ, mới thành lập hoặc mới tái định vị thương hiệu dễ bị ảnh hưởng hơn so với các thương hiệu phổ biến. Sự trùng lặp tên gọi càng làm trầm trọng thêm vấn đề: nếu nhiều tổ chức, sản phẩm hoặc cá nhân dùng chung tên thương hiệu của bạn, mô hình có thể hợp nhất các thông tin của họ làm một.
Sự rõ ràng của thực thể: hãy biến thương hiệu của bạn thành một thực thể duy nhất, không thể nhầm lẫn
Các hệ thống AI thực hiện việc đối chiếu cơ sở dữ liệu thường hoạt động bằng cách phân định thực thể thành một danh tính chuẩn tắc trước khi mô tả chúng. Thông tin cốt lõi của bạn càng xuất hiện nhất quán trên web bao nhiêu thì quá trình xử lý thực thể đó càng trở nên dễ dàng bấy nhiêu. Hãy giữ cho ba yếu tố sau luôn đồng nhất ở mọi nơi xuất hiện: tên tổ chức chính xác của bạn, một URL website chuẩn tắc và một mô tả ổn định. Sự thiếu đồng nhất trong những thông tin cơ bản này là tác nhân khiến mô hình đưa ra phỏng đoán hoặc hợp nhất bạn với một đối tượng khác.
Dữ liệu cấu trúc cho công cụ tìm kiếm biết bạn là ai, chứ không phải cách xếp hạng bạn
Đánh dấu Schema.org, đặc biệt là đánh dấu Organization với thuộc tính sameAs, cung cấp cho máy móc một mô tả rõ ràng, có cấu trúc đọc hiểu được về thực thể của bạn và trỏ hướng trực tiếp tới các hồ sơ bên bên ngoài có thẩm quyền của bạn. Thuộc tính sameAs đóng vai trò như các mô liên kết: nó liệt kê các nguồn bên ngoài, chẳng hạn như Wikidata, LinkedIn, hoặc Crunchbase, để công cụ tìm kiếm có thể tham chiếu chéo nhằm xác minh danh tính của bạn. Quan trọng là, dữ liệu cấu trúc phục vụ cho mục đích thấu hiểu và đủ điều kiện hiển thị kết quả tìm kiếm phong phú (rich results), chứ không phải là một đòn bẩy xếp hạng trực tiếp. Google đã tuyên bố rõ ràng rằng dữ liệu cấu trúc không phải là một yếu tố xếp hạng trực tiếp, do đó giá trị cốt lõi ở đây nằm ở việc loại bỏ sự mơ hồ và tạo độ rõ nét, từ đó hỗ trợ gián tiếp cho mức độ đáng tin cậy trong các nội dung mô tả về bạn.
Các nguồn bên thứ ba có thẩm quyền là một trong những giải pháp cải thiện mạnh mẽ nhất
Các sự thật về một thực thể được xác định bằng tính nhất quán trên các nguồn độc lập, đáng tin cậy, chứ không chỉ bằng những tuyên bố của riêng bạn. Wikidata từ lâu đã được coi là có đòn bẩy đặc biệt cao vì nó là một dữ liệu đầu vào có cấu trúc, máy có thể đọc được mà Google và các hệ thống khác có thể tham chiếu khi một tổ chức đủ điều kiện, và một mục thông tin sạch với trang web chính thức của bạn cùng nhãn nhất quán sẽ hỗ trợ phân định thực thể rõ ràng, mặc dù nó không đảm bảo việc được đưa vào Knowledge Graph. Sự phủ sóng uy tín, các hồ sơ chính xác trên các nền tảng lâu năm và các chi tiết khớp nhau trên tất cả các kênh đó sẽ củng cố cùng một bức tranh toàn cảnh. Khi mạng web đồng thuận về các sự thật của bạn, mô hình sẽ ít có cơ hội để tự thêu dệt hơn.
- Các câu trả lời của AI về thương hiệu của bạn được tạo ra, đôi khi từ chính bộ nhớ của mô hình và đôi khi từ các kết quả web được truy xuất, vì vậy ngay cả các câu trả lời có cơ sở vẫn có thể chứa các lỗi nghe rất tự tin khi nguồn thông tin quá ít ỏi. Đó là một rủi ro tích hợp, không phải là một lỗi kỹ thuật.
- Các mô hình suy đoán nhiều nhất khi dữ liệu ít ỏi, không nhất quán hoặc tên của bạn bị trùng lặp với một thực thể khác, điều này ảnh hưởng nặng nề nhất đến các thương hiệu nhỏ hơn và mới hơn.
- Hãy thống nhất ba yếu tố cơ bản ở mọi nơi: tên chính xác, một URL chuẩn và một mô tả ổn định. Sự không nhất quán chính là yếu tố dẫn đến sự suy đoán.
- Sử dụng schema Organization với sameAs để khai báo danh tính của bạn và liên kết đến các hồ sơ có thẩm quyền, nhưng hãy coi đó là công cụ phân định thực thể, không phải là một thủ thuật xếp hạng.
- Hãy đồng nhất các sự thật về bạn trên các nguồn độc lập như Wikidata, LinkedIn và các tin bài uy tín. Sự đồng thuận giữa các nguồn độc lập là một trong những biện pháp kiểm soát ảo giác mạnh mẽ nhất mà bạn có.
