Trước đây, mạng Internet chỉ có một trình thu thập thông tin thực sự quan trọng: Googlebot. Giờ đây, một nhóm các AI crawler ngày càng đông đảo đang truy cập trang web của bạn vì nhiều lý do khác nhau, và việc quyết định ai được quyền truy cập là một lựa chọn kinh doanh có tính toán, không phải ngẫu nhiên. Bước đi cốt lõi là phân tách mục đích khỏi chủ sở hữu: một số bot thu thập dữ liệu để đào tạo mô hình, một số lập chỉ mục các trang của bạn cho các câu trả lời tìm kiếm của AI, và số khác truy xuất trang trực tiếp (live fetch) theo yêu cầu của người dùng. Chặn một công cụ không đồng nghĩa với chặn những công cụ còn lại. Đây là chân dung của các crawler thực sự năm 2026, cách robots.txt giúp bạn thể hiện tùy chọn ưu tiên (và tại sao nó chỉ là một yêu cầu tự nguyện), những gì Cloudflare đã thay đổi, cùng sự đánh đổi thực tế giữa việc bảo vệ nội dung và duy trì sự hiện diện trong các câu trả lời của AI.
Ba nhiệm vụ: đào tạo (training), lập chỉ mục tìm kiếm (search-index), và truy xuất trực tiếp (live fetchers)
Sự khác biệt quan trọng nhất giữa các AI crawler không nằm ở công ty sở hữu mà ở mục đích hoạt động. Trình thu thập thông tin đào tạo hoặc thu thập dữ liệu thu gom nội dung để xây dựng hoặc cải thiện các mô hình AI. Trình lập chỉ mục tìm kiếm phân loại các trang của bạn để bạn có thể được hiển thị và trích dẫn trong các câu trả lời dạng tìm kiếm của sản phẩm AI. Các trình truy xuất trực tiếp theo yêu cầu tải một trang theo thời gian thực vì người dùng đã đặt câu hỏi hoặc nhấp vào liên kết bên trong sản phẩm AI. Những công cụ này phục vụ các mục đích khác nhau, và việc chặn một công cụ thường không giống với chặn các công cụ còn lại. Nhiều nhà cung cấp cung cấp các token riêng biệt cho mỗi mục đích, nhưng điều này không phổ biến ở khắp mọi nơi: Meta-ExternalAgent rõ ràng là đa mục đích, và Google không cung cấp token robots.txt nào để chặn tính năng Search AI của họ trong khi vẫn giữ nguyên việc lập chỉ mục Search truyền thống - vì vậy ba mục đích này không phải lúc nào cũng có thể kiểm soát độc lập. Ở những nơi chúng được phân tách, bạn có thể từ chối việc sử dụng để đào tạo trong khi vẫn cho phép lập chỉ mục tìm kiếm và truy xuất trực tiếp để đưa bạn vào câu trả lời của AI.
Những user-agent thực tế của năm 2026 cần biết
Lời khuyên mơ hồ kiểu "chặn các bot AI" sẽ vô tác dụng nếu không có tên cụ thể. OpenAI: GPTBot (đào tạo), OAI-SearchBot (lập chỉ mục và hiển thị kiểu tìm kiếm), ChatGPT-User (truy xuất trực tiếp) - mỗi loại có một token robots.txt riêng biệt. Các crawler đã được ghi nhận của Anthropic: ClaudeBot (đào tạo), Claude-SearchBot (điều hướng và phân tích web để cải thiện chất lượng kết quả tìm kiếm của Claude), Claude-User (truy xuất trực tiếp do người dùng khởi tạo); token anthropic-ai cũ hơn đã bị hạn chế (deprecated), và Anthropic không xuất bản token robots.txt riêng biệt cho Claude Code (việc tìm nạp URL của nó không thể kiểm soát độc lập thông qua một user agent chuyên dụng). Các công cụ khác: PerplexityBot (lập chỉ mục tìm kiếm) và Perplexity-User (truy xuất trực tiếp); CCBot (Common Crawl, một tập dữ liệu mở lớn mà nhiều mô hình đã khai thác); Google, nơi Googlebot vẫn xử lý cả Search và các tính năng AI của Google, Google-Extended là một token từ chối đào tạo AI (không phải một crawler riêng biệt), và Google-CloudVertexBot là một crawler riêng biệt để truy xuất các trang web theo yêu cầu của chủ sở hữu khi khách hàng đang xây dựng các agent Vertex AI hoặc grounding; Applebot với token từ từ chối Applebot-Extended; Amazonbot, Bytespider (ByteDance), Meta-ExternalAgent (crawler đa mục đích của Meta, bao gồm đào tạo AI cũng như lập chỉ mục và cải tiến sản phẩm) và facebookexternalhit (bản xem trước liên kết Meta). Đây là một trong số các tác nhân chính và những cái tên bạn sẽ tham chiếu trong quy tắc của mình, nhưng danh sách chưa đầy đủ và liên tục thay đổi, vì vậy hãy kiểm tra tài liệu hiện tại của từng nhà cung cấp.
robots.txt thể hiện các tùy chọn ưu tiên, nhưng mang tính tự nguyện
robots.txt, một tệp văn bản thuần ở thư mục gốc tên miền của bạn, đã quản lý hành vi của crawler trong nhiều thập kỷ theo Giao thức loại trừ robot (Robots Exclusion Protocol), được chính thức hóa thành RFC 9309 vào tháng 9 năm 2022. Bạn đặt tên cho một user-agent và cho phép hoặc từ chối các đường dẫn, nhờ đó bạn có thể từ chối GPTBot trong khi vẫn giữ nguyên Googlebot. Lưu ý cốt lõi: robots.txt là một yêu cầu tự nguyện, không phải sự bắt buộc. Các crawler hoạt động chuẩn mực thường tuân thủ nó và các nhà cung cấp lớn đều công bố hỗ trợ cho các token của họ, nhưng không có gì trong giao thức thực sự ngăn cản một bot phớt lờ nó. Đây không phải là một công cụ kiểm soát bảo mật. Một hạn chế khác: robots.txt quản lý đáng tin cậy các crawler tự động (GPTBot, ClaudeBot, CCBot), nhưng các trình truy xuất trực tiếp do người dùng kích hoạt thì khác nhau. Anthropic tài liệu hóa rằng Claude-User tôn trọng nó; ChatGPT-User là một token user-agent được xuất bản, có thể nhận danh, nhưng cách các lượt truy xuất do người dùng khởi động tương tác với robots.txt là một lĩnh vực đang phát triển - hãy tham khảo tài liệu hiện tại của OpenAI để biết quy tắc chính thức, và đừng giả định rằng một lượt truy xuất do người dùng kích hoạt sẽ được chặn một cách đáng tin cậy chỉ bằng độc nhất robots.txt. Ngược lại, Cloudflare báo cáo vào tháng 8 năm 2025 rằng Perplexity liên tục truy cập vào nội dung bị chặn thông qua các user-agent không khai báo và xoay vòng IP, đồng thời hủy niêm yết nó như một bot đã được xác minh (Perplexity bác bỏ điều này). Vì vậy, đừng trông đợi hoàn toàn vào robots.txt để chặn các lượt truy xuất do người dùng kích hoạt ở mọi nơi.
Cloudflare đã bổ sung giải pháp thực thi thực tế thay vì một yêu cầu lịch sự thông thường
Vì robots.txt chỉ mang tính tự nguyện, các biện pháp kiểm soát ở cấp độ hạ tầng là rất quan trọng. Cloudflare, đơn vị đứng trước phần lớn lưu lượng truy cập web, đã có động thái cung cấp cho các chủ sở hữu trang web các quyền kiểm soát mạnh mẽ hơn đối với các AI crawler, bao gồm việc chặn nhiều AI bot theo mặc định đối với các trang web mới. Vào ngày 1 tháng 7 năm 2025, họ đã ra mắt thử nghiệm giới hạn (private beta) mô hình trả tiền cho mỗi lượt rà quét (pay-per-crawl) sử dụng phản hồi HTTP 402 (Payment Required) để các nhà vận hành có thể tính phí các công ty AI để truy cập thay vì phục vụ miễn phí, và bảng điều khiển AI Crawl Control rộng lớn hơn của họ sau đó đã chính thức ra mắt rộng rãi (general availability). Tại thời điểm ra mắt Pay Per Crawl, Cloudflare đã mô tả hướng đi tương lai là chuyển dịch sang bồi thường dựa trên mức độ sử dụng ('trả tiền cho mỗi lần suy luận'); chưa có ngày cụ thể nào được công bố - hãy kiểm tra tài liệu hiện tại của Cloudflare để nắm trạng thái. Các thông tin chi tiết ở đây thay đổi rất nhanh, nhưng điểm mấu chốt bền vững là quyền truy cập chuyển hướng từ một yêu cầu mà trang web đưa ra sang một cánh cổng thực thi mà nhà điều hành mạng kiểm soát, một thay đổi thực sự so với kỷ nguyên chỉ có robots.txt.
Sự đánh đổi, và vị trí của llms.txt ở đâu
Quyết định này là một sự đánh đổi thực chất trong kinh doanh. Việc chặn một training crawler được nhận diện sẽ giới hạn việc thu thập trong tương lai của bot đó (nó không thu hồi các bản sao đã được thu thập, cấp phép, thu được qua tập dữ liệu bên thứ ba hoặc thu lượm bởi các tác nhân ngụy trang), đây là điều quan trọng nhất đối với các nhà xuất bản và doanh nghiệp sở hữu nội dung gốc, nhưng việc chặn các trình truy xuất trực tiếp và lập chỉ mục tìm kiếm có thể trực tiếp làm giảm cơ hội nội dung của bạn được truy xuất và trích dẫn trong các câu trả lời của AI. Không có thiết lập nào là chuẩn xác cho mọi trường hợp; hãy quyết định theo từng mục đích dựa trên việc khả năng hiển thị hay bảo vệ nội dung có giá trị hơn đối với bạn. Và đừng quá thổi phồng llms.txt: đó là một quy ước đề xuất, không chính thức mà không nhà cung cấp lớn nào buộc phải tuân thủ, chỉ là một tín hiệu tùy chọn, chứ không phải một cơ chế kiểm soát hay giải pháp thay thế cho robots.txt.
- Phân tách mục đích khỏi chủ sở hữu: trình thu thập thông tin đào tạo/thu thập dữ liệu, trình lập chỉ mục tìm kiếm và trình truy xuất trực tiếp do người dùng kích hoạt là ba nhiệm vụ khác nhau, và việc chặn một công cụ không chặn các công cụ còn lại.
- Sử dụng tên user-agent thực tế, cập nhật thay vì lời khuyên "AI bot" mơ hồ, ví dụ: GPTBot, OAI-SearchBot, ChatGPT-User (OpenAI); ClaudeBot, Claude-SearchBot, Claude-User (Anthropic; token anthropic-ai cũ hơn đã bị hạn chế, và Anthropic không xuất bản token robots.txt riêng biệt cho Claude Code); PerplexityBot, Perplexity-User; CCBot; Googlebot, Google-Extended và Google-CloudVertexBot; Applebot và Applebot-Extended; Amazonbot, Bytespider, Meta-ExternalAgent, facebookexternalhit; danh sách này chưa đầy đủ và luôn thay đổi, vì vậy hãy kiểm tra tài liệu của từng nhà cung cấp.
- robots.txt (Giao thức loại trừ robot, RFC 9309, tháng 9 năm 2022) thể hiện các tùy chọn ưu tiên cho từng user-agent nhưng mang tính tự nguyện: các bot hợp tác nói chung sẽ tôn trọng điều đó, tuy nhiên đây không phải là công cụ bắt buộc hay bảo mật, và nó quản lý các crawler tự động một cách đáng tin cậy hơn so với các trình truy xuất do người dùng kích hoạt; Anthropic tài liệu hóa rằng Claude-User tôn trọng nó, trong khi ChatGPT-User là một token được xuất bản, có thể nhận dạng mà tương tác robots.txt của nó là một lĩnh vực đang phát triển (hãy kiểm tra các tài liệu hiện tại của OpenAI; đừng giả định một lượt truy xuất do người dùng kích hoạt được chặn đáng tin cậy chỉ bằng độc nhất robots.txt), và Cloudflare đã báo cáo các tác nhân của Perplexity né tránh các lượt chặn vào tháng 8 năm 2025.
- Việc chặn AI-bot mặc định của Cloudflare và mô hình pay-per-crawl của nó (bản private beta từ ngày 1 tháng 7 năm 2025, sử dụng HTTP 402, với cơ chế bồi thường dựa trên mức độ sử dụng 'trả phí cho mỗi lần suy luận' được mô tả lúc khởi đầu như một định hướng tương lai và không công bố ngày cụ thể) là sự thực thi thực chất ở cấp độ hạ tầng vượt xa robots.txt tự nguyện, rất đáng cân nhắn nếu việc bảo vệ nội dung được đặt lên hàng đầu.
- Quyết định chặn hay cho phép là một sự đánh đổi thực sự giữa việc bảo vệ nội dung và việc được trích dẫn trong các câu trả lời AI; hãy quyết định theo từng mục đích, và chỉ coi llms.txt như một tín hiệu tùy chọn, không chính thức.
