AI Visibility

Quyền truy cập của AI Crawler: Kiểm soát GPTBot, ClaudeBot & những công cụ còn lại

Một làn sóng các AI crawler hiện đang truy cập trang web của bạn vì nhiều lý do khác nhau, và quyết định cho phép hay chặn chúng là một sự đánh đổi thực sự trong kinh doanh giữa việc bảo vệ nội dung và duy trì khả năng hiển thị trong các câu trả lời của AI.

Bởi , NYFTY Labs AI Content Engine

Trước đây, mạng Internet chỉ có một trình thu thập thông tin thực sự quan trọng: Googlebot. Giờ đây, một nhóm các AI crawler ngày càng đông đảo đang truy cập trang web của bạn vì nhiều lý do khác nhau, và việc quyết định ai được quyền truy cập là một lựa chọn kinh doanh có tính toán, không phải ngẫu nhiên. Bước đi cốt lõi là phân tách mục đích khỏi chủ sở hữu: một số bot thu thập dữ liệu để đào tạo mô hình, một số lập chỉ mục các trang của bạn cho các câu trả lời tìm kiếm của AI, và số khác truy xuất trang trực tiếp (live fetch) theo yêu cầu của người dùng. Chặn một công cụ không đồng nghĩa với chặn những công cụ còn lại. Đây là chân dung của các crawler thực sự năm 2026, cách robots.txt giúp bạn thể hiện tùy chọn ưu tiên (và tại sao nó chỉ là một yêu cầu tự nguyện), những gì Cloudflare đã thay đổi, cùng sự đánh đổi thực tế giữa việc bảo vệ nội dung và duy trì sự hiện diện trong các câu trả lời của AI.

AI crawler access Three jobs, training, search-index, live fetch, meet a gate Training GPTBot, ClaudeBot, CCBot Search-index OAI-SearchBot, Claude-SearchBot Live fetch ChatGPT-User, Claude-User The gate robots.txt a request, voluntary Cloudflare HTTP 402 enforced toll Your site allow, charge, block robots.txt asks; Cloudflare Pay Per Crawl can enforce with HTTP 402.
Các AI crawler thực hiện ba nhiệm vụ khác nhau gồm huấn luyện, lập chỉ mục tìm kiếm và truy xuất trực tiếp theo yêu cầu của người dùng, và tiếp cận trang web của bạn tại một cổng: robots.txt thể hiện một tùy chọn ưu tiên (tự nguyện), trong khi Cloudflare Pay Per Crawl có thể kiểm soát quyền truy cập bằng phí thu phí HTTP 402.

Ba nhiệm vụ: đào tạo (training), lập chỉ mục tìm kiếm (search-index), và truy xuất trực tiếp (live fetchers)

Sự khác biệt quan trọng nhất giữa các AI crawler không nằm ở công ty sở hữu mà ở mục đích hoạt động. Trình thu thập thông tin đào tạo hoặc thu thập dữ liệu thu gom nội dung để xây dựng hoặc cải thiện các mô hình AI. Trình lập chỉ mục tìm kiếm phân loại các trang của bạn để bạn có thể được hiển thị và trích dẫn trong các câu trả lời dạng tìm kiếm của sản phẩm AI. Các trình truy xuất trực tiếp theo yêu cầu tải một trang theo thời gian thực vì người dùng đã đặt câu hỏi hoặc nhấp vào liên kết bên trong sản phẩm AI. Những công cụ này phục vụ các mục đích khác nhau, và việc chặn một công cụ thường không giống với chặn các công cụ còn lại. Nhiều nhà cung cấp cung cấp các token riêng biệt cho mỗi mục đích, nhưng điều này không phổ biến ở khắp mọi nơi: Meta-ExternalAgent rõ ràng là đa mục đích, và Google không cung cấp token robots.txt nào để chặn tính năng Search AI của họ trong khi vẫn giữ nguyên việc lập chỉ mục Search truyền thống - vì vậy ba mục đích này không phải lúc nào cũng có thể kiểm soát độc lập. Ở những nơi chúng được phân tách, bạn có thể từ chối việc sử dụng để đào tạo trong khi vẫn cho phép lập chỉ mục tìm kiếm và truy xuất trực tiếp để đưa bạn vào câu trả lời của AI.

AI VISIBILITY 1Training bots2Search-index bots3Live fetchersBlocking one is not blocking the others NYFTYLABS
Điểm khác biệt mấu chốt nằm ở mục đích: huấn luyện, lập chỉ mục tìm kiếm và truy xuất trực tiếp theo yêu cầu là các nhiệm vụ hoàn toàn khác nhau.

Những user-agent thực tế của năm 2026 cần biết

Lời khuyên mơ hồ kiểu "chặn các bot AI" sẽ vô tác dụng nếu không có tên cụ thể. OpenAI: GPTBot (đào tạo), OAI-SearchBot (lập chỉ mục và hiển thị kiểu tìm kiếm), ChatGPT-User (truy xuất trực tiếp) - mỗi loại có một token robots.txt riêng biệt. Các crawler đã được ghi nhận của Anthropic: ClaudeBot (đào tạo), Claude-SearchBot (điều hướng và phân tích web để cải thiện chất lượng kết quả tìm kiếm của Claude), Claude-User (truy xuất trực tiếp do người dùng khởi tạo); token anthropic-ai cũ hơn đã bị hạn chế (deprecated), và Anthropic không xuất bản token robots.txt riêng biệt cho Claude Code (việc tìm nạp URL của nó không thể kiểm soát độc lập thông qua một user agent chuyên dụng). Các công cụ khác: PerplexityBot (lập chỉ mục tìm kiếm) và Perplexity-User (truy xuất trực tiếp); CCBot (Common Crawl, một tập dữ liệu mở lớn mà nhiều mô hình đã khai thác); Google, nơi Googlebot vẫn xử lý cả Search và các tính năng AI của Google, Google-Extended là một token từ chối đào tạo AI (không phải một crawler riêng biệt), và Google-CloudVertexBot là một crawler riêng biệt để truy xuất các trang web theo yêu cầu của chủ sở hữu khi khách hàng đang xây dựng các agent Vertex AI hoặc grounding; Applebot với token từ từ chối Applebot-Extended; Amazonbot, Bytespider (ByteDance), Meta-ExternalAgent (crawler đa mục đích của Meta, bao gồm đào tạo AI cũng như lập chỉ mục và cải tiến sản phẩm) và facebookexternalhit (bản xem trước liên kết Meta). Đây là một trong số các tác nhân chính và những cái tên bạn sẽ tham chiếu trong quy tắc của mình, nhưng danh sách chưa đầy đủ và liên tục thay đổi, vì vậy hãy kiểm tra tài liệu hiện tại của từng nhà cung cấp.

AI VISIBILITYOpenAI tokensGPTBot (training)OAI-SearchBot (index)ChatGPT-User (live)Anthropic tokensClaudeBot (training)Claude-SearchBot (search)Claude-User (live)vsNYFTYLABS
Mỗi nhà cung cấp cung cấp các token robots.txt riêng biệt cho từng mục đích; token anthropic-ai cũ hơn hiện đã bị ngừng hỗ trợ.

robots.txt thể hiện các tùy chọn ưu tiên, nhưng mang tính tự nguyện

robots.txt, một tệp văn bản thuần ở thư mục gốc tên miền của bạn, đã quản lý hành vi của crawler trong nhiều thập kỷ theo Giao thức loại trừ robot (Robots Exclusion Protocol), được chính thức hóa thành RFC 9309 vào tháng 9 năm 2022. Bạn đặt tên cho một user-agent và cho phép hoặc từ chối các đường dẫn, nhờ đó bạn có thể từ chối GPTBot trong khi vẫn giữ nguyên Googlebot. Lưu ý cốt lõi: robots.txt là một yêu cầu tự nguyện, không phải sự bắt buộc. Các crawler hoạt động chuẩn mực thường tuân thủ nó và các nhà cung cấp lớn đều công bố hỗ trợ cho các token của họ, nhưng không có gì trong giao thức thực sự ngăn cản một bot phớt lờ nó. Đây không phải là một công cụ kiểm soát bảo mật. Một hạn chế khác: robots.txt quản lý đáng tin cậy các crawler tự động (GPTBot, ClaudeBot, CCBot), nhưng các trình truy xuất trực tiếp do người dùng kích hoạt thì khác nhau. Anthropic tài liệu hóa rằng Claude-User tôn trọng nó; ChatGPT-User là một token user-agent được xuất bản, có thể nhận danh, nhưng cách các lượt truy xuất do người dùng khởi động tương tác với robots.txt là một lĩnh vực đang phát triển - hãy tham khảo tài liệu hiện tại của OpenAI để biết quy tắc chính thức, và đừng giả định rằng một lượt truy xuất do người dùng kích hoạt sẽ được chặn một cách đáng tin cậy chỉ bằng độc nhất robots.txt. Ngược lại, Cloudflare báo cáo vào tháng 8 năm 2025 rằng Perplexity liên tục truy cập vào nội dung bị chặn thông qua các user-agent không khai báo và xoay vòng IP, đồng thời hủy niêm yết nó như một bot đã được xác minh (Perplexity bác bỏ điều này). Vì vậy, đừng trông đợi hoàn toàn vào robots.txt để chặn các lượt truy xuất do người dùng kích hoạt ở mọi nơi.

AI VISIBILITY 1Name user-agent2Allow/disallowpaths3Bots may honor4Not enforcedA request, not a security control NYFTYLABS
robots.txt (RFC 9309) thiết lập các tùy chọn ưu tiên cho từng token, nhưng việc tuân thủ cấu hình này là tự nguyện chứ không bắt buộc.

Cloudflare đã bổ sung giải pháp thực thi thực tế thay vì một yêu cầu lịch sự thông thường

Vì robots.txt chỉ mang tính tự nguyện, các biện pháp kiểm soát ở cấp độ hạ tầng là rất quan trọng. Cloudflare, đơn vị đứng trước phần lớn lưu lượng truy cập web, đã có động thái cung cấp cho các chủ sở hữu trang web các quyền kiểm soát mạnh mẽ hơn đối với các AI crawler, bao gồm việc chặn nhiều AI bot theo mặc định đối với các trang web mới. Vào ngày 1 tháng 7 năm 2025, họ đã ra mắt thử nghiệm giới hạn (private beta) mô hình trả tiền cho mỗi lượt rà quét (pay-per-crawl) sử dụng phản hồi HTTP 402 (Payment Required) để các nhà vận hành có thể tính phí các công ty AI để truy cập thay vì phục vụ miễn phí, và bảng điều khiển AI Crawl Control rộng lớn hơn của họ sau đó đã chính thức ra mắt rộng rãi (general availability). Tại thời điểm ra mắt Pay Per Crawl, Cloudflare đã mô tả hướng đi tương lai là chuyển dịch sang bồi thường dựa trên mức độ sử dụng ('trả tiền cho mỗi lần suy luận'); chưa có ngày cụ thể nào được công bố - hãy kiểm tra tài liệu hiện tại của Cloudflare để nắm trạng thái. Các thông tin chi tiết ở đây thay đổi rất nhanh, nhưng điểm mấu chốt bền vững là quyền truy cập chuyển hướng từ một yêu cầu mà trang web đưa ra sang một cánh cổng thực thi mà nhà điều hành mạng kiểm soát, một thay đổi thực sự so với kỷ nguyên chỉ có robots.txt.

AI VISIBILITY 1AI crawlerrequest2Cloudflare gate3HTTP 402 toll4Charge or blockPay Per Crawl launched Jul 1, 2025 NYFTYLABS
Cloudflare Pay Per Crawl sử dụng HTTP 402 để các nhà vận hành trang web có thể tính phí các công ty AI thay vì cung cấp dữ liệu miễn phí cho họ.

Sự đánh đổi, và vị trí của llms.txt ở đâu

Quyết định này là một sự đánh đổi thực chất trong kinh doanh. Việc chặn một training crawler được nhận diện sẽ giới hạn việc thu thập trong tương lai của bot đó (nó không thu hồi các bản sao đã được thu thập, cấp phép, thu được qua tập dữ liệu bên thứ ba hoặc thu lượm bởi các tác nhân ngụy trang), đây là điều quan trọng nhất đối với các nhà xuất bản và doanh nghiệp sở hữu nội dung gốc, nhưng việc chặn các trình truy xuất trực tiếp và lập chỉ mục tìm kiếm có thể trực tiếp làm giảm cơ hội nội dung của bạn được truy xuất và trích dẫn trong các câu trả lời của AI. Không có thiết lập nào là chuẩn xác cho mọi trường hợp; hãy quyết định theo từng mục đích dựa trên việc khả năng hiển thị hay bảo vệ nội dung có giá trị hơn đối với bạn. Và đừng quá thổi phồng llms.txt: đó là một quy ước đề xuất, không chính thức mà không nhà cung cấp lớn nào buộc phải tuân thủ, chỉ là một tín hiệu tùy chọn, chứ không phải một cơ chế kiểm soát hay giải pháp thay thế cho robots.txt.

AI VISIBILITYBlock crawlersLimits future collectionProtects contentFor publishersAllow crawlersEnables retrievalChance to be citedFor visibilityvsNYFTYLABS
Một sự đánh đổi thực sự cần quyết định theo từng mục đích: bảo vệ dữ liệu đối lập với cơ hội được truy xuất và trích dẫn nguồn.
Những điểm mấu chốt cần lưu ý
  • Phân tách mục đích khỏi chủ sở hữu: trình thu thập thông tin đào tạo/thu thập dữ liệu, trình lập chỉ mục tìm kiếm và trình truy xuất trực tiếp do người dùng kích hoạt là ba nhiệm vụ khác nhau, và việc chặn một công cụ không chặn các công cụ còn lại.
  • Sử dụng tên user-agent thực tế, cập nhật thay vì lời khuyên "AI bot" mơ hồ, ví dụ: GPTBot, OAI-SearchBot, ChatGPT-User (OpenAI); ClaudeBot, Claude-SearchBot, Claude-User (Anthropic; token anthropic-ai cũ hơn đã bị hạn chế, và Anthropic không xuất bản token robots.txt riêng biệt cho Claude Code); PerplexityBot, Perplexity-User; CCBot; Googlebot, Google-Extended và Google-CloudVertexBot; Applebot và Applebot-Extended; Amazonbot, Bytespider, Meta-ExternalAgent, facebookexternalhit; danh sách này chưa đầy đủ và luôn thay đổi, vì vậy hãy kiểm tra tài liệu của từng nhà cung cấp.
  • robots.txt (Giao thức loại trừ robot, RFC 9309, tháng 9 năm 2022) thể hiện các tùy chọn ưu tiên cho từng user-agent nhưng mang tính tự nguyện: các bot hợp tác nói chung sẽ tôn trọng điều đó, tuy nhiên đây không phải là công cụ bắt buộc hay bảo mật, và nó quản lý các crawler tự động một cách đáng tin cậy hơn so với các trình truy xuất do người dùng kích hoạt; Anthropic tài liệu hóa rằng Claude-User tôn trọng nó, trong khi ChatGPT-User là một token được xuất bản, có thể nhận dạng mà tương tác robots.txt của nó là một lĩnh vực đang phát triển (hãy kiểm tra các tài liệu hiện tại của OpenAI; đừng giả định một lượt truy xuất do người dùng kích hoạt được chặn đáng tin cậy chỉ bằng độc nhất robots.txt), và Cloudflare đã báo cáo các tác nhân của Perplexity né tránh các lượt chặn vào tháng 8 năm 2025.
  • Việc chặn AI-bot mặc định của Cloudflare và mô hình pay-per-crawl của nó (bản private beta từ ngày 1 tháng 7 năm 2025, sử dụng HTTP 402, với cơ chế bồi thường dựa trên mức độ sử dụng 'trả phí cho mỗi lần suy luận' được mô tả lúc khởi đầu như một định hướng tương lai và không công bố ngày cụ thể) là sự thực thi thực chất ở cấp độ hạ tầng vượt xa robots.txt tự nguyện, rất đáng cân nhắn nếu việc bảo vệ nội dung được đặt lên hàng đầu.
  • Quyết định chặn hay cho phép là một sự đánh đổi thực sự giữa việc bảo vệ nội dung và việc được trích dẫn trong các câu trả lời AI; hãy quyết định theo từng mục đích, và chỉ coi llms.txt như một tín hiệu tùy chọn, không chính thức.

← Thêm hướng dẫn

FAQ

Câu hỏi của bạn, đã có lời giải.

Một trình thu thập thông tin đào tạo hoặc thu thập dữ liệu (chẳng hạn như GPTBot hoặc ClaudeBot) thu gom nội dung được sử dụng để giúp xây dựng hoặc cải thiện các mô hình AI. Một trình truy xuất trực tiếp (chẳng hạn như ChatGPT-User hoặc Claude-User) tải một trang theo thời gian thực vì người dùng đã đặt câu hỏi hoặc nhấp vào liên kết bên trong sản phẩm AI. Loại thứ ba, trình rà quét chất lượng tìm kiếm (chẳng hạn như OAI-SearchBot, Claude-SearchBot hoặc PerplexityBot), điều hướng và phân tích web để bạn có thể xuất hiện và được trích dẫn trong các câu trả lời dạng tìm kiếm của AI. Chúng phục vụ các mục đích khác nhau, và việc chặn một công cụ không chặn các công cụ còn lại, vì vậy, ví dụ, bạn có thể hạn chế sử dụng cho việc đào tạo trong khi vẫn cho phép lập chỉ mục tìm kiếm và các lượt truy xuất trực tiếp để có cơ hội được trích dẫn. Một lưu ý: robots.txt là một chốt kiểm soát đáng tin cậy đối với các crawler tự động hoạt động chuẩn mực, nhưng một số trình truy xuất do người dùng kích hoạt không tôn trọng nó một cách đáng tin cậy. Anthropic tài liệu hóa rằng Claude-User tôn trọng robots.txt; ChatGPT-User là một token user-agent được xuất bản, có thể nhận diện, nhưng cách các lượt truy xuất do người dùng khởi tạo tương tác với robots.txt là một lĩnh vực đang phát triển - hãy tham khảo tài liệu hiện tại của OpenAI để có quy tắc chính thức, và đừng giả định một lượt truy xuất do người dùng kích hoạt sẽ bị chặn một cách đáng tin cậy chỉ bằng độc nhất robots.txt. Cloudflare đã báo cáo vào tháng 8 năm 2025 rằng các tác nhân của Perplexity đã né tránh các lượt chặn, do đó việc chặn các trình truy xuất do người dùng kích hoạt sẽ ít đáng tin cậy hơn.

Nó thể hiện một yêu cầu mà các crawler hoạt động chuẩn mực thường tuân thủ, và OpenAI công bố hỗ trợ cho các token user-agent của mình cũng như các quyền kiểm soát GPTBot, OAI-SearchBot và ChatGPT-User riêng biệt. Nhưng robots.txt mang tính tự nguyện theo thiết kế; nó là một phần của Robots Exclusion Protocol (được chính thức hóa thành RFC 9309 vào tháng 9 năm 2022), tài liệu hóa quy ước này mà không thực thi nó. Không có cơ chế nào trong giao thức ngăn chặn một bot không tuân thủ bỏ qua tệp này một cách vật lý. Việc chặn GPTBot kiểm soát cụ thể crawler đào tạo của OpenAI; bản thân nó không ảnh hưởng đến OAI-SearchBot hoặc ChatGPT-User, những công cụ mà bạn kiểm soát bằng các token riêng của chúng. Vì vậy, robots.txt là công cụ phù hợp đầu tiên để nêu rõ các ưu tiên, nhưng nó không phải là một biện pháp kiểm soát bảo mật hay một sự đảm bảo.

Chúng là các token kiểm soát thay vì các crawler riêng biệt. Theo Google, Google-Extended cho phép bạn từ chối sử dụng nội dung của mình để huấn luyện các mô hình AI tạo sinh của họ (như Gemini và các tính năng tạo sinh Vertex AI của nó); Google tuyên bố rằng việc sử dụng nó không ảnh hưởng đến cách Googlebot lập chỉ mục hoặc xếp hạng các trang của bạn trong Search. Lưu ý một giới hạn quan trọng: vì Googlebot là một crawler duy nhất phục vụ cho cả Search và các tính năng AI của Google, Google-Extended kiểm soát việc huấn luyện mô hình tạo sinh nhưng không xóa các trang của bạn khỏi AI Overviews bên trong Google Search. Applebot-Extended đóng vai trò từ chối tương tự đối với việc huấn luyện mô hình AI của Apple, được xếp chồng lên trên crawler tìm kiếm Applebot thông thường, vì vậy việc chặn nó không xóa bạn khỏi các tính năng tìm kiếm của Apple. Cả hai đều cho phép bạn phân tách giữa "lập chỉ mục tôi cho tìm kiếm" và "sử dụng tôi để huấn luyện AI", đây chính xác là loại hình kiểm soát dựa trên mục đích mà chủ đề này đề cập. (Google cũng vận hành một Google-CloudVertexBot riêng biệt để truy xuất các trang web theo yêu cầu của chủ sở hữu trang khi khách hàng đang xây dựng các tác nhân Vertex AI hoặc grounding, tính năng này khác biệt với token Google-Extended.)

Đó là một sự đánh đổi kinh doanh thực sự và không có câu trả lời chung cho tất cả. Việc chặn một crawler huấn luyện được xác định sẽ giới hạn việc thu thập dữ liệu trong tương lai của bot đó, điều quan trọng nhất đối với các nhà xuất bản và doanh nghiệp sở hữu nội dung gốc, mặc dù nó không rút lại các bản sao đã được thu thập, cấp phép, có được thông qua các tập dữ liệu của bên thứ ba, hoặc được thu thập bởi các tác nhân giả dạng. Nhưng việc chặn các trình truy xuất trực tiếp (live fetchers) và crawler lập chỉ mục tìm kiếm nói riêng có thể làm giảm cơ hội bạn được truy xuất và trích dẫn khi người dùng đặt các câu hỏi liên quan trong các công cụ AI. Cách tiếp cận thực tế là quyết định theo từng mục đích: nhiều doanh nghiệp cho phép các trình truy xuất trực tiếp và theo kiểu tìm kiếm để duy trì khả năng hiển thị, đồng thời hạn chế hoặc đàm phán xung quanh các crawler huấn luyện hàng loạt.

Nó là tùy chọn và mang tính thử nghiệm, không bắt buộc. Tệp llms.txt là một quy ước được đề xuất bắt nguồn từ cộng đồng, một tệp Markdown hướng các hệ thống AI đến nội dung chính của bạn, tương tự như sitemaps về mặt tinh thần. Việc áp dụng nó có chi phí thấp, nhưng nó không phải là một tiêu chuẩn chính thức và không có nhà cung cấp AI lớn nào bắt buộc phải tuân theo. Hãy coi nó như một tín hiệu bổ sung nếu bạn muốn, chứ không phải là một cơ chế kiểm soát và không phải là sự thế chỗ cho robots.txt hoặc cho các quyết định truy cập crawler có chủ đích.

Bạn muốn giải pháp này hoạt động hiệu quả cho thương hiệu của mình?