Bạn có đang cho phép AI truy cập không?
Của bạn robots.txt âm thầm quyết định xem các crawler đằng sau ChatGPT, Claude, Gemini, Perplexity và các công cụ khác có được phép đọc trang web của bạn hay không. Công cụ này sẽ đối chiếu với 13 AI crawler lớn của năm 2026 và hiển thị một ma trận cho phép/chặn trực quan, phân chia rõ giữa các crawler thu thập trang để trả lời câu hỏi AI trực tiếp, các crawler chỉ thu thập dữ liệu để huấn luyện mô hình, và các crawler làm cả hai việc trên. Nhờ đó, bạn có thể phân biệt giữa việc từ chối huấn luyện và việc vô tình chặn mình khỏi các câu trả lời AI. Công cụ chạy hoàn toàn trên trình duyệt của bạn, không cần khóa API, không gửi bất kỳ dữ liệu nào cho chúng tôi.
What is AI Crawler Auditor?
AI Crawler Auditor là một công cụ miễn phí, hoạt động ngay trên trình duyệt, giúp đọc file robots.txt của trang web và hiển thị ma trận cho phép/chặn trực quan đối với 13 AI crawler lớn của năm 2026, bao gồm GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended, Googlebot, CCBot, Bytespider, Amazonbot, Amzn-SearchBot, Amzn-User, và meta-externalagent. Công cụ phân loại rõ ràng giữa crawler thu thập dữ liệu để trả lời câu hỏi AI trực tiếp và crawler chỉ thu thập dữ liệu để huấn luyện mô hình (đồng thời gắn cờ những crawler thực hiện cả hai nhiệm vụ, chẳng hạn như Amazonbot), giúp bạn biết mình đang từ chối huấn luyện hay vô tình tự chặn mình khỏi các câu trả lời AI.
Cách thức hoạt động
Nhập tên miền của bạn và công cụ sẽ thử tải file /robots.txt công khai của bạn qua HTTPS. Vì các trình duyệt chặn hầu hết các yêu cầu liên trang (cross-site requests), nếu việc tải thất bại, bạn chỉ cần mở file robots.txt của mình, sao chép và dán vào đây, kết quả phân tích hoàn toàn giống nhau.
Mọi thứ đều được phân tích trên thiết bị của bạn: user-agent đã được ghi nhận của từng AI crawler sẽ được đối chiếu với các quy tắc của bạn (gộp mọi nhóm robots.txt khớp và đánh giá mức độ ưu tiên của ký tự đại diện wildcard, terminal-$, và longest-match) rồi được đánh dấu là cho phép, cho phép một phần, hoặc bị chặn, kèm theo đề xuất bằng tiếng Anh dễ hiểu. Không có gì được tải lên và không cần khóa API.
Công cụ này dành cho ai
Dành cho chủ sở hữu trang web, nhà tiếp thị và nhà phát triển muốn xem nhanh và riêng tư xem những AI crawler nào được robots.txt của họ cho phép truy cập. Kết quả mang lại sự rõ ràng: tiếp tục cho phép các crawler truy xuất trực tiếp để bạn luôn có cơ hội được trích dẫn trong câu trả lời AI, đồng thời biến việc từ chối huấn luyện mô hình (GPTBot, Google-Extended, CCBot và các công cụ tương tự) thành một quyết định chủ động, riêng biệt thay vì một sự cố ngoài ý muốn.
Trong thực tế
Ví dụ, một phòng khám dán file robots.txt của mình vào và thấy một quy tắc Disallow chung đang chặn OAI-SearchBot và PerplexityBot – yêu cầu các crawler tuân thủ này không truy cập trang của mình. Điều này có thể làm giảm mạnh tần suất xuất hiện của phòng khám khi người dùng hỏi ChatGPT hoặc Perplexity về nhà cung cấp dịch vụ tại địa phương. (robots.txt chỉ là hướng dẫn mang tính tự nguyện: các công cụ vẫn có thể nhắc đến thương hiệu từ các nguồn đã lập chỉ mục trước đó hoặc bên thứ ba.) Ma trận hiển thị chính xác crawler nào bị chặn và tại sao, đồng thời xác nhận rằng việc tiếp tục từ chối huấn luyện đối với GPTBot là hoàn toàn ổn, trong khi các crawler truy xuất trực tiếp nên được mở lại.
Ai có thể đọc trang web của bạn, và ai bị bạn chặn ngoài cửa.
Nhập tên miền của bạn và chúng tôi sẽ thử tải file /robots.txtcủa bạn. Các trình duyệt thường chặn yêu cầu liên trang đến tệp của miền khác, vì vậy nếu việc tải thất bại, bạn chỉ cần mở file robots.txt của mình, dán vào và phân tích. Mọi thứ được phân tích ngay trên thiết bị của bạn dựa trên các user-agent đã được ghi nhận đằng sau ChatGPT, Claude, Perplexity, Google-Extended (kiểm soát việc huấn luyện và tạo cơ sở thực tế cho Gemini, chứ không phải AI Overviews), Googlebot (vận hành Google Search và AI Overviews), Common Crawl, ByteDance, Amazon, và Meta. robots.txt chỉ chi phối các bot tuân thủ quy tắc, còn nội dung đã nằm trong dữ liệu huấn luyện của mô hình từ trước thì vẫn sẽ tồn tại bất kể thế nào.
Thay vào đó, hãy dán robots.txt của bạn (sử dụng nếu trình duyệt không thể tải tự động)
Mở file robots.txt của bạn ↗, chọn tất cả, sao chép và dán vào bên dưới.
Không có gì được tải lên hoặc lưu trữ, tệp được phân tích hoàn toàn trong trình duyệt của bạn. Hãy nhớ rằng: robots.txt được tuân thủ một cách tự nguyện (các crawler lịch sự sẽ tôn trọng nó, một số khác thì bỏ qua), và nội dung đã có trong tập dữ liệu huấn luyện của mô hình vẫn sẽ ở đó bất kể ra sao. Bạn muốn chúng tôi theo dõi giúp bạn điều này? Hãy liên hệ với chúng tôi.
Câu hỏi của bạn, đã có lời giải.
Có, công cụ này hoàn toàn miễn phí, không cần đăng ký và không cần khóa API. Nó đọc các quy tắc robots.txt của bạn và hiển thị những AI crawler nào bạn cho phép hoặc chặn đứng.
Không. Công cụ này chạy hoàn toàn trên trình duyệt của bạn. Khi bạn nhập tên miền hoặc dán robots.txt, nó sẽ được phân tích cú pháp trực tiếp trên thiết bị của bạn và không bao giờ được tải lên, ghi nhật ký hoặc lưu trữ bởi chúng tôi.
Các trình duyệt chặn hầu hết các yêu cầu liên trang (cross-site requests) đến tệp của tên miền khác vì lý do bảo mật, do đó việc tải trực tiếp robots.txt thường không thành công. Khi điều đó xảy ra, bạn có thể mở robots.txt của mình, sao chép và dán vào, và công cụ sẽ phân tích nó theo cách hoàn toàn tương tự.
Nó kiểm tra các user-agent đã được tài liệu hóa của các AI crawler lớn trong năm 2026, bao gồm GPTBot và OAI-SearchBot (OpenAI), ClaudeBot và Claude-SearchBot (Anthropic), PerplexityBot, Google-Extended và Googlebot (Google), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot, Amzn-SearchBot, và Amzn-User (Amazon), cùng meta-externalagent (Meta).
Các crawler phục vụ đào tạo (như GPTBot, ClaudeBot, Google-Extended, CCBot) thu thập dữ liệu có thể được sử dụng để huấn luyện mô hình. Các crawler phục vụ tìm kiếm-truy xuất (như OAI-SearchBot, Claude-SearchBot, PerplexityBot) truy xuất các trang để trả lời các câu hỏi trực tiếp. Một số crawler, như Amazonbot, làm cả hai nhiệm vụ. Việc chặn các crawler truy xuất có thể khiến bạn không còn xuất hiện trong câu trả lời của AI ngay bây giờ, trong khi chặn các crawler chỉ phục vụ đào tạo là một lựa chọn từ chối (opt-out) riêng biệt và hoàn toàn hợp lệ.
Không. Google-Extended chỉ kiểm soát việc nội dung của bạn có được sử dụng để huấn luyện mô hình Gemini và làm cơ sở dữ liệu (grounding) hay không. AI Overviews được vận hành bởi chỉ mục Googlebot tiêu chuẩn, do đó việc chặn Google-Extended không loại bỏ bạn khỏi AI Overviews, và việc cho phép nó cũng không tự động đưa bạn vào đó.
Không. Nó báo cáo kết quả đọc robots.txt ở cấp độ trang web đối với các user-agent được tài liệu hóa. robots.txt được tuân thủ một cách tự nguyện, các quy tắc ở cấp độ đường dẫn (path-level) vẫn có thể hạn chế các phần nhất định, các bot có thể thay đổi, và nội dung đã có trong dữ liệu huấn luyện của mô hình sẽ vẫn ở đó bất kể thế nào.
