Alat diagnostik

Penguji robots.txt

Muatkan robots.txt sesebuah laman atau tampal milik anda sendiri, masukkan URL dan pilih perangkak. Anda dapat keputusan yang jelas, baris tepat yang menentukannya, dan ujian yang sama dijalankan serentak terhadap dua belas perangkak utama.

Mana-mana token perangkak boleh digunakan, jadi taipkan sendiri jika perangkak yang anda perlukan tiada dalam senarai.

Peraturan yang ditampal dipadankan sepenuhnya dalam pelayar anda. Pengambilan robots.txt daripada sesuatu domain melalui pelayan kami hanya untuk memuat turun satu fail awam itu, dan tiada apa-apa yang disimpan.

Bagaimana padanan robots.txt sebenarnya berfungsi

Fail robots.txt ialah satu himpunan kumpulan. Setiap kumpulan bermula dengan satu atau lebih baris User-agent dan mengandungi peraturan Allow serta Disallow yang terpakai untuk perangkak berkenaan. Sesebuah perangkak hanya membaca kumpulan yang sepadan dengan token produknya sendiri, ditambah kumpulan umum jika tiada kumpulan bernama yang sesuai, jadi peraturan yang ditulis untuk Googlebot langsung tidak memberi kesan kepada GPTBot.

Apabila beberapa peraturan dalam satu kumpulan sepadan dengan URL yang sama, yang paling khusus menang: peraturan yang coraknya memadankan bilangan aksara paling banyak. Jika Allow dan Disallow sama panjang, Allow yang menang. Susunan itu datang daripada RFC 9309, iaitu Robots Exclusion Protocol yang diseragamkan, dan itulah sebabnya Disallow: /admin/ bersama Allow: /admin/public/ membiarkan folder public kekal boleh dirangkak.

Dua kad liar disokong dalam corak. Tanda bintang mewakili sebarang rentetan aksara, manakala tanda dolar menambat corak pada hujung URL. Laluan sensitif kepada huruf besar dan kecil, nama perangkak tidak, dan satu robots.txt hanya mengawal skema, hos serta port miliknya sendiri, jadi fail pada subdomain www tidak meliputi domain tanpa www.

Apa yang dilaporkan oleh penguji ini

  • Keputusan bagi perangkak yang anda pilih, lengkap dengan peraturan tepat dan nombor barisnya
  • URL yang sama diuji terhadap dua belas perangkak serentak, bot carian dan bot AI bersebelahan
  • Kumpulan yang sepadan, termasuk sama ada ia kumpulan bernama atau kumpulan umum
  • Setiap baris Sitemap yang diisytiharkan dalam fail
  • Amaran penghuraian: peraturan yang ditulis sebelum sebarang baris User-agent, arahan yang tidak disokong, URL mutlak dalam Disallow, Sitemap yang tiada

Penyemak Kesediaan AI

Bolehkah ChatGPT, Claude dan Perplexity membaca serta memetik laman anda? Menyemak llms.txt, peraturan perangkak AI dalam robots.txt, data berstruktur dan metadata.

Semak kesediaan AI →

Daripada blog

Semua panduan →

Frequently asked questions

Adakah menyekat halaman dalam robots.txt mengeluarkannya daripada Google?
Tidak. Peraturan Disallow menghentikan perangkakan, bukan pengindeksan. Google masih boleh menyenaraikan URL yang disekat jika ia menemuinya melalui pautan, cuma tanpa perihalan. Untuk mengeluarkan halaman daripada hasil carian, benarkan perangkakan dan gunakan tag meta robots noindex pada halaman itu sendiri.
Mengapa peraturan Disallow saya tidak berkesan?
Biasanya ada peraturan yang lebih panjang mengatasinya. Padanan dibuat mengikut panjang corak, bukan susunan dalam fail, dan Allow menang apabila panjangnya sama. Huruf besar dan kecil juga penting: /Blog/ dan /blog/ ialah laluan berbeza. Uji URL sebenar di sini dan baca peraturan yang dinamakan penguji ini sebagai pemenang.
Adakah crawl-delay dipatuhi?
Tidak oleh Google, yang mengabaikan arahan itu sepenuhnya dan meminta pemilik laman menggunakan tetapan kadar perangkakan. Bing dan Yandex secara sejarahnya menghormatinya. Membiarkannya dalam fail anda tidak merugikan, tetapi jangan bergantung padanya untuk mengawal Googlebot.
Bolehkah saya letak noindex dalam robots.txt?
Ia tidak memberi apa-apa kesan pada Google. Sokongan untuk arahan noindex tidak rasmi dalam robots.txt tamat pada 1 September 2019. Gunakan tag meta robots noindex atau pengepala HTTP X-Robots-Tag pada halaman yang anda mahu jauhkan daripada hasil carian.
Adakah satu robots.txt meliputi semua subdomain saya?
Tidak. Fail itu terpakai untuk satu skema, hos dan port sahaja. Blog di blog.example.com memerlukan robots.txt tersendiri di blog.example.com/robots.txt, dan versi https sesebuah laman dianggap berasingan daripada versi http.