Alat diagnostik

Penguji robots.txt

Muat robots.txt sebuah situs atau tempel milik Anda sendiri, masukkan URL, lalu pilih crawler. Anda mendapat putusan yang jelas, baris persis yang menentukannya, dan pengujian yang sama untuk dua belas crawler besar sekaligus.

Token crawler apa pun bisa dipakai, jadi ketik saja sendiri kalau crawler yang Anda butuhkan tidak ada di daftar.

Aturan yang Anda tempel dicocokkan sepenuhnya di browser Anda. Mengambil robots.txt dari sebuah domain lewat server kami hanya mengunduh satu file publik itu, dan tidak ada yang disimpan.

Cara pencocokan robots.txt bekerja sesungguhnya

File robots.txt adalah kumpulan grup. Setiap grup diawali satu baris User-agent atau lebih dan memuat aturan Allow serta Disallow untuk crawler tersebut. Sebuah crawler hanya membaca grup yang cocok dengan token produknya sendiri, ditambah grup umum bila tidak ada grup bernama yang pas, sehingga aturan yang ditulis untuk Googlebot sama sekali tidak berlaku bagi GPTBot.

Ketika beberapa aturan dalam satu grup sama-sama cocok dengan satu URL, yang paling spesifik menang: aturan yang polanya mencocokkan jumlah karakter terbanyak. Jika Allow dan Disallow sama panjang, Allow yang menang. Urutan itu berasal dari RFC 9309, Robots Exclusion Protocol yang sudah distandarkan, dan itulah sebabnya Disallow: /admin/ ditambah Allow: /admin/public/ membuat folder publik tetap bisa dirayapi.

Ada dua wildcard yang didukung di dalam pola. Tanda bintang mewakili rangkaian karakter apa pun, dan tanda dolar mengunci pola di akhir URL. Path bersifat case sensitive, nama crawler tidak, dan satu robots.txt hanya mengatur skema, host, serta port miliknya sendiri, sehingga file di subdomain www tidak mencakup domain tanpa www.

Apa yang dilaporkan penguji ini

  • Putusan untuk crawler yang Anda pilih, lengkap dengan aturan persis dan nomor barisnya
  • URL yang sama diuji ke dua belas crawler sekaligus, bot mesin pencari dan bot AI berdampingan
  • Grup mana yang cocok, termasuk apakah itu grup bernama atau grup umum
  • Setiap baris Sitemap yang dideklarasikan di dalam file
  • Peringatan parsing: aturan yang ditulis sebelum baris User-agent mana pun, direktif yang tidak didukung, URL absolut di Disallow, Sitemap yang hilang

Pemeriksa Kesiapan AI

Bisakah ChatGPT, Claude, dan Perplexity membaca serta mengutip situs Anda? Memeriksa llms.txt, aturan crawler AI di robots.txt, data terstruktur, dan metadata.

Cek kesiapan AI →

Dari blog

Semua panduan →

Frequently asked questions

Apakah memblokir halaman di robots.txt menghapusnya dari Google?
Tidak. Aturan Disallow menghentikan perayapan, bukan pengindeksan. Google tetap bisa menampilkan URL yang diblokir jika menemukannya lewat tautan, hanya saja tanpa deskripsi. Agar sebuah halaman benar-benar keluar dari hasil pencarian, izinkan perayapannya dan pasang tag noindex di meta robots pada halaman itu.
Kenapa aturan Disallow saya tidak bekerja?
Biasanya ada aturan yang lebih panjang yang mengalahkannya. Pencocokan ditentukan oleh panjang pola, bukan urutan baris, dan Allow menang saat panjangnya seri. Huruf besar kecil juga berpengaruh: /Blog/ dan /blog/ adalah path yang berbeda. Uji URL persisnya di sini lalu baca aturan yang disebut penguji sebagai pemenang.
Apakah crawl-delay dipatuhi?
Tidak oleh Google, yang mengabaikan direktif ini sepenuhnya dan meminta pemilik situs mengatur laju perayapan lewat setelan tersendiri. Bing dan Yandex secara historis menghormatinya. Membiarkannya di file Anda tidak merugikan, tetapi jangan mengandalkannya untuk mengendalikan Googlebot.
Bisakah saya menaruh noindex di robots.txt?
Di Google itu tidak berpengaruh. Dukungan untuk direktif noindex tidak resmi di robots.txt berakhir pada 1 September 2019. Gunakan tag noindex di meta robots atau header HTTP X-Robots-Tag pada halaman yang ingin Anda jauhkan dari hasil pencarian.
Apakah satu robots.txt mencakup subdomain saya?
Tidak. File itu hanya berlaku untuk satu skema, satu host, dan satu port. Blog di blog.example.com butuh robots.txt sendiri di blog.example.com/robots.txt, dan versi https sebuah situs diperlakukan terpisah dari versi http.