robots.txt, noindex, atau canonical: kapan memakai yang mana
Tiga alat, tiga tugas berbeda. Salah pilih, Google tetap menyimpan halaman yang ingin Anda hapus, atau bahkan tidak pernah membaca instruksi Anda.
Gunakan robots.txt untuk mengatur crawling, noindex untuk menjauhkan halaman dari hasil penelusuran, dan rel=canonical untuk memilih satu URL dari sekelompok duplikat. Ketiganya menyelesaikan masalah berbeda dan bisa saling mengganggu: halaman yang diblokir di robots.txt tetap bisa diindeks, dan Google tidak pernah melihat aturan noindex di halaman yang tidak bisa di-crawl.
Apa beda robots.txt, noindex, dan canonical?
Masing-masing bekerja di tahap yang berbeda. robots.txt menentukan apakah crawler boleh mengambil sebuah URL. noindex menentukan apakah halaman yang sudah diambil boleh muncul di hasil. Canonical memberi tahu Google halaman mana dari beberapa halaman yang hampir sama yang mewakili kelompoknya. Begini dokumentasi Google menggambarkan ketiganya berdampingan.
| Disallow di robots.txt | noindex | rel=canonical | |
|---|---|---|---|
| Mengatur | Crawling | Pengindeksan | Duplikat mana yang mewakili kelompok |
| Letaknya | File robots.txt di root situs | Tag meta robots atau header HTTP X-Robots-Tag | Elemen link di head, atau header HTTP Link |
| Menjauhkan URL dari Google? | Tidak. URL yang diblokir tetap bisa diindeks jika situs lain menautkannya | Ya, setelah Googlebot meng-crawl halaman dan membaca aturannya | Tidak. Duplikat digabungkan, bukan dihapus |
| Halaman harus di-crawl? | Tidak | Ya | Ya |
| Seberapa mengikat? | Tergantung apakah crawler mau mematuhinya | Google menghapus halaman sepenuhnya | Petunjuk, bukan aturan |
Kapan memakai robots.txt?
Saat masalahnya adalah lalu lintas crawling. Pengantar robots.txt dari Google menyebutkan bahwa file ini terutama dipakai agar situs Anda tidak kebanjiran permintaan. Untuk halaman web, robots.txt cocok dalam dua kasus: server Anda kewalahan menghadapi crawler Google, atau Anda ingin mencegah crawling halaman yang tidak penting atau mirip. File ini juga cara yang didokumentasikan untuk mencegah file gambar, video, dan audio muncul di Google Penelusuran.
Menurut Google, robots.txt bukan mekanisme untuk menjauhkan halaman web dari Google. Halaman yang diblokir tetap bisa diindeks jika situs lain menautkannya. URL dan teks anchor dari tautan itu bisa muncul di hasil, hanya saja tanpa deskripsi. Aturannya juga sukarela: Googlebot mematuhinya, crawler lain belum tentu. Periksa apa yang sebenarnya diizinkan file Anda dengan penguji robots.txt kami.
Kapan memakai noindex?
Saat sebuah halaman tidak boleh muncul di Google Penelusuran. Pasang <meta name="robots" content="noindex"> di head, atau kirim X-Robots-Tag: noindex sebagai header respons untuk file seperti PDF. Dokumentasi noindex Google menjelaskan bahwa begitu Googlebot meng-crawl halaman dan membaca aturannya, Google menghapus halaman itu sepenuhnya dari hasil, terlepas dari apakah situs lain menautkannya.
Jebakannya ada di langkah pertama itu. Google harus meng-crawl halaman untuk melihat tag meta dan header HTTP. Jika halaman masih muncul setelah noindex dipasang, dokumentasi menyebut dua kemungkinan penyebab: Google belum meng-crawl ulang, atau robots.txt memblokirnya. Alat Inspeksi URL di Search Console bisa dipakai untuk meminta crawling ulang. Google juga mencatat bahwa beberapa mesin telusur lain mungkin menafsirkan noindex secara berbeda.
Kapan tag canonical lebih tepat?
Saat konten yang sama ada di beberapa URL dan Anda ingin salah satunya mendapat semua kreditnya. Halaman Google tentang menggabungkan URL duplikat menyebut alasannya: memilih URL yang dilihat orang di hasil penelusuran, menggabungkan sinyal seperti tautan ke satu URL pilihan, mempermudah pelacakan metrik, dan tidak membuang waktu crawling untuk duplikat.
Canonical tidak menyembunyikan apa pun. Halaman kanonikalisasi Google menyebutnya petunjuk, bukan aturan, dan menjelaskan bahwa halaman kanonis di-crawl paling rutin, sedangkan duplikat lebih jarang. Hasil penelusuran biasanya mengarah ke halaman kanonis, kecuali ada duplikat yang lebih cocok untuk pencari. Pengalihan dan rel=canonical sama-sama sinyal kuat, sedangkan pencantuman di sitemap adalah sinyal lemah. Untuk file non-HTML, kirim canonical sebagai header HTTP Link. Panduan kami tentang konflik tag canonical membahas apa yang terjadi jika sinyal-sinyal itu bertentangan.
Bisakah robots.txt dan noindex dipakai bersamaan?
Tidak di URL yang sama, jika tujuannya menghapus. Google menyatakannya dengan jelas: jika halaman diblokir oleh robots.txt, crawler tidak akan pernah melihat aturan noindex, dan halaman masih bisa muncul di hasil. Jadi untuk URL terindeks yang membandel, solusinya adalah menghapus Disallow, membiarkan Google meng-crawl-nya, lalu biarkan noindex bekerja.
Halaman Google tentang URL duplikat menyebut tiga kesalahan lain yang perlu dihindari:
- Jangan memakai robots.txt untuk kanonikalisasi.
- Jangan memakai noindex untuk mengarahkan pemilihan halaman kanonis dalam satu situs, karena halaman itu jadi terblokir sepenuhnya dari Penelusuran.
- Jangan memakai alat penghapusan URL untuk kanonikalisasi, karena alat itu menyembunyikan semua versi sebuah URL.
Mana yang sebaiknya Anda pakai?
Mulailah dari hasil yang Anda inginkan, bukan dari alat yang Anda kenal.
- Server kelebihan beban, atau crawler membuang waktu di halaman yang tidak penting: robots.txt.
- Halaman tidak boleh muncul di Google: noindex, dengan crawling tetap dibuka. Untuk apa pun yang bersifat pribadi, gunakan perlindungan kata sandi, yang disebut Google sebagai pilihan lainnya.
- Konten yang sama ada di beberapa URL: rel=canonical di setiap duplikat, atau pengalihan jika duplikat itu memang tidak perlu ada.
- Gambar, video, atau audio yang ingin dijauhkan dari Google Penelusuran: robots.txt.
Jika yang Anda khawatirkan adalah crawler AI, panduan robots.txt untuk crawler AI kami berisi aturan siap salin untuk tiap bot.