robots.txt, noindex atau canonical: bila guna yang mana
Tiga alat, tiga tugas berbeza. Tersilap pilih, Google terus menyimpan halaman yang anda mahu buang, atau langsung tidak membaca arahan anda.
Gunakan robots.txt untuk mengawal perangkakan, noindex untuk menjauhkan halaman daripada hasil carian, dan rel=canonical untuk memilih satu URL daripada sekumpulan pendua. Ketiga-tiganya menyelesaikan masalah berbeza dan boleh saling mengganggu: halaman yang disekat dalam robots.txt masih boleh diindeks, dan Google tidak pernah nampak peraturan noindex pada halaman yang tidak boleh dirangkak.
Apakah beza robots.txt, noindex dan canonical?
Setiap satu bertindak pada peringkat berbeza. robots.txt menentukan sama ada perangkak boleh mengambil sesuatu URL. noindex menentukan sama ada halaman yang sudah diambil boleh muncul dalam hasil. Canonical memberitahu Google halaman mana antara beberapa halaman yang hampir serupa patut mewakili kumpulannya. Begini dokumentasi Google menerangkan ketiga-tiganya sebelah-menyebelah.
| Disallow dalam robots.txt | noindex | rel=canonical | |
|---|---|---|---|
| Mengawal | Perangkakan | Pengindeksan | Pendua mana yang mewakili kumpulan |
| Di mana letaknya | Fail robots.txt di akar laman | Tag meta robots atau pengepala HTTP X-Robots-Tag | Elemen link dalam head, atau pengepala HTTP Link |
| Menjauhkan URL daripada Google? | Tidak. URL yang disekat masih boleh diindeks jika laman lain memautkannya | Ya, sebaik Googlebot merangkak halaman dan membaca peraturannya | Tidak. Pendua digabungkan, bukan dibuang |
| Halaman perlu dirangkak? | Tidak | Ya | Ya |
| Sejauh mana ia mengikat? | Terpulang kepada setiap perangkak untuk mematuhinya | Google membuang halaman sepenuhnya | Petunjuk, bukan peraturan |
Bila perlu guna robots.txt?
Apabila masalahnya ialah trafik perangkakan. Pengenalan robots.txt oleh Google menyatakan fail ini digunakan terutamanya untuk mengelakkan laman anda dibebani permintaan. Bagi halaman web, ia sesuai dalam dua keadaan: pelayan anda tidak mampu menampung perangkak Google, atau anda mahu mengelakkan perangkakan halaman yang tidak penting atau serupa. Ia juga cara yang didokumenkan untuk menghalang fail imej, video dan audio daripada muncul dalam Carian Google.
Menurut Google, robots.txt bukan mekanisme untuk menjauhkan halaman web daripada Google. Halaman yang disekat masih boleh diindeks jika laman lain memautkannya. URL dan teks sauh daripada pautan itu boleh muncul dalam hasil, cuma tanpa penerangan. Peraturannya juga sukarela: Googlebot mematuhinya, perangkak lain mungkin tidak. Semak apa yang sebenarnya dibenarkan oleh fail anda dengan penguji robots.txt kami.
Bila perlu guna noindex?
Apabila sesuatu halaman tidak boleh muncul dalam Carian Google. Letakkan <meta name="robots" content="noindex"> dalam head, atau hantar X-Robots-Tag: noindex sebagai pengepala respons untuk fail seperti PDF. Dokumentasi noindex Google menerangkan bahawa sebaik Googlebot merangkak halaman dan mengekstrak peraturannya, Google membuang halaman itu sepenuhnya daripada hasil, tidak kira sama ada laman lain memautkannya.
Perangkapnya ada pada langkah pertama itu. Google perlu merangkak halaman untuk melihat tag meta dan pengepala HTTP. Jika halaman masih muncul selepas noindex ditambah, dokumentasi menyebut dua punca yang mungkin: Google belum merangkaknya semula, atau robots.txt menyekatnya. Alat Pemeriksaan URL dalam Search Console boleh digunakan untuk meminta perangkakan semula. Google juga menyatakan bahawa sesetengah enjin carian lain mungkin mentafsir noindex secara berbeza.
Bila tag canonical pilihan yang lebih baik?
Apabila kandungan yang sama berada di beberapa URL dan anda mahu salah satunya mendapat semua kredit. Halaman Google tentang menggabungkan URL pendua menyenaraikan sebabnya: memilih URL yang dilihat orang dalam hasil carian, menggabungkan isyarat seperti pautan ke satu URL pilihan, memudahkan penjejakan metrik, dan tidak membazir masa perangkakan pada pendua.
Canonical tidak menyembunyikan apa-apa. Halaman pengkanonan Google menyebutnya petunjuk, bukan peraturan, dan menyatakan halaman kanonik dirangkak paling kerap manakala pendua dirangkak kurang kerap. Hasil carian biasanya menghala ke halaman kanonik, kecuali ada pendua yang lebih sesuai untuk pencari. Ubah hala dan rel=canonical kedua-duanya isyarat kuat, manakala kemasukan dalam sitemap ialah isyarat lemah. Untuk fail bukan HTML, hantar canonical sebagai pengepala HTTP Link. Panduan kami tentang konflik tag canonical menerangkan apa yang berlaku apabila isyarat-isyarat itu bercanggah.
Bolehkah robots.txt dan noindex digunakan bersama?
Bukan pada URL yang sama, jika tujuannya untuk membuang. Google menyatakannya dengan jelas: jika halaman disekat oleh robots.txt, perangkak tidak akan pernah nampak peraturan noindex, dan halaman masih boleh muncul dalam hasil. Jadi untuk URL terindeks yang degil, penyelesaiannya ialah membuang Disallow, membiarkan Google merangkaknya, dan membiarkan noindex berfungsi.
Halaman Google tentang URL pendua menyebut tiga lagi kesilapan yang perlu dielakkan:
- Jangan guna robots.txt untuk pengkanonan.
- Jangan guna noindex untuk mengemudi pemilihan halaman kanonik dalam satu laman, kerana ia menyekat halaman itu sepenuhnya daripada Carian.
- Jangan guna alat pengalihan keluar URL untuk pengkanonan, kerana ia menyembunyikan semua versi sesuatu URL.
Yang mana patut anda guna?
Mulakan daripada hasil yang anda mahu, bukan daripada alat yang anda kenal.
- Pelayan terbeban, atau perangkak membazir masa pada halaman yang tidak penting: robots.txt.
- Halaman tidak boleh muncul dalam Google: noindex, dengan perangkakan dibiarkan terbuka. Untuk apa-apa yang peribadi, perlindungan kata laluan, yang disebut Google sebagai pilihan satu lagi.
- Kandungan yang sama berada di beberapa URL: rel=canonical pada setiap pendua, atau ubah hala jika pendua itu memang tidak perlu wujud.
- Imej, video atau audio yang mahu dijauhkan daripada Carian Google: robots.txt.
Jika perangkak AI yang membimbangkan anda, panduan robots.txt untuk perangkak AI kami ada peraturan sedia salin untuk setiap bot.