Panduan

robots.txt, noindex atau canonical: bila guna yang mana

Tiga alat, tiga tugas berbeza. Tersilap pilih, Google terus menyimpan halaman yang anda mahu buang, atau langsung tidak membaca arahan anda.

Oleh Sidang editor WebDoctor·6 Oktober 2026·4 min bacaan


Gunakan robots.txt untuk mengawal perangkakan, noindex untuk menjauhkan halaman daripada hasil carian, dan rel=canonical untuk memilih satu URL daripada sekumpulan pendua. Ketiga-tiganya menyelesaikan masalah berbeza dan boleh saling mengganggu: halaman yang disekat dalam robots.txt masih boleh diindeks, dan Google tidak pernah nampak peraturan noindex pada halaman yang tidak boleh dirangkak.

Apakah beza robots.txt, noindex dan canonical?

Setiap satu bertindak pada peringkat berbeza. robots.txt menentukan sama ada perangkak boleh mengambil sesuatu URL. noindex menentukan sama ada halaman yang sudah diambil boleh muncul dalam hasil. Canonical memberitahu Google halaman mana antara beberapa halaman yang hampir serupa patut mewakili kumpulannya. Begini dokumentasi Google menerangkan ketiga-tiganya sebelah-menyebelah.

Disallow dalam robots.txtnoindexrel=canonical
MengawalPerangkakanPengindeksanPendua mana yang mewakili kumpulan
Di mana letaknyaFail robots.txt di akar lamanTag meta robots atau pengepala HTTP X-Robots-TagElemen link dalam head, atau pengepala HTTP Link
Menjauhkan URL daripada Google?Tidak. URL yang disekat masih boleh diindeks jika laman lain memautkannyaYa, sebaik Googlebot merangkak halaman dan membaca peraturannyaTidak. Pendua digabungkan, bukan dibuang
Halaman perlu dirangkak?TidakYaYa
Sejauh mana ia mengikat?Terpulang kepada setiap perangkak untuk mematuhinyaGoogle membuang halaman sepenuhnyaPetunjuk, bukan peraturan

Bila perlu guna robots.txt?

Apabila masalahnya ialah trafik perangkakan. Pengenalan robots.txt oleh Google menyatakan fail ini digunakan terutamanya untuk mengelakkan laman anda dibebani permintaan. Bagi halaman web, ia sesuai dalam dua keadaan: pelayan anda tidak mampu menampung perangkak Google, atau anda mahu mengelakkan perangkakan halaman yang tidak penting atau serupa. Ia juga cara yang didokumenkan untuk menghalang fail imej, video dan audio daripada muncul dalam Carian Google.

Menurut Google, robots.txt bukan mekanisme untuk menjauhkan halaman web daripada Google. Halaman yang disekat masih boleh diindeks jika laman lain memautkannya. URL dan teks sauh daripada pautan itu boleh muncul dalam hasil, cuma tanpa penerangan. Peraturannya juga sukarela: Googlebot mematuhinya, perangkak lain mungkin tidak. Semak apa yang sebenarnya dibenarkan oleh fail anda dengan penguji robots.txt kami.

Bila perlu guna noindex?

Apabila sesuatu halaman tidak boleh muncul dalam Carian Google. Letakkan <meta name="robots" content="noindex"> dalam head, atau hantar X-Robots-Tag: noindex sebagai pengepala respons untuk fail seperti PDF. Dokumentasi noindex Google menerangkan bahawa sebaik Googlebot merangkak halaman dan mengekstrak peraturannya, Google membuang halaman itu sepenuhnya daripada hasil, tidak kira sama ada laman lain memautkannya.

Perangkapnya ada pada langkah pertama itu. Google perlu merangkak halaman untuk melihat tag meta dan pengepala HTTP. Jika halaman masih muncul selepas noindex ditambah, dokumentasi menyebut dua punca yang mungkin: Google belum merangkaknya semula, atau robots.txt menyekatnya. Alat Pemeriksaan URL dalam Search Console boleh digunakan untuk meminta perangkakan semula. Google juga menyatakan bahawa sesetengah enjin carian lain mungkin mentafsir noindex secara berbeza.

Bila tag canonical pilihan yang lebih baik?

Apabila kandungan yang sama berada di beberapa URL dan anda mahu salah satunya mendapat semua kredit. Halaman Google tentang menggabungkan URL pendua menyenaraikan sebabnya: memilih URL yang dilihat orang dalam hasil carian, menggabungkan isyarat seperti pautan ke satu URL pilihan, memudahkan penjejakan metrik, dan tidak membazir masa perangkakan pada pendua.

Canonical tidak menyembunyikan apa-apa. Halaman pengkanonan Google menyebutnya petunjuk, bukan peraturan, dan menyatakan halaman kanonik dirangkak paling kerap manakala pendua dirangkak kurang kerap. Hasil carian biasanya menghala ke halaman kanonik, kecuali ada pendua yang lebih sesuai untuk pencari. Ubah hala dan rel=canonical kedua-duanya isyarat kuat, manakala kemasukan dalam sitemap ialah isyarat lemah. Untuk fail bukan HTML, hantar canonical sebagai pengepala HTTP Link. Panduan kami tentang konflik tag canonical menerangkan apa yang berlaku apabila isyarat-isyarat itu bercanggah.

Bolehkah robots.txt dan noindex digunakan bersama?

Bukan pada URL yang sama, jika tujuannya untuk membuang. Google menyatakannya dengan jelas: jika halaman disekat oleh robots.txt, perangkak tidak akan pernah nampak peraturan noindex, dan halaman masih boleh muncul dalam hasil. Jadi untuk URL terindeks yang degil, penyelesaiannya ialah membuang Disallow, membiarkan Google merangkaknya, dan membiarkan noindex berfungsi.

Halaman Google tentang URL pendua menyebut tiga lagi kesilapan yang perlu dielakkan:

  • Jangan guna robots.txt untuk pengkanonan.
  • Jangan guna noindex untuk mengemudi pemilihan halaman kanonik dalam satu laman, kerana ia menyekat halaman itu sepenuhnya daripada Carian.
  • Jangan guna alat pengalihan keluar URL untuk pengkanonan, kerana ia menyembunyikan semua versi sesuatu URL.

Yang mana patut anda guna?

Mulakan daripada hasil yang anda mahu, bukan daripada alat yang anda kenal.

  • Pelayan terbeban, atau perangkak membazir masa pada halaman yang tidak penting: robots.txt.
  • Halaman tidak boleh muncul dalam Google: noindex, dengan perangkakan dibiarkan terbuka. Untuk apa-apa yang peribadi, perlindungan kata laluan, yang disebut Google sebagai pilihan satu lagi.
  • Kandungan yang sama berada di beberapa URL: rel=canonical pada setiap pendua, atau ubah hala jika pendua itu memang tidak perlu wujud.
  • Imej, video atau audio yang mahu dijauhkan daripada Carian Google: robots.txt.

Jika perangkak AI yang membimbangkan anda, panduan robots.txt untuk perangkak AI kami ada peraturan sedia salin untuk setiap bot.

PengindeksanSEO teknikal

Frequently asked questions

Adakah menyekat halaman dalam robots.txt membuangnya daripada Google?
Tidak. Google menyatakan robots.txt bukan mekanisme untuk menjauhkan halaman web daripada Google. Halaman yang disekat masih boleh diindeks jika laman lain memautkannya, dan URL-nya boleh muncul dalam hasil tanpa penerangan. Untuk menjauhkannya, guna noindex dan biarkan perangkakan dibenarkan.
Kenapa halaman noindex saya masih ada dalam Google?
Dokumentasi Google memberi dua sebab yang mungkin. Sama ada Google belum merangkak semula halaman sejak peraturan ditambah, atau robots.txt menyekat perangkak sehingga noindex tidak pernah dilihat. Buang sebarang Disallow untuk URL itu, kemudian minta perangkakan semula melalui alat Pemeriksaan URL dalam Search Console.
Patutkah halaman pendua diberi noindex dan bukan canonical?
Google tidak mengesyorkannya. Panduan URL pendua Google menyatakan bahawa menggunakan noindex untuk menghalang pemilihan halaman kanonik dalam satu laman akan menyekat halaman itu sepenuhnya daripada Carian. rel=canonical atau ubah hala sebaliknya menggabungkan pendua ke satu URL pilihan dan menyatukan isyarat seperti pautan.
Adakah Google sentiasa mengikut tag canonical?
Tidak. Google menyebut keutamaan kanonik sebagai petunjuk, bukan peraturan, dan memilih halaman kanonik sendiri daripada isyarat yang dikumpul semasa pengindeksan. Ubah hala dan rel=canonical ialah isyarat kuat, manakala kemasukan dalam sitemap isyarat lemah, jadi halakan ketiga-tiganya ke URL yang sama.

Jalankan semakan

Teruskan membaca