Panduan

robots.txt untuk Perayap AI: Resipi Benar dan Halang

Tiga resipi dan satu jadual bot demi bot untuk mengawal GPTBot, ClaudeBot, PerplexityBot dan yang lain daripada satu fail teks kecil.

Oleh Sidang editor WebDoctor·22 Julai 2026·4 min bacaan


Untuk mengawal perayap AI, tambah peraturan User-agent dan Disallow dalam fail robots.txt di root domain anda. Anda boleh menghalang setiap bot AI, menghalang latihan tetapi mengekalkan carian AI, atau membenarkan semua. Fail ini bersifat nasihat: bot yang beradab mematuhinya, tetapi ia bukan kawalan akses.

Bagaimana robots.txt mengawal perayap AI

Setiap syarikat AI mengendalikan satu atau lebih ejen bernama. Anda menyasarkannya melalui token user-agent dalam robots.txt, kemudian menentukan apa yang boleh mereka ambil. Ada tiga langkah yang berbaloi diketahui: menghalang satu bot sepenuhnya, menghalang hanya perayap latihan sambil membiarkan bot carian AI lalu, atau membiarkan semua terbuka. Resipi di bawah merangkumi ketiga-tiganya. Setiap satu masuk ke dalam satu fail di https://example.com/robots.txt.

Resipi 1: halang semua perayap AI

Ini menolak setiap ejen AI yang didokumenkan dan menambah dua token opt-out yang mengawal penggunaan untuk latihan. Tampal seadanya, atau buang bot yang anda tidak pedulikan:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Satu perkara yang patut dinyatakan dengan jelas: menghalang GPTBot menghentikan perayap latihan OpenAI, bukan carian ChatGPT (itu OAI-SearchBot) dan bukan pelayaran yang dicetus pengguna (itu ChatGPT-User). Resipi di atas merangkumi ketiga-tiganya, sebab itu setiap satu mendapat bloknya sendiri.

Resipi 2: benarkan carian AI tetapi halang latihan AI

Matlamat biasa ialah kekal kelihatan dalam enjin jawapan AI sambil menjauhkan kandungan anda daripada latihan model. Benarkan bot carian, tolak perayap dan token latihan:

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended dan Applebot-Extended ialah kunci pemisahan ini. Kedua-duanya token robots.txt, bukan perayap berasingan. Menolaknya mengeluarkan kandungan anda daripada latihan AI Gemini dan Apple, manakala Googlebot dan Applebot terus mengindeks anda untuk carian biasa.

Resipi 3: benarkan semua (lalai)

Jika anda tidak buat apa-apa, inilah keadaan sebenar. Disallow kosong membiarkan setiap perayap mengambil mana-mana laluan:

User-agent: *
Disallow:

Fail robots.txt yang tiada bermakna perkara yang sama. Anda hanya perlukan peraturan eksplisit apabila mahu menyekat sesuatu.

Perbandingan 11 perayap AI

BotSyarikatTujuanHalang untuk menghentikan…
GPTBotOpenAIMerayap untuk melatih modelLatihan atas kandungan anda
OAI-SearchBotOpenAIMenjana hasil carian ChatGPTMuncul dalam carian ChatGPT
ChatGPT-UserOpenAIPelayaran dan tindakan yang dicetus penggunaPengambilan yang dicetus pengguna dari ChatGPT
ClaudeBotAnthropicMerayap untuk melatih modelLatihan atas kandungan anda
Claude-UserAnthropicPengambilan yang dicetus penggunaPengambilan yang dicetus pengguna dari Claude
PerplexityBotPerplexityMengindeks untuk enjin jawapannyaPengindeksan dalam Perplexity
Perplexity-UserPerplexityPengambilan yang dicetus penggunaPengambilan yang dicetus pengguna dari Perplexity
Google-ExtendedGoogleToken mengawal penggunaan untuk latihan Gemini/Vertex AIPenggunaan kandungan untuk latihan Gemini/Vertex AI
Applebot-ExtendedAppleToken mengawal penggunaan untuk latihan AI ApplePenggunaan kandungan untuk latihan AI Apple
CCBotCommon CrawlMembina set data awam yang digunakan untuk latihan AIKemasukan ke dalam set data Common Crawl
BytespiderByteDance (TikTok)Perayap AIPerayapan AI oleh ByteDance

Apa yang robots.txt boleh dan tidak boleh buat

Beberapa peraturan menentukan sama ada fail anda berfungsi langsung:

  • Ia mesti berada di root domain. Perayap membaca https://example.com/robots.txt dan tiada tempat lain. Fail dalam subfolder diabaikan, dan setiap subdomain memerlukan failnya sendiri.
  • Token tidak sensitif huruf besar-kecil. GPTBot dan gptbot sepadan dengan perayap yang sama. Kekalkan ejaan yang didokumenkan demi kebolehbacaan, tetapi tidak perlu risau tentang padanan tepat.
  • Sesetengah entri ialah token, bukan perayap. Google-Extended dan Applebot-Extended tidak pernah mengambil apa-apa. Ia hanya memberi isyarat sama ada Google dan Apple boleh menggunakan kandungan yang sudah dirayap untuk latihan AI.
  • Ia nasihat, bukan tembok. robots.txt bersifat sukarela. Bot yang serius mematuhinya; ia bukan kawalan akses dan tidak akan menghentikan perayap yang memilih untuk mengabaikannya. Untuk halangan keras, gunakan peraturan firewall, pengesahan, atau penyekatan di edge mengikut user-agent dan IP.

Gandingkan dengan fail llms.txt

robots.txt menentukan siapa yang boleh merayap. Sebuah fail llms.txt melakukan tugas sebaliknya: ia menunjukkan sistem AI kepada kandungan yang anda mahu mereka baca dan fahami. Kedua-duanya berfungsi bersama, dan anda boleh membina satu dengan penjana llms.txt. Untuk melihat rupa keseluruhan tapak anda kepada perayap AI, jalankan semakan kesediaan AI.

robots.txtperayap AI

Frequently asked questions

Adakah menghalang GPTBot mengeluarkan saya daripada ChatGPT?
Tidak. GPTBot hanya mengendalikan perayapan latihan. Hasil carian ChatGPT datang daripada OAI-SearchBot, dan pelayaran yang dicetus pengguna menggunakan ChatGPT-User. Untuk kekal di luar carian ChatGPT, tolak juga OAI-SearchBot. Setiap ejen OpenAI ialah token berasingan, jadi menghalang satu tidak menghalang yang lain.
Apa beza Google-Extended dan Googlebot?
Googlebot merayap halaman untuk pengindeksan carian biasa. Google-Extended ialah token robots.txt, bukan perayap berasingan, yang mengawal sama ada kandungan anda melatih Gemini dan Vertex AI. Tolak Google-Extended untuk keluar daripada latihan AI sementara halaman anda kekal terindeks dalam Google Search.
Adakah robots.txt cukup untuk menghentikan scraping AI?
Tidak. robots.txt bersifat nasihat. Perayap yang serius mematuhinya, tetapi ia bukan kawalan akses dan tidak boleh menghentikan bot yang mengabaikan peraturan. Untuk halangan keras, gunakan kawalan pihak pelayan seperti peraturan firewall, pengesahan, atau penyekatan user-agent dan IP di edge.
Di mana fail robots.txt diletakkan?
Di root domain anda, boleh dicapai di https://example.com/robots.txt. Fail dalam subfolder diabaikan, dan setiap subdomain serta skema memerlukan failnya sendiri. Token user-agent tidak sensitif huruf besar-kecil, jadi GPTBot dan gptbot sepadan, tetapi kekalkan ejaan yang didokumenkan demi kejelasan.
Bolehkah saya menghalang perayap AI tetapi mengekalkan carian biasa?
Boleh. Perayap carian biasa seperti Googlebot dan Applebot berasingan daripada token latihan AI. Tolak Google-Extended dan Applebot-Extended untuk keluar daripada latihan AI sementara Googlebot dan Applebot terus mengindeks tapak anda untuk hasil carian biasa.

Jalankan semakan

Teruskan membaca