robots.txt untuk Perayap AI: Resipi Benar dan Halang
Tiga resipi dan satu jadual bot demi bot untuk mengawal GPTBot, ClaudeBot, PerplexityBot dan yang lain daripada satu fail teks kecil.
Untuk mengawal perayap AI, tambah peraturan User-agent dan Disallow dalam fail robots.txt di root domain anda. Anda boleh menghalang setiap bot AI, menghalang latihan tetapi mengekalkan carian AI, atau membenarkan semua. Fail ini bersifat nasihat: bot yang beradab mematuhinya, tetapi ia bukan kawalan akses.
Bagaimana robots.txt mengawal perayap AI
Setiap syarikat AI mengendalikan satu atau lebih ejen bernama. Anda menyasarkannya melalui token user-agent dalam robots.txt, kemudian menentukan apa yang boleh mereka ambil. Ada tiga langkah yang berbaloi diketahui: menghalang satu bot sepenuhnya, menghalang hanya perayap latihan sambil membiarkan bot carian AI lalu, atau membiarkan semua terbuka. Resipi di bawah merangkumi ketiga-tiganya. Setiap satu masuk ke dalam satu fail di https://example.com/robots.txt.
Resipi 1: halang semua perayap AI
Ini menolak setiap ejen AI yang didokumenkan dan menambah dua token opt-out yang mengawal penggunaan untuk latihan. Tampal seadanya, atau buang bot yang anda tidak pedulikan:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Satu perkara yang patut dinyatakan dengan jelas: menghalang GPTBot menghentikan perayap latihan OpenAI, bukan carian ChatGPT (itu OAI-SearchBot) dan bukan pelayaran yang dicetus pengguna (itu ChatGPT-User). Resipi di atas merangkumi ketiga-tiganya, sebab itu setiap satu mendapat bloknya sendiri.
Resipi 2: benarkan carian AI tetapi halang latihan AI
Matlamat biasa ialah kekal kelihatan dalam enjin jawapan AI sambil menjauhkan kandungan anda daripada latihan model. Benarkan bot carian, tolak perayap dan token latihan:
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended dan Applebot-Extended ialah kunci pemisahan ini. Kedua-duanya token robots.txt, bukan perayap berasingan. Menolaknya mengeluarkan kandungan anda daripada latihan AI Gemini dan Apple, manakala Googlebot dan Applebot terus mengindeks anda untuk carian biasa.
Resipi 3: benarkan semua (lalai)
Jika anda tidak buat apa-apa, inilah keadaan sebenar. Disallow kosong membiarkan setiap perayap mengambil mana-mana laluan:
User-agent: *
Disallow:
Fail robots.txt yang tiada bermakna perkara yang sama. Anda hanya perlukan peraturan eksplisit apabila mahu menyekat sesuatu.
Perbandingan 11 perayap AI
| Bot | Syarikat | Tujuan | Halang untuk menghentikan… |
|---|---|---|---|
| GPTBot | OpenAI | Merayap untuk melatih model | Latihan atas kandungan anda |
| OAI-SearchBot | OpenAI | Menjana hasil carian ChatGPT | Muncul dalam carian ChatGPT |
| ChatGPT-User | OpenAI | Pelayaran dan tindakan yang dicetus pengguna | Pengambilan yang dicetus pengguna dari ChatGPT |
| ClaudeBot | Anthropic | Merayap untuk melatih model | Latihan atas kandungan anda |
| Claude-User | Anthropic | Pengambilan yang dicetus pengguna | Pengambilan yang dicetus pengguna dari Claude |
| PerplexityBot | Perplexity | Mengindeks untuk enjin jawapannya | Pengindeksan dalam Perplexity |
| Perplexity-User | Perplexity | Pengambilan yang dicetus pengguna | Pengambilan yang dicetus pengguna dari Perplexity |
| Google-Extended | Token mengawal penggunaan untuk latihan Gemini/Vertex AI | Penggunaan kandungan untuk latihan Gemini/Vertex AI | |
| Applebot-Extended | Apple | Token mengawal penggunaan untuk latihan AI Apple | Penggunaan kandungan untuk latihan AI Apple |
| CCBot | Common Crawl | Membina set data awam yang digunakan untuk latihan AI | Kemasukan ke dalam set data Common Crawl |
| Bytespider | ByteDance (TikTok) | Perayap AI | Perayapan AI oleh ByteDance |
Apa yang robots.txt boleh dan tidak boleh buat
Beberapa peraturan menentukan sama ada fail anda berfungsi langsung:
- Ia mesti berada di root domain. Perayap membaca
https://example.com/robots.txtdan tiada tempat lain. Fail dalam subfolder diabaikan, dan setiap subdomain memerlukan failnya sendiri. - Token tidak sensitif huruf besar-kecil.
GPTBotdangptbotsepadan dengan perayap yang sama. Kekalkan ejaan yang didokumenkan demi kebolehbacaan, tetapi tidak perlu risau tentang padanan tepat. - Sesetengah entri ialah token, bukan perayap.
Google-ExtendeddanApplebot-Extendedtidak pernah mengambil apa-apa. Ia hanya memberi isyarat sama ada Google dan Apple boleh menggunakan kandungan yang sudah dirayap untuk latihan AI. - Ia nasihat, bukan tembok. robots.txt bersifat sukarela. Bot yang serius mematuhinya; ia bukan kawalan akses dan tidak akan menghentikan perayap yang memilih untuk mengabaikannya. Untuk halangan keras, gunakan peraturan firewall, pengesahan, atau penyekatan di edge mengikut user-agent dan IP.
Gandingkan dengan fail llms.txt
robots.txt menentukan siapa yang boleh merayap. Sebuah fail llms.txt melakukan tugas sebaliknya: ia menunjukkan sistem AI kepada kandungan yang anda mahu mereka baca dan fahami. Kedua-duanya berfungsi bersama, dan anda boleh membina satu dengan penjana llms.txt. Untuk melihat rupa keseluruhan tapak anda kepada perayap AI, jalankan semakan kesediaan AI.