robots.txt untuk Crawler AI: Resep Izinkan dan Blokir
Tiga resep dan tabel bot per bot untuk mengendalikan GPTBot, ClaudeBot, PerplexityBot, dan lainnya dari satu berkas teks kecil.
Untuk mengendalikan crawler AI, tambahkan aturan User-agent dan Disallow di berkas robots.txt pada root domain Anda. Anda bisa memblokir setiap bot AI, memblokir pelatihan tetapi tetap muncul di pencarian AI, atau mengizinkan semua. Berkas ini bersifat anjuran: bot yang taat mematuhinya, tetapi ini bukan kontrol akses.
Bagaimana robots.txt mengendalikan crawler AI
Setiap perusahaan AI menjalankan satu atau beberapa agen bernama. Anda menargetkannya lewat token user-agent di robots.txt, lalu menentukan apa yang boleh mereka ambil. Ada tiga langkah yang perlu diketahui: memblokir satu bot sepenuhnya, memblokir hanya crawler pelatihan sambil membiarkan bot pencarian AI lewat, atau membiarkan semua terbuka. Resep di bawah mencakup ketiganya. Setiap resep masuk ke satu berkas di https://example.com/robots.txt.
Resep 1: blokir semua crawler AI
Ini menolak setiap agen AI yang terdokumentasi dan menambahkan dua token opt-out yang mengatur penggunaan untuk pelatihan. Tempel apa adanya, atau pangkas bot yang tidak Anda pedulikan:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Perplexity-User
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Satu hal yang perlu dinyatakan jelas: memblokir GPTBot menghentikan crawler pelatihan OpenAI, bukan pencarian ChatGPT (itu OAI-SearchBot) dan bukan penjelajahan yang dipicu pengguna (itu ChatGPT-User). Resep di atas mencakup ketiganya, itulah mengapa masing-masing punya blok sendiri.
Resep 2: izinkan pencarian AI tapi blokir pelatihan AI
Tujuan yang umum adalah tetap terlihat di mesin jawaban AI sambil menjaga konten Anda dari pelatihan model. Izinkan bot pencarian, tolak crawler dan token pelatihan:
# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Block AI training
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
Google-Extended dan Applebot-Extended adalah kunci pemisahan ini. Keduanya token robots.txt, bukan crawler terpisah. Menolaknya mengeluarkan konten Anda dari pelatihan AI Gemini dan Apple, sementara Googlebot dan Applebot tetap mengindeks Anda untuk pencarian biasa.
Resep 3: izinkan semua (default)
Jika Anda tidak melakukan apa pun, inilah keadaan sebenarnya. Disallow kosong membiarkan setiap crawler mengambil jalur mana pun:
User-agent: *
Disallow:
Berkas robots.txt yang tidak ada berarti hal yang sama. Anda hanya butuh aturan eksplisit ketika ingin membatasi sesuatu.
Perbandingan 11 crawler AI
| Bot | Perusahaan | Tujuan | Blokir untuk menghentikan… |
|---|---|---|---|
| GPTBot | OpenAI | Merayapi untuk melatih model | Pelatihan atas konten Anda |
| OAI-SearchBot | OpenAI | Menyediakan hasil pencarian ChatGPT | Muncul di pencarian ChatGPT |
| ChatGPT-User | OpenAI | Penjelajahan dan aksi yang dipicu pengguna | Pengambilan yang dipicu pengguna dari ChatGPT |
| ClaudeBot | Anthropic | Merayapi untuk melatih model | Pelatihan atas konten Anda |
| Claude-User | Anthropic | Pengambilan yang dipicu pengguna | Pengambilan yang dipicu pengguna dari Claude |
| PerplexityBot | Perplexity | Mengindeks untuk mesin jawabannya | Pengindeksan di Perplexity |
| Perplexity-User | Perplexity | Pengambilan yang dipicu pengguna | Pengambilan yang dipicu pengguna dari Perplexity |
| Google-Extended | Token pengatur penggunaan untuk pelatihan Gemini/Vertex AI | Penggunaan konten untuk pelatihan Gemini/Vertex AI | |
| Applebot-Extended | Apple | Token pengatur penggunaan untuk pelatihan AI Apple | Penggunaan konten untuk pelatihan AI Apple |
| CCBot | Common Crawl | Membangun dataset publik yang dipakai untuk pelatihan AI | Pemasukan ke dataset Common Crawl |
| Bytespider | ByteDance (TikTok) | Crawler AI | Perayapan AI oleh ByteDance |
Yang bisa dan tidak bisa dilakukan robots.txt
Beberapa aturan menentukan apakah berkas Anda berfungsi sama sekali:
- Harus berada di root domain. Crawler membaca
https://example.com/robots.txtdan tidak di tempat lain. Berkas di subfolder diabaikan, dan setiap subdomain butuh miliknya sendiri. - Token tidak peka huruf besar-kecil.
GPTBotdangptbotcocok dengan crawler yang sama. Pertahankan penulisan yang terdokumentasi demi keterbacaan, tetapi tak perlu khawatir soal kecocokan persis. - Sebagian entri adalah token, bukan crawler.
Google-ExtendeddanApplebot-Extendedtidak pernah mengambil apa pun. Keduanya hanya memberi sinyal apakah Google dan Apple boleh memakai konten yang sudah dirayapi untuk pelatihan AI. - Ini anjuran, bukan tembok. robots.txt bersifat sukarela. Bot yang serius mematuhinya; ini bukan kontrol akses dan tak akan menghentikan crawler yang memilih mengabaikannya. Untuk blokir keras, pakai aturan firewall, autentikasi, atau blokir di edge berdasarkan user-agent dan IP.
Pasangkan dengan berkas llms.txt
robots.txt menentukan siapa yang boleh merayapi. Sebuah berkas llms.txt melakukan kebalikannya: mengarahkan sistem AI ke konten yang ingin Anda tampilkan untuk dibaca dan dipahami. Keduanya bekerja bersama, dan Anda bisa membuatnya dengan generator llms.txt. Untuk melihat tampilan seluruh situs Anda di mata crawler AI, jalankan pemeriksaan kesiapan AI.