Panduan

robots.txt untuk Crawler AI: Resep Izinkan dan Blokir

Tiga resep dan tabel bot per bot untuk mengendalikan GPTBot, ClaudeBot, PerplexityBot, dan lainnya dari satu berkas teks kecil.

Oleh Redaksi WebDoctor·22 Juli 2026·4 menit baca


Untuk mengendalikan crawler AI, tambahkan aturan User-agent dan Disallow di berkas robots.txt pada root domain Anda. Anda bisa memblokir setiap bot AI, memblokir pelatihan tetapi tetap muncul di pencarian AI, atau mengizinkan semua. Berkas ini bersifat anjuran: bot yang taat mematuhinya, tetapi ini bukan kontrol akses.

Bagaimana robots.txt mengendalikan crawler AI

Setiap perusahaan AI menjalankan satu atau beberapa agen bernama. Anda menargetkannya lewat token user-agent di robots.txt, lalu menentukan apa yang boleh mereka ambil. Ada tiga langkah yang perlu diketahui: memblokir satu bot sepenuhnya, memblokir hanya crawler pelatihan sambil membiarkan bot pencarian AI lewat, atau membiarkan semua terbuka. Resep di bawah mencakup ketiganya. Setiap resep masuk ke satu berkas di https://example.com/robots.txt.

Resep 1: blokir semua crawler AI

Ini menolak setiap agen AI yang terdokumentasi dan menambahkan dua token opt-out yang mengatur penggunaan untuk pelatihan. Tempel apa adanya, atau pangkas bot yang tidak Anda pedulikan:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-User
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Perplexity-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Satu hal yang perlu dinyatakan jelas: memblokir GPTBot menghentikan crawler pelatihan OpenAI, bukan pencarian ChatGPT (itu OAI-SearchBot) dan bukan penjelajahan yang dipicu pengguna (itu ChatGPT-User). Resep di atas mencakup ketiganya, itulah mengapa masing-masing punya blok sendiri.

Resep 2: izinkan pencarian AI tapi blokir pelatihan AI

Tujuan yang umum adalah tetap terlihat di mesin jawaban AI sambil menjaga konten Anda dari pelatihan model. Izinkan bot pencarian, tolak crawler dan token pelatihan:

# Allow AI search engines
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Block AI training
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Google-Extended dan Applebot-Extended adalah kunci pemisahan ini. Keduanya token robots.txt, bukan crawler terpisah. Menolaknya mengeluarkan konten Anda dari pelatihan AI Gemini dan Apple, sementara Googlebot dan Applebot tetap mengindeks Anda untuk pencarian biasa.

Resep 3: izinkan semua (default)

Jika Anda tidak melakukan apa pun, inilah keadaan sebenarnya. Disallow kosong membiarkan setiap crawler mengambil jalur mana pun:

User-agent: *
Disallow:

Berkas robots.txt yang tidak ada berarti hal yang sama. Anda hanya butuh aturan eksplisit ketika ingin membatasi sesuatu.

Perbandingan 11 crawler AI

BotPerusahaanTujuanBlokir untuk menghentikan…
GPTBotOpenAIMerayapi untuk melatih modelPelatihan atas konten Anda
OAI-SearchBotOpenAIMenyediakan hasil pencarian ChatGPTMuncul di pencarian ChatGPT
ChatGPT-UserOpenAIPenjelajahan dan aksi yang dipicu penggunaPengambilan yang dipicu pengguna dari ChatGPT
ClaudeBotAnthropicMerayapi untuk melatih modelPelatihan atas konten Anda
Claude-UserAnthropicPengambilan yang dipicu penggunaPengambilan yang dipicu pengguna dari Claude
PerplexityBotPerplexityMengindeks untuk mesin jawabannyaPengindeksan di Perplexity
Perplexity-UserPerplexityPengambilan yang dipicu penggunaPengambilan yang dipicu pengguna dari Perplexity
Google-ExtendedGoogleToken pengatur penggunaan untuk pelatihan Gemini/Vertex AIPenggunaan konten untuk pelatihan Gemini/Vertex AI
Applebot-ExtendedAppleToken pengatur penggunaan untuk pelatihan AI ApplePenggunaan konten untuk pelatihan AI Apple
CCBotCommon CrawlMembangun dataset publik yang dipakai untuk pelatihan AIPemasukan ke dataset Common Crawl
BytespiderByteDance (TikTok)Crawler AIPerayapan AI oleh ByteDance

Yang bisa dan tidak bisa dilakukan robots.txt

Beberapa aturan menentukan apakah berkas Anda berfungsi sama sekali:

  • Harus berada di root domain. Crawler membaca https://example.com/robots.txt dan tidak di tempat lain. Berkas di subfolder diabaikan, dan setiap subdomain butuh miliknya sendiri.
  • Token tidak peka huruf besar-kecil. GPTBot dan gptbot cocok dengan crawler yang sama. Pertahankan penulisan yang terdokumentasi demi keterbacaan, tetapi tak perlu khawatir soal kecocokan persis.
  • Sebagian entri adalah token, bukan crawler. Google-Extended dan Applebot-Extended tidak pernah mengambil apa pun. Keduanya hanya memberi sinyal apakah Google dan Apple boleh memakai konten yang sudah dirayapi untuk pelatihan AI.
  • Ini anjuran, bukan tembok. robots.txt bersifat sukarela. Bot yang serius mematuhinya; ini bukan kontrol akses dan tak akan menghentikan crawler yang memilih mengabaikannya. Untuk blokir keras, pakai aturan firewall, autentikasi, atau blokir di edge berdasarkan user-agent dan IP.

Pasangkan dengan berkas llms.txt

robots.txt menentukan siapa yang boleh merayapi. Sebuah berkas llms.txt melakukan kebalikannya: mengarahkan sistem AI ke konten yang ingin Anda tampilkan untuk dibaca dan dipahami. Keduanya bekerja bersama, dan Anda bisa membuatnya dengan generator llms.txt. Untuk melihat tampilan seluruh situs Anda di mata crawler AI, jalankan pemeriksaan kesiapan AI.

robots.txtcrawler AI

Frequently asked questions

Apakah memblokir GPTBot menghapus saya dari ChatGPT?
Tidak. GPTBot hanya menangani perayapan pelatihan. Hasil pencarian ChatGPT berasal dari OAI-SearchBot, dan penjelajahan yang dipicu pengguna memakai ChatGPT-User. Agar keluar dari pencarian ChatGPT, tolak juga OAI-SearchBot. Setiap agen OpenAI adalah token terpisah, jadi memblokir satu tidak memblokir yang lain.
Apa beda Google-Extended dan Googlebot?
Googlebot merayapi halaman untuk pengindeksan pencarian biasa. Google-Extended adalah token robots.txt, bukan crawler terpisah, yang mengatur apakah konten Anda melatih Gemini dan Vertex AI. Tolak Google-Extended untuk keluar dari pelatihan AI sementara halaman Anda tetap terindeks di Google Search.
Apakah robots.txt cukup untuk menghentikan scraping AI?
Tidak. robots.txt bersifat anjuran. Crawler yang serius mematuhinya, tetapi ini bukan kontrol akses dan tak bisa menghentikan bot yang mengabaikan aturan. Untuk blokir keras, gunakan kontrol sisi server seperti aturan firewall, autentikasi, atau blokir user-agent dan IP di edge.
Di mana berkas robots.txt diletakkan?
Di root domain Anda, dapat diakses di https://example.com/robots.txt. Berkas di subfolder diabaikan, dan setiap subdomain serta skema butuh miliknya sendiri. Token user-agent tidak peka huruf besar-kecil, jadi GPTBot dan gptbot cocok, tetapi pertahankan penulisan terdokumentasi demi kejelasan.
Bisakah saya memblokir crawler AI tapi tetap muncul di pencarian biasa?
Bisa. Crawler pencarian biasa seperti Googlebot dan Applebot terpisah dari token pelatihan AI. Tolak Google-Extended dan Applebot-Extended untuk keluar dari pelatihan AI, sementara Googlebot dan Applebot tetap mengindeks situs Anda untuk hasil pencarian biasa.

Jalankan pemeriksaan

Lanjutkan membaca