Kesiapan AI: Cara Dikutip ChatGPT dan Perplexity
Asisten AI hanya merekomendasikan situs yang bisa mereka rayapi, pahami, dan percayai. Itu tiga masalah terpisah — dan kebanyakan situs gagal minimal di satu tanpa menyadarinya.
Sebuah situs siap AI ketika mesin penjawab seperti ChatGPT, Perplexity, dan hasil AI Google bisa merayapinya, memahaminya, dan mengutipnya. Itu tiga lapisan terpisah: akses, yang dikendalikan robots.txt; pemahaman, yang digerakkan data terstruktur dan metadata; dan panduan, yang diberikan llms.txt. Setiap lapisan bisa gagal sendiri-sendiri, dan kebanyakan situs punya celah setidaknya di satu lapisan.
Mengapa ini jadi disiplin tersendiri
Porsi pertanyaan yang dulu menjadi pencarian Google kini makin banyak dijawab langsung di dalam asisten AI, dengan segelintir sumber yang dikutip. Menjadi salah satu kutipan itu adalah posisi satu yang baru. SEO klasik tetap penting, karena mesin penjawab bersandar pada indeks pencarian untuk menemukan kandidat, tetapi tumpang-tindihnya hanya sebagian: sebuah situs bisa berperingkat bagus di tautan biru namun tak terlihat di jawaban AI karena memblokir sebuah crawler dua tahun lalu, di tengah perdebatan soal data latih.
Kabar baiknya: berbeda dari SEO klasik yang penuh sinyal samar, ketiga lapisan kesiapan AI bersifat teknis dan bisa diperiksa satu per satu. Anda tidak perlu menebak-nebak posisi Anda — Anda bisa mengauditnya dalam hitungan detik, lalu memperbaikinya dalam hitungan jam.
Lapisan 1: akses. Siapa yang boleh membaca situs Anda?
Setiap sistem AI besar merayap dengan user agent bernama, dan robots.txt Anda memutuskan bot demi bot. Pembedaan krusialnya adalah untuk apa masing-masing bot. Memblokir bot pelatihan hanya memengaruhi bobot model di masa depan; memblokir bot pencarian mencoret Anda dari jawaban mesin itu hari ini juga.
| Crawler | Operator | Memblokirnya berarti |
|---|---|---|
GPTBot, OAI-SearchBot | OpenAI | ChatGPT tidak bisa membaca atau mengutip Anda |
ClaudeBot | Anthropic | Claude tidak bisa membaca atau mengutip Anda |
PerplexityBot | Perplexity | Absen dari jawaban Perplexity |
Google-Extended | Hanya pelatihan Gemini; AI Overviews tidak terpengaruh | |
CCBot | Common Crawl | Keluar dari banyak dataset pelatihan; tanpa dampak pencarian |
Luka paling umum yang dibuat sendiri: robots.txt “blokir semua bot AI” yang dipasang pada 2023 sebagai pernyataan sikap soal data latih, dan masih terpasang sekarang — padahal user agent yang sama kini menggerakkan produk pencarian. Putuskan per bot, berdasarkan fungsinya hari ini. Sintaksnya sama seperti aturan robots.txt lainnya, satu blok per user agent:
# Bot pencarian AI: izinkan agar bisa dikutip
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Bot khusus pelatihan: keputusan terpisah
User-agent: CCBot
Disallow: /
Perhatikan bahwa kedua keputusan itu independen: Anda bisa terbuka untuk bot pencarian sekaligus menolak bot pelatihan, atau sebaliknya. Yang tidak masuk akal hanyalah memblokir semuanya tanpa sadar lalu bertanya-tanya mengapa tak pernah dikutip.
Lapisan 2: pemahaman. Bisakah mesin memparse maksud Anda?
Mesin penjawab tidak membaca halaman seperti manusia. Sinyal yang paling andal mereka parse:
- Data terstruktur JSON-LD. Markup schema.org (Organization, FAQPage, Article, Product) adalah fakta terbaca mesin yang bebas tafsir, dan itulah yang paling bersih diekstrak ke dalam jawaban. Markup FAQ sangat efektif karena bentuknya memang tanya-jawab.
- Metadata yang jujur. Tag title yang spesifik, meta description yang sungguhan, URL kanonis, dan satu H1 yang jelas per halaman. Bila ini hilang, cuplikan AI jatuh ke potongan teks halaman yang sembarang.
- Konten berbentuk jawaban. Halaman yang menyatakan jawabannya di paragraf pertama akan dikutip; halaman yang menguburnya di bawah 800 kata basa-basi akan dilewati. Tabel perbandingan dan bagian FAQ ramah-ekstraksi sejak lahir.
Dari ketiganya, JSON-LD paling sering terlewat justru karena tidak kasatmata: halaman tampak sempurna bagi manusia, sementara bagi mesin ia gumpalan teks tanpa penanda. Kabar baiknya, format schema.org dalam JSON-LD hanyalah blok skrip kecil di head halaman — tidak menyentuh tampilan, tidak mengubah desain, dan bisa ditambahkan tipe halaman demi tipe halaman tanpa membongkar apa pun.
Lapisan 3: panduan. Sudahkah Anda meninggalkan peta?
File llms.txt memberi model indeks terkurasi situs Anda dalam markdown. Ia lapisan yang paling baru dan paling belum terstandar — justru karena itu ia lapisan tiga, bukan lapisan satu: kerjakan setelah akses dan pemahaman beres, bukan sebagai penggantinya. Dengan generator, urusannya selesai dalam hitungan menit dan melengkapi lingkarannya. Logika urutan ini sederhana: robots.txt menentukan siapa yang boleh masuk, data terstruktur menentukan apa yang mereka pahami, dan llms.txt menentukan ke mana mereka diarahkan lebih dulu. Peta hanya berguna bagi tamu yang sudah diizinkan lewat pintu.
Daftar periksa: perbaiki dari yang paling berdampak
- Jalankan pemeriksaan kesiapan AI pada domain Anda. Ketiga lapisan dinilai dalam sekitar sepuluh detik.
- Buka blokir crawler pencarian AI yang Anda ingin mengutip Anda. Ini perubahan tunggal berdampak terbesar, dan cuma satu suntingan robots.txt.
- Tambahkan JSON-LD ke tipe-tipe halaman kunci, mulai dari Organization di beranda dan FAQPage di mana pun Anda sungguh menjawab pertanyaan.
- Isi celah metadata yang ditandai pemeriksaan: title, description, canonical.
- Pastikan sitemap Anda valid dan dideklarasikan di robots.txt; mesin penjawab memakai indeks pencarian untuk menemukan Anda.
- Tambahkan llms.txt paling akhir, lalu jalankan ulang pemeriksaan sampai semuanya hijau.
Urutannya bukan hiasan. Percuma menyusun llms.txt yang indah kalau crawler-nya diblokir di gerbang, dan percuma memoles metadata kalau file yang menghadap mesin justru menyajikan halaman error. Kerjakan dari lapisan akses ke bawah, dan setiap langkah membuat langkah berikutnya berarti.
Apa yang bukan kesiapan AI
Ia bukan trik, dan tidak ada meta tag rahasia. Sistem yang dibangun untuk menjawab pertanyaan mengganjar hal-hal yang sama dengan yang selalu diganjar SEO teknis yang baik: halaman yang terjangkau, struktur yang tak ambigu, konten yang benar-benar menjawab sesuatu. Bedanya ada di penegakan. Pengunjung manusia memaklumi meta description yang hilang; pipeline ekstraksi langsung pindah ke sumber berikutnya. Kesiapan AI adalah higiene teknis dengan ambang toleransi yang diturunkan.
Itu juga kabar baiknya. Karena tidak ada rahasia, tidak ada pula ketergantungan pada agensi atau trik yang kedaluwarsa tiap enam bulan: seluruh daftar periksa di atas bisa Anda kerjakan sendiri dalam satu sore, dan hasilnya bertahan selama situsnya tetap dirawat dengan baik.