Kesediaan AI: Cara Dipetik oleh ChatGPT dan Perplexity
Pembantu AI hanya mengesyorkan laman yang boleh dirangkak, dihurai dan dipercayainya. Itu tiga masalah yang berasingan, dan kebanyakan laman gagal sekurang-kurangnya satu tanpa disedari.
Sesebuah laman dikira sedia AI apabila enjin jawapan seperti ChatGPT, Perplexity dan hasil AI Google boleh merangkaknya, memahaminya dan memetiknya. Itu tiga lapisan yang berasingan: akses, yang dikawal oleh robots.txt; pemahaman, yang dipacu oleh data berstruktur dan metadata; dan panduan, yang disediakan oleh llms.txt. Setiap lapisan boleh gagal secara berasingan, dan kebanyakan laman mempunyai sekurang-kurangnya satu lompang. Berita baiknya: ketiga-tiganya boleh disemak dalam beberapa saat dan dibetulkan dalam satu petang.
Mengapa ia menjadi disiplin tersendiri
Semakin banyak soalan yang dahulunya carian Google kini dijawab terus di dalam pembantu AI, dengan segelintir sumber yang dipetik. Menjadi salah satu petikan itu ialah kedudukan pertama yang baharu. SEO klasik tetap penting, kerana enjin jawapan bersandar pada indeks carian untuk mencari calon, tetapi pertindihannya tidak penuh: sesebuah laman boleh mendapat kedudukan yang baik dalam pautan biru tetapi tetap halimunan kepada jawapan AI kerana ia menyekat satu perangkak dua tahun lalu semasa perdebatan tentang data latihan.
Perbezaan kedua ialah bentuk hasilnya. Dalam carian klasik, kedudukan kesepuluh masih menerima sedikit klik; dalam jawapan AI, sumber yang tidak dipetik langsung tidak wujud bagi pengguna berkenaan. Permainannya jauh lebih binari, dan sebab itulah lompang teknikal yang kecil membawa akibat yang tidak sepadan besarnya.
Lapisan 1: akses. Siapa yang boleh membaca laman anda?
Setiap sistem AI utama merangkak dengan ejen pengguna yang bernama, dan robots.txt anda membuat keputusan bot demi bot. Perbezaan yang paling kritikal ialah tujuan setiap bot. Menyekat bot latihan hanya menjejaskan pemberat model masa hadapan; menyekat bot carian menyingkirkan anda daripada jawapan enjin itu hari ini juga. OpenAI, misalnya, sengaja mengasingkan bot latihannya (GPTBot) daripada bot cariannya (OAI-SearchBot) supaya pemilik laman boleh memilih satu tanpa yang lain.
| Perangkak | Pengendali | Kesan menyekatnya |
|---|---|---|
GPTBot, OAI-SearchBot | OpenAI | ChatGPT tidak boleh membaca atau memetik anda |
ClaudeBot | Anthropic | Claude tidak boleh membaca atau memetik anda |
PerplexityBot | Perplexity | Tiada dalam jawapan Perplexity |
Google-Extended | Hanya latihan Gemini; AI Overviews tidak terjejas | |
CCBot | Common Crawl | Terkeluar daripada banyak set data latihan; tiada kesan carian |
Luka paling lazim yang dibuat sendiri: robots.txt "sekat semua bot AI" yang ditambah pada 2023 sebagai kenyataan sikap tentang data latihan, dan masih terpasang sekarang sedangkan ejen pengguna yang sama sudah menjadi tulang belakang produk carian. Buat keputusan bagi setiap bot, berdasarkan fungsinya pada hari ini. Ingat juga bahawa robots.txt ialah dokumen awam: sesiapa sahaja boleh melihat bot mana yang anda sekat, jadi tiada sebab untuk meneka-neka status laman anda sendiri.
Lapisan 2: pemahaman. Bolehkah mesin menghurai maksud anda?
Enjin jawapan tidak membaca halaman seperti manusia. Isyarat yang paling boleh diharap dihurainya:
- Data berstruktur JSON-LD. Penanda schema.org (Organization, FAQPage, Article, Product) ialah fakta mesra mesin yang tidak berdwimakna, dan itulah yang paling bersih diekstrak ke dalam jawapan. Penanda FAQ paling berkesan kerana bentuknya memang soal jawab.
- Metadata yang jujur. Tag title yang spesifik, meta description yang sebenar, URL kanonikal dan satu H1 yang jelas pada setiap halaman. Apabila semua ini tiada, cebisan jawapan AI berundur kepada teks halaman yang sembarangan.
- Kandungan berbentuk jawapan. Halaman yang menyatakan jawapannya dalam perenggan pertama akan dipetik; halaman yang menanamnya di bawah 800 patah kata mukadimah akan dilangkau. Jadual perbandingan dan seksyen FAQ memang mesra pengekstrakan dari segi binaannya.
Ujian pantas untuk lapisan ini: buka halaman terpenting anda dan tanya sama ada perenggan pertamanya, dibaca secara berasingan, menjawab soalan yang membawa pelawat ke situ. Kemudian lihat sumber halaman dan cari blok <script type="application/ld+json">. Jika kedua-duanya tiada, mesin sedang meneka maksud anda — dan tekaan jarang dipetik.
Lapisan 3: panduan. Adakah anda meninggalkan peta?
Fail llms.txt memberi model satu indeks terpilih laman anda dalam markdown. Ia lapisan yang paling baharu dan paling kurang standard, dan sebab itulah ia lapisan ketiga dan bukannya pertama: lakukannya selepas akses dan pemahaman sudah betul, bukan sebagai ganti kedua-duanya. Ia juga lapisan yang paling murah dibetulkan: tiada perubahan templat, tiada penghijrahan — hanya satu fail teks di akar laman. Ia mengambil masa beberapa minit dengan penjana dan melengkapkan keseluruhan rantaian.
Senarai semak: betulkan mengikut turutan
- Jalankan semakan kesediaan AI pada domain anda. Ia menskor ketiga-tiga lapisan dalam kira-kira sepuluh saat.
- Buka sekatan terhadap perangkak carian AI yang anda mahu memetik anda. Ini perubahan tunggal berimpak paling tinggi, dan ia cuma satu suntingan robots.txt.
- Tambah JSON-LD pada jenis halaman utama anda, bermula dengan Organization di halaman utama dan FAQPage di mana-mana anda benar-benar menjawab soalan.
- Isi lompang metadata yang ditandakan semakan: title, description, kanonikal.
- Pastikan peta laman anda sah dan diisytiharkan dalam robots.txt; enjin jawapan menggunakan indeks carian untuk menemui anda.
- Tambah llms.txt paling akhir, dan jalankan semula semakan untuk mengesahkan semuanya hijau.
Turutannya disengajakan: akses dahulu, kerana tanpa akses tiada apa-apa lagi yang penting; pemahaman kedua, kerana itulah yang menentukan sama ada anda dipetik dengan tepat; dan panduan paling akhir, kerana llms.txt hanya berguna kepada sistem yang sudah pun boleh masuk.
Apa yang bukan kesediaan AI
Ia bukan helah, dan tiada tag meta rahsia. Sistem yang dibina untuk menjawab soalan mengganjari perkara yang sama yang selama ini diganjari SEO teknikal yang baik: halaman yang boleh dicapai, struktur yang tidak berdwimakna, kandungan yang benar-benar menjawab sesuatu. Bezanya pada penguatkuasaan. Pelawat manusia bertolak ansur dengan meta description yang tiada; saluran pengekstrakan terus sahaja berpindah ke sumber seterusnya. Kesediaan AI ialah kebersihan teknikal dengan toleransi yang direndahkan.
Kerja ini juga tidak perlu diulang dari kosong setiap kali. Selepas pusingan pembetulan yang pertama, kekalkan rutin yang sama seperti peta laman: semak semula selepas setiap perubahan besar, dan sekali setiap suku tahun selain itu. Landskap perangkak akan terus berubah; laman yang menyemak secara berkala menyesuaikan diri dalam hitungan minit, bukan bulan.