Apa Itu llms.txt dan Perlukah Situs Anda Memilikinya?
Satu file markdown kecil di root situs memberi tahu sistem AI apa isi situs Anda dan halaman mana yang penting. Beginilah cara kerjanya — dan kapan ia layak dipasang.
llms.txt adalah file markdown polos di root situs yang memberi tahu sistem AI apa isi situs Anda dan halaman mana yang penting, dalam format yang memang dirancang untuk model bahasa. Ia adalah proposal komunitas dari llmstxt.org — bukan standar resmi — tetapi biayanya hanya satu file teks kecil, dan sejumlah alat AI sudah membacanya hari ini.
Masalah yang diselesaikannya
Ketika sebuah model bahasa ingin memahami situs Anda, pilihannya sama-sama buruk. Ia bisa merayapi HTML mentah — berkubang di antara menu navigasi, banner cookie, dan skrip demi menemukan isi yang sebenarnya. Atau ia mengandalkan apa yang sempat terekam dalam data latihnya, yang sering kali sudah basi. Jendela konteks itu terbatas: setiap token yang terbuang untuk boilerplate adalah token yang tidak dipakai untuk konten Anda yang sesungguhnya.
llms.txt adalah jalan pintasnya: peta terkurasi yang ramah LLM, yang berkata “inilah kami, dan inilah halaman-halaman yang layak dibaca”, dalam markdown bersih yang diparse model secara natif. Analogi paling dekatnya adalah halaman “mulai dari sini” yang ditulis untuk mesin: bukan pengganti konten Anda, melainkan pintu masuk yang menghemat pekerjaan model sebelum sampai ke konten itu.
Formatnya, dalam satu contoh
Seluruh spesifikasinya muat dalam empat aturan — dan pilihan markdown-nya disengaja: format ini ringan, mudah dibaca manusia yang menyuntingnya, dan sudah menjadi “bahasa ibu” model bahasa modern. Satu heading # berisi nama situs (wajib). Blockquote > opsional berisi ringkasan satu baris. Prosa bebas opsional. Lalu bagian-bagian ## berisi tautan markdown, masing-masing dengan deskripsi singkat:
# CellChart
> Referensi silang baterai kancing dan koin: semua alias,
ukuran, dan padanan untuk 92 jenis sel.
## Keluarga baterai
- [Padanan LR44](https://example.com/lr44/): semua nama
untuk LR44 dan apa penggantinya
- [CR2032 vs CR2025](https://example.com/cr2032-vs-cr2025/):
dua sel koin yang paling sering tertukar
Bagian bernama ## Optional punya makna khusus: model boleh melewatinya saat konteks sedang sempit. Letakkan halaman wajib-baca di bagian-bagian awal dan materi pelengkap di sana.
llms.txt vs robots.txt vs sitemap.xml
| File | Pembaca | Pesannya | Format |
|---|---|---|---|
robots.txt | Semua crawler | “Path ini boleh / tidak boleh dirayapi” | Direktif |
sitemap.xml | Crawler mesin pencari | “Ini semua halaman, selengkap-lengkapnya” | XML |
llms.txt | Model bahasa | “Ini yang penting, sudah dikurasi” | Markdown |
Ketiganya saling melengkapi. robots.txt mengatur akses, sitemap mengejar kelengkapan, llms.txt mengejar kurasi. Ada pula file pendampingnya, llms-full.txt, yang secara opsional menyalin isi lengkap halaman-halaman kunci Anda ke dalam satu file untuk model yang ingin mengambil semuanya sekali jalan; mulailah tanpa itu dulu.
Potret adopsi apa adanya
Curigai siapa pun yang menjual llms.txt sebagai trik peringkat. Google sudah menyatakan tidak memakai file ini, dan belum ada mesin pencari besar yang berkomitmen padanya secara terbuka. Adopsinya nyata tetapi tidak merata: platform dokumentasi seperti Mintlify menghasilkannya untuk ribuan situs docs, perusahaan seperti Anthropic dan Cloudflare menerbitkannya, dan makin banyak alat pengembangan AI yang mengambilnya bila tersedia.
Bingkai yang tepat adalah asuransi murah. File ini selesai dibuat dalam hitungan menit, tidak merugikan apa pun, dan jika asisten AI terus tumbuh sebagai sumber trafik, situs yang punya peta bersih yang terbaca mesin berada di posisi terdepan. Asimetri itu — biaya sekecil-kecilnya melawan peluang yang masuk akal — adalah keseluruhan argumennya, dan itu sudah cukup.
Jadi, perlukah situs Anda memilikinya?
Untuk sebagian besar situs, jawabannya: ya, dengan ekspektasi yang benar. Kandidat yang paling diuntungkan adalah situs dokumentasi, situs referensi, alat daring, dan bisnis yang sering menjadi bahan pertanyaan ke asisten AI — situs yang isinya memang layak dikutip. Yang paling sedikit diuntungkan adalah situs yang kontennya sepenuhnya di balik login atau yang justru tidak ingin dibaca sistem AI; untuk kasus terakhir, alatnya adalah aturan per-bot di robots.txt, bukan llms.txt. Dan yang perlu diluruskan: file ini bukan mekanisme kontrol akses. Ia tidak bisa melarang apa pun — ia hanya menunjukkan arah. Anggap saja begini: kalau ada sistem yang akan membaca situs Anda dengan atau tanpa peta, lebih baik ia membaca dengan peta yang Anda tulis sendiri.
Kesalahan umum
Karena formatnya begitu sederhana, hampir semua llms.txt yang bermasalah gagal bukan di sintaks, melainkan di penilaian — memperlakukannya sebagai sitemap kedua, atau menulisnya sekali lalu tak pernah menoleh lagi. Lima pola yang paling sering kami temukan:
- Menumpahkan semua URL. Itu tugas sitemap. llms.txt berisi 5.000 tautan sama bergunanya bagi model dengan tidak punya file sama sekali. Kurasi 10 sampai 30 halaman.
- Lokasi salah. File ini tinggal di root:
https://domainanda.com/llms.txt. Subdirektori bukan bagian dari proposal, dan alat-alat hanya memeriksa root. - Menyajikan HTML. Sebagian host mengarahkan path tak dikenal ke halaman error berstatus 200. Alat AI lalu memparse halaman 404 Anda sebagai deskripsi situs. Periksa apa yang benar-benar dikembalikan URL itu.
- Deskripsi yang kabur. “Sumber daya bermanfaat” tidak memberi tahu model apa pun. “Kebijakan kedaluwarsa 14 merek kursi mobil anak, diverifikasi terhadap halaman produsen” — itulah yang membuat Anda dikutip dengan akurat.
- Sekali tulis lalu dilupakan. Tautan mati di dalam file mengirim model ke halaman 404. Regenerasi setiap kali halaman kunci berubah.
Cara membuatnya dalam lima menit
Menulisnya manual sah-sah saja — ini cuma file teks — tetapi lebih cepat memakai generator llms.txt gratis kami: ia membaca sitemap dan metadata halaman Anda lalu merakit file-nya untuk Anda. Tinjau hasilnya, sunting deskripsi yang terasa kurang pas, buang halaman yang tidak layak masuk, dan unggah bersebelahan dengan robots.txt di root situs.
Langkah terakhir, verifikasi. Jalankan pemeriksaan kesiapan AI untuk memastikan file-nya benar-benar terjangkau di URL yang tepat, mengembalikan markdown polos alih-alih halaman error, dan lolos pemeriksaan format — sekaligus melihat seluruh permukaan situs Anda yang menghadap AI (aturan robots.txt, data terstruktur, metadata) dalam sekali jalan. Lima menit untuk membuat, sepuluh detik untuk memverifikasi, dan satu pengingat di kalender untuk meregenerasinya saat halaman kunci berubah: itulah keseluruhan biaya kepemilikannya.