Apa Itu llms.txt dan Perlukah Laman Anda Memilikinya?
Satu fail markdown kecil di akar laman memberitahu sistem AI apa itu laman anda dan halaman mana yang penting. Inilah cara ia berfungsi dan bila ia berbaloi ditambah.
llms.txt ialah fail markdown biasa di akar laman anda yang memberitahu sistem AI apa itu laman anda dan halaman mana yang penting, dalam format yang direka khusus untuk model bahasa. Ia cadangan komuniti daripada llmstxt.org, bukan standard rasmi, tetapi kosnya hanya satu fail teks kecil dan beberapa alat AI sudah pun membacanya.
Masalah yang diselesaikannya
Apabila sebuah model bahasa mahu memahami laman anda, ia berdepan dua pilihan yang sama-sama buruk. Ia boleh merangkak HTML mentah, mengharung navigasi, sepanduk kuki dan skrip semata-mata untuk mencari isi sebenar — halaman moden yang beratus kilobait mungkin hanya mengandungi beberapa perenggan isi yang benar-benar bernilai. Atau ia boleh bergantung pada apa yang termuat dalam data latihannya, yang selalunya sudah lapuk dan langsung tidak mengetahui halaman yang anda terbitkan minggu lepas. Tetingkap konteks pula terhad: setiap token yang terbuang pada elemen hiasan ialah token yang tidak digunakan untuk kandungan anda yang sebenar.
llms.txt ialah jalan pintasnya: peta terpilih yang mesra model bahasa, yang berkata "inilah kami, dan inilah halaman yang berbaloi dibaca", dalam markdown bersih yang dihurai model secara semula jadi.
Persoalannya bukan sama ada laman anda "difahami AI" secara umum, tetapi sama ada sistem yang datang dengan belanjawan token yang kecil dapat menemui halaman yang betul dengan pantas. Itulah satu-satunya tugas fail ini, dan sebab itulah ia sengaja dibuat pendek.
Formatnya, dalam satu contoh
Keseluruhan spesifikasinya muat dalam empat peraturan. Satu tajuk # dengan nama laman (wajib). Satu petikan blok > pilihan dengan ringkasan sebaris. Prosa pilihan. Kemudian seksyen ## yang mengandungi pautan markdown, setiap satu dengan keterangan pilihan:
# CellChart
> Rujukan silang bateri butang dan bateri syiling: setiap alias,
saiz dan kesetaraan untuk 92 jenis sel.
## Keluarga bateri
- [Kesetaraan LR44](https://example.com/lr44/): semua nama
bagi LR44 dan penggantinya
- [CR2032 lawan CR2025](https://example.com/cr2032-vs-cr2025/):
dua sel syiling yang paling kerap dikelirukan
Seksyen bernama ## Optional mempunyai makna khas: model dibenarkan melangkaunya apabila ruang konteks sempit. Letakkan halaman yang wajib dibaca dalam seksyen-seksyen awal dan bahan sampingan di bawah seksyen itu.
Perhatikan juga apa yang tiada dalam contoh itu: tiada HTML, tiada metadata tersembunyi, tiada sintaks khas yang perlu dipelajari. Sesiapa yang pernah menulis fail README sudah tahu menulis llms.txt. Keterangan ringkas selepas setiap pautan itulah bahagian yang paling berbaloi diusahakan — ia menentukan sama ada model memahami mengapa sesebuah halaman penting sebelum membukanya.
llms.txt lawan robots.txt lawan sitemap.xml
Cara paling mudah memahami kedudukan llms.txt ialah meletakkannya di sebelah dua fail akar yang sudah anda kenali:
| Fail | Sasaran | Mesejnya | Format |
|---|---|---|---|
robots.txt | Semua perangkak | "Laluan ini boleh / tidak boleh dirangkak" | Arahan |
sitemap.xml | Perangkak enjin carian | "Inilah setiap halaman, selengkap-lengkapnya" | XML |
llms.txt | Model bahasa | "Inilah yang penting, dipilih rapi" | Markdown |
Ketiga-tiga fail ini saling melengkapi, bukan bersaing. robots.txt mengawal akses, peta laman mengejar kesempurnaan liputan, dan llms.txt mengejar pemilihan. Ada satu fail pengiring, llms-full.txt, yang secara pilihan memuatkan teks penuh halaman-halaman utama anda untuk model yang mahu segala-galanya dalam satu ambilan; ia paling masuk akal untuk laman dokumentasi yang kandungannya memang dibaca secara pukal, dan menambah kos penyelenggaraan, jadi mulakan tanpanya dahulu.
Gambaran penerimaan yang jujur
Berwaspadalah terhadap sesiapa yang menjual llms.txt sebagai helah kedudukan carian. Google telah menyatakan ia tidak menggunakan fail ini, dan belum ada enjin carian utama yang mengiktirafnya secara terbuka. Namun penerimaannya nyata walaupun tidak sekata: platform dokumentasi seperti Mintlify menjananya untuk beribu-ribu laman dokumentasi, syarikat seperti Anthropic dan Cloudflare menerbitkannya, dan semakin banyak alat pembangunan AI mengambil fail ini apabila ia wujud.
Bingkai yang tepat ialah insurans murah. Fail ini mengambil masa beberapa minit untuk dibina, tidak memudaratkan apa-apa, dan jika pembantu AI terus berkembang sebagai sumber trafik, laman yang mempunyai peta mesra mesin yang kemas berada di barisan hadapan. Asimetri itulah — kos yang kecil berbalas potensi yang munasabah — keseluruhan hujahnya, dan ia sudah memadai. Sejarah web sendiri penuh dengan fail kecil yang bermula sebagai konvensyen tidak rasmi sebelum menjadi kebiasaan; robots.txt bertahan berdekad-dekad tanpa status standard rasmi, dan hari ini tiada siapa membina laman tanpanya.
Kesilapan biasa
Kebanyakan fail llms.txt yang gagal semakan jatuh ke dalam lima perangkap yang sama, dan kesemuanya mudah dielakkan:
- Mencurahkan setiap URL. Itu tugas peta laman. llms.txt dengan 5,000 pautan sama sahaja gunanya kepada model seperti tiada fail langsung. Pilih 10 hingga 30 halaman sahaja — tanya diri anda halaman mana yang anda mahu dibaca dahulu oleh pembantu AI, dan itulah senarainya.
- Lokasi yang salah. Fail ini mesti berada di akar laman:
https://domainanda.com/llms.txt. Subdirektori bukan sebahagian daripada cadangan ini dan alat AI hanya menyemak akar. - Menyajikan HTML. Sesetengah hos menghalakan laluan yang tidak dikenali ke halaman ralat berstatus 200. Alat AI kemudiannya menghurai halaman 404 anda sebagai keterangan laman anda. Semak apa yang sebenarnya dikembalikan oleh URL itu.
- Keterangan yang kabur. "Sumber berguna" tidak memberitahu model apa-apa. "Polisi luput bagi 14 jenama kerusi keselamatan kereta, disahkan terus daripada halaman pengeluar" — itulah yang membuatkan anda dipetik dengan tepat.
- Menulis sekali dan melupakannya. Pautan mati dalam fail menghantar model ke halaman 404. Jana semula apabila halaman utama berubah.
Cara menambahnya dalam lima minit
Penjana llms.txt percuma kami membaca peta laman dan metadata halaman anda lalu menyusun fail itu untuk anda; semak hasilnya, sunting apa yang kurang tepat, dan muat naik di sebelah robots.txt. Kemudian jalankan semakan kesediaan AI untuk mengesahkan fail itu boleh dicapai dan sah, sambil melihat keseluruhan permukaan laman anda yang berdepan AI (peraturan robots.txt, data berstruktur) pada masa yang sama.
Satu nota penyelenggaraan terakhir: layan llms.txt seperti anda melayan peta laman — jana semula apabila struktur kandungan berubah, dan semak semula selepas penghijrahan atau reka bentuk semula. Oleh sebab failnya kecil dan senarainya pendek, semakan sekali-sekala hanya mengambil masa seminit.