robots.txt
Website en techniek
Website en techniek
robots.txt is een bestand in de hoofdmap van je site dat crawlers vertelt welke delen ze wel en niet mogen ophalen.
Het is een instructie, geen slot: nette crawlers houden zich eraan, kwaadwillende bots niet. Je verwijst er meestal ook je sitemap in.
Een pagina blokkeren in robots.txt is niet hetzelfde als hem uit de index halen. Wil je iets echt uit de resultaten, gebruik dan een noindex-instructie en laat de crawler er juist wél bij.
In de praktijk
Een 'Disallow: /' die per ongeluk van een testomgeving mee live gaat, blokkeert je hele site. Controleer dit direct na een livegang.
Hoort hierbij
- CrawlenCrawlen is het proces waarbij een zoekmachine je pagina's ophaalt door links te volgen. Zonder crawl geen index, en zonder index geen positie.
- SitemapEen XML-sitemap is een lijst van de URL's die je geïndexeerd wilt hebben, bedoeld voor zoekmachines.
- llms.txtllms.txt is een voorgesteld tekstbestand in de hoofdmap van je site met een beknopt overzicht van je belangrijkste pagina's, bedoeld voor taalmodellen.
