robots.txt
Website en techniek
Website en techniek
robots.txt is een bestand in de hoofdmap van je site dat crawlers vertelt welke delen ze wel en niet mogen ophalen.
Het is een instructie, geen slot: nette crawlers houden zich eraan, kwaadwillende bots niet. Je verwijst er meestal ook je sitemap in.
Een pagina blokkeren in robots.txt is niet hetzelfde als hem uit de index halen. Wil je iets echt uit de resultaten, gebruik dan een noindex-instructie en laat de crawler er juist wél bij.
Tip
Controleer je robots.txt direct na elke livegang, zodat een 'Disallow: /' die per ongeluk vanuit een testomgeving meekomt snel wordt gecorrigeerd.
Hoort hierbij
- CrawlenCrawlen is het proces waarbij een zoekmachine je pagina's ophaalt door links te volgen. Zonder crawl geen index, en zonder index geen positie.
- SitemapEen XML-sitemap is een lijst van de URL's die je geïndexeerd wilt hebben, bedoeld voor zoekmachines.
- llms.txtllms.txt is een voorgesteld tekstbestand in de hoofdmap van je site met een beknopt overzicht van je belangrijkste pagina's, bedoeld voor taalmodellen.
