robots.txt
Även känt som: Robots exclusion protocol
En textfil i webbplatsens rot som talar om för sökmotorernas robotar vilka delar av sajten de får eller inte får crawla.
robots.txt är en enkel textfil som placeras i domänens rot (till exempel dindoman.se/robots.txt) och läses av sökmotorernas crawlers innan de börjar hämta sidor. Med direktiven User-agent, Disallow och Allow kan du styra vilka robotar som får besöka vilka delar av sajten och hänvisa till din XML-sitemap.
Filen används främst för att spara crawlbudget och hålla ovidkommande sidor — som admin-vyer, sökresultat eller dubbletter — utanför crawlningen. Viktigt att förstå: robots.txt hindrar crawling men inte nödvändigtvis indexering. Vill du garanterat hålla en sida ur sökresultaten används i stället meta-taggen noindex.
På moderna sajter används robots.txt också för att styra AI-crawlers (som GPTBot och ClaudeBot). Filen är offentlig, så lägg aldrig hemlig information där — den avslöjar tvärtom vilka kataloger du helst vill dölja.
Fördjupning på denna.se
Relaterade termer
Canonical-URL
En HTML-tagg som talar om för sökmotorer vilken URL som är originalet när samma innehåll finns på flera adresser — motverkar duplicerat innehåll.
DNS
Internets telefonkatalog — systemet som översätter domännamn (dinsajt.se) till IP-adresser (195.85.222.44) som datorer använder för att kommunicera.
