Robots.txt, noindex og canonical brukes alle til å styre hvordan søkemotorer behandler innhold. Der likheten slutter. Robots.txt styrer om siden får leses, noindex styrer om den får vises, og canonical forteller hvilken versjon som er originalen.
Blandes de sammen, ender du enten med å blokkere noe du ville beholde, eller med å tro at noe er ute av indeksen når det ikke er det. Begge deler er vanlig, og begge deler er lette å unngå når du har mekanikken klar.
Robots.txt: får crawleren komme inn?
Robots.txt er en tekstfil på roten av domenet som forteller crawlere hvor de ikke skal gå. Den virker på forespørselsnivå: crawleren leser filen først, og lar være å hente URL-er som er utestengt.
Det sentrale poenget, og det som overrasker flest: en blokkert side kan fortsatt havne i søkeresultatet. Får Google nok signaler utenfra, typisk lenker fra andre nettsteder, kan URL-en vises uten tittel og beskrivelse, med en merknad om at innholdet ikke kunne leses.
Robots.txt er altså ikke et verktøy for hemmelighold. Den er et verktøy for å styre hvor crawleren bruker tiden sin. Bruk den til ting som interne søkeresultater, endeløse filterkombinasjoner og tunge ressurser uten verdi for søk.
Noindex: får siden vises?
Noindex er en instruks i selve siden, enten som en meta-tagg i head eller som en HTTP-header. Den sier: du kan gjerne lese meg, men ikke ta meg med i søkeresultatet.
Dette er riktig verktøy når du vil holde en side helt ute av søk. Typiske kandidater er takkesider, testsider, interne verktøy, tynne arkiver og landingssider som bare skal brukes i annonser.
Kombinasjonen noindex,follow betyr at siden ikke skal vises, men at lenkene på den fortsatt kan følges. Det er som regel det du vil ha, siden lenkene ofte peker til sider du gjerne vil at Google skal finne.
Canonical: hvilken versjon er originalen?
Canonical er en lenke i head som peker til den URL-en du mener er den offisielle versjonen av innholdet. Den brukes når det samme eller nesten det samme innholdet er tilgjengelig på flere adresser.
To ting er verdt å ha klart:
- Canonical hindrer ikke indeksering. Den samler signalene på én URL og ber Google vise den fremfor de andre.
- Canonical er et hint, ikke en ordre. Google kan velge en annen URL hvis signalene peker tydelig i en annen retning, for eksempel hvis alle interne lenker går til en annen adresse enn den du har oppgitt.
Den vanligste bruken er URL-varianter med sporingsparametre, produktvarianter, paginering og innhold som ligger under flere kategorier. Mer om dette i duplicate content i WordPress.
Den klassiske feilen
Å blokkere en side i robots.txt og samtidig sette noindex på den virker ikke. Grunnen er logisk når du ser den: noindex-instruksen står inne i siden, og Google får aldri lese siden fordi robots.txt hindret den i å hente den.
Resultatet er en side som kan ligge i søkeresultatet uten beskrivelse, og som du ikke får ut igjen fordi instruksen om å fjerne den er utilgjengelig.
Riktig rekkefølge når noe skal ut av indeksen:
- Sett noindex på siden.
- La den være crawlbar til Google har lest instruksen og fjernet siden.
- Blokker den eventuelt i robots.txt etterpå, hvis du vil spare crawl-ressurser.
Samme resonnement gjelder canonical: en blokkert side får heller ikke lest sin egen canonical.
Slik velger du riktig verktøy
Still ett spørsmål: hva er det jeg vil oppnå?
- «Denne siden skal aldri dukke opp i Google.» Noindex.
- «Dette innholdet finnes flere steder, og jeg vil at verdien skal samles ett sted.» Canonical.
- «Googlebot bruker for mye tid på sider som ikke betyr noe.» Robots.txt.
- «Ingen skal kunne se dette.» Ingen av delene. Bruk innlogging eller passordbeskyttelse.
Det siste punktet er verdt å understreke. Robots.txt er en offentlig fil som hvem som helst kan lese, og den fungerer som et skilt, ikke en lås. Skriver du inn /hemmelig-kampanje/ der, har du nettopp fortalt alle hvor den ligger.
Beslektede verktøy det er lett å blande inn
To andre ting dukker ofte opp i samme samtale:
301-redirect flytter både brukere og signaler permanent til en ny URL. Bruk den når innholdet har byttet adresse, ikke når det finnes to gyldige varianter samtidig. Se redirects i WordPress.
Fjerningsverktøyet i Search Console skjuler en URL midlertidig, i omtrent seks måneder. Det er en nødbrems når noe hastet ut av søkeresultatet, ikke en løsning. Uten noindex eller sletting kommer siden tilbake når perioden utløper.
Kort oppsummert
Robots.txt handler om tilgang, noindex om synlighet, canonical om identitet. De tre løser ulike problemer, og feilen oppstår nesten alltid når man bruker et av dem til en jobb det ikke er laget for. Bestem deg først for hva du vil oppnå, og velg verktøy etterpå.