Crawlability handler om hvorvidt en søkemotor kan nå og lese en side. Indeksering handler om hvorvidt den lagres og vurderes for visning i søkeresultatet. Det er to forskjellige ting, og rekkefølgen går bare én vei: en side kan være crawlbar uten å bli indeksert, men den kan ikke bli indeksert uten å ha vært crawlbar.
Skillet virker akademisk helt til noe ikke virker. Da er det forskjellen på å bruke en uke på riktig tiltak eller feil.
Hva som hindrer crawling
Crawling stopper når Googlebot ikke kommer frem til innholdet. De vanligste årsakene:
- Blokkering i robots.txt. En regel som utestenger crawleren fra en mappe eller en URL. Se robots.txt i WordPress.
- Ingen lenker inn. Sider som ikke er lenket fra noe sted og ikke ligger i sitemapet blir sjelden funnet. Dette kalles ofte foreldreløse sider.
- Innlogging eller tilgangskontroll. Googlebot logger ikke inn.
- Serverfeil og tidsavbrudd. Får crawleren 500-feil eller svært trege svar, gir den opp og prøver sjeldnere senere.
- Innhold som krever JavaScript for å eksistere. Se JavaScript SEO.
Hva som hindrer indeksering
Her er siden lest, men ikke tatt inn. Årsakene er av en helt annen type:
- Du har bedt om det. En noindex-instruks gjør nøyaktig det den skal.
- Canonical peker et annet sted. Du har fortalt Google at en annen URL er originalen.
- Google mener den er duplikat. Selv uten canonical kan Google velge en annen versjon som representant.
- For lite selvstendig innhold. Tynne sider, tomme kategorier og automatisk genererte varianter blir ofte vurdert som ikke verdt plassen.
- Funnet, men ikke prioritert. Google kjenner til siden og har valgt å vente. Dette er vanlig på nye eller store nettsteder.
Legg merke til at de fleste av disse er kvalitetsvurderinger, ikke tekniske feil. Det er en viktig forskjell: du kan ikke fikse dem med en innstilling.
Slik finner du ut hvor det stopper
URL-inspeksjon i Google Search Console er verktøyet. Lim inn en URL, og du får vite om den er indeksert, når den sist ble crawlet, hvilken canonical Google har valgt, og hvordan siden ser ut når den er rendret.
Statusmeldingene der forvirrer mange, så her er de vanligste oversatt til hva de betyr i praksis:
- «Oppdaget, men foreløpig ikke indeksert»: Google vet at siden finnes, men har ikke besøkt den. Ofte et signal om at nettstedet ditt ikke prioriteres høyt nok, eller at siden er dårlig lenket internt.
- «Gjennomsøkt, men foreløpig ikke indeksert»: Google har lest siden og valgt å ikke ta den med. Dette er nesten alltid et innholdsproblem, ikke et teknisk et.
- «Alternativ side med riktig kanonisk tag»: Fungerer som det skal. Siden er bevisst utelatt til fordel for en annen.
- «Duplikat, Google valgte en annen kanonisk enn brukeren»: Du har pekt ett sted, Google har valgt et annet. Verdt å undersøke.
- «Blokkert av robots.txt»: Rent teknisk, og som regel utilsiktet.
Rapporten «Sideindeksering» gir deg det samme bildet for hele nettstedet, gruppert etter årsak. Det er der du bør begynne hvis du mistenker at problemet gjelder mange sider.
Kolonnen «Kilde» er den mest oversette i hele rapporten, og den avgjør hva du skal gjøre. Står det Nettsted, er det du som har bestemt noe: en noindex, en viderekobling, en canonical, en 404 eller en serverfeil. Står det Google-systemer, er det Google som har vurdert og valgt.
Skillet er praktisk. Rader med kilde «Nettsted» kan du rette direkte, og de er ofte tekniske. Rader med kilde «Google-systemer», altså «gjennomsøkt» og «oppdaget», kan du ikke rette med en innstilling. Der må du gjøre sidene mer verdt å ta med, eller lenke bedre til dem internt.
Et lite forbehold om tallene: store mengder 404-feil ser dramatisk ut, men er sjelden kritisk i seg selv. En 404 er et gyldig svar på at noe ikke finnes. Det du bør sjekke er om noen av dem er URL-er som burde ha eksistert, eller som fortsatt lenkes til fra andre nettsteder. Resten kan få ligge.
Crawl-budsjett, og hvem det gjelder
Googlebot bruker begrenset tid på hvert nettsted. Hvor mye avhenger av hvor viktig nettstedet fremstår og hvor godt serveren svarer. Dette kalles gjerne crawl-budsjett.
For et nettsted med under noen tusen sider er dette sjelden et reelt problem, og det er verdt å si tydelig, fordi mange bruker tid på det uten grunn. Har du 80 sider, blir de crawlet.
Der det betyr noe er på store nettsteder, og særlig nettbutikker som genererer URL-er automatisk. Filtre, sorteringer, søkeresultater og paginering kan lage titusenvis av varianter som alle spiser av budsjettet uten å gi noe tilbake. Da havner viktige sider bakerst i køen. Se WooCommerce SEO.
Tankegangen: ikke alt bør indekseres
Et vanlig instinkt er å ville ha flest mulig sider i indeksen. Det er sjelden riktig. Sider uten selvstendig verdi trekker ned inntrykket av nettstedet som helhet og konkurrerer med dine egne viktige sider.
Still tre spørsmål om hver sidetype:
- Finnes det et søk der denne siden ville vært et godt svar?
- Har den innhold som ikke allerede finnes et annet sted hos meg?
- Ville jeg vært fornøyd om en kunde landet her fra Google?
Tre ganger nei betyr at siden bør holdes utenfor indeksen, eller helst ikke eksistere. Typiske kandidater er takkesider, interne søkeresultater, tomme tag-arkiver og tekniske varianter av sider som allerede finnes. Se kategorier og tagger.
Riktig verktøy til riktig jobb
Når du har bestemt deg for at noe skal ut, er valget av virkemiddel avgjørende. Robots.txt hindrer lesing, noindex hindrer visning, og canonical samler verdi. De løser ulike problemer og kan ikke byttes ut med hverandre. Den vanligste feilen, å blokkere en side i robots.txt og samtidig sette noindex på den, gjør at ingen av delene virker.
Forskjellen er forklart i sin helhet i robots.txt, noindex og canonical.