Lær SEO uten snarveier

Loggfilanalyse, et avansert men nyttig verktøy

Serverloggen viser nøyaktig hva Googlebot har gjort på nettstedet ditt. Slik leser du den, og slik vurderer du om det er verdt innsatsen.

Loggfilanalyse går ut på å lese serverens egne rådata over hva som har besøkt nettstedet. Hver eneste forespørsel legger igjen en linje: hvem som spurte, hvilken URL, når, hvilken svarkode og hvor mange byte som ble sendt.

Det er den eneste kilden som viser hva søkemotorene reelt sett har gjort hos deg. Alt annet er rapporter, utvalg og estimater. Dette er kvitteringen.

Hva loggen kan svare på som ingen andre kan

Search Console er et godt verktøy, men det viser et bearbeidet utvalg med noen dagers forsinkelse, og det viser bare Google. Loggfilen viser alt, umiddelbart og fullstendig.

Spørsmål bare loggen svarer presist på:

  • Hvilke URL-er har Googlebot besøkt, og hvor ofte?
  • Hvilke viktige sider har den ikke besøkt på flere måneder?
  • Hvor mye av kapasiteten går til sider uten verdi?
  • Hvilke svarkoder får boten, og fra hvilke deler av nettstedet?
  • Hvor lang tid tar serveren å svare når boten spør?
  • Hvor raskt ble nye sider oppdaget etter publisering?
  • Hvilke andre boter bruker ressursene dine?

Det nest siste punktet er verdt å merke seg. Tiden fra publisering til første crawl er en ærlig indikator på hvor høyt Google prioriterer nettstedet ditt, og den kan du følge over tid.

Hva du trenger

Du trenger tilgang til rå tilgangslogger fra serveren, typisk i Apache- eller Nginx-format. På et vanlig norsk webhotell ligger de gjerne under et loggområde i kontrollpanelet, eller du må be leverandøren om dem.

Tre ting å avklare før du går i gang:

  1. Hvor lenge oppbevares de? Mange steder rulleres loggene etter noen uker. Vil du analysere over tid, må du hente ut jevnlig.
  2. Ligger det en CDN eller proxy foran? Da kan trafikken være logget der i stedet, og serverloggen viser bare et utvalg.
  3. Hva sier personvernreglene? Logger inneholder IP-adresser, som er personopplysninger. Behandlingen må ha et grunnlag, og du bør ikke lagre dem lenger enn nødvendig.

Verifiser botene før du analyserer

Dette steget hoppes ofte over, og da blir hele analysen feil. Hvem som helst kan oppgi at de er Googlebot i user agent-feltet, og mange skrapere gjør nettopp det for å slippe unna sperrer.

Den riktige måten å verifisere på er å slå opp IP-adressen bakover til et vertsnavn, sjekke at det tilhører Google, og deretter slå det opp forover igjen. Google publiserer også lister over sine egne IP-områder, som er enklere å bruke i praksis.

Gjør du ikke dette, kan du ende med å konkludere med at Google elsker en side som i virkeligheten bare blir skrapet av en konkurrent.

Hva du typisk finner

Erfaringsmessig dukker de samme mønstrene opp:

Kapasiteten går til søppel. Filterkombinasjoner, sorteringsparametre, interne søkeresultater og paginering uten ende. På store nettbutikker er det ikke uvanlig at flertallet av crawlene går til URL-er som aldri skal rangere.

Viktige sider blir nesten ikke besøkt. En kategoriside som crawles hver tredje måned er et signal om at den er dårlig lenket internt, eller at nettstedet har for mange sider i forhold til hvor viktig Google mener det er.

Feil du ikke visste om. Serverfeil som opptrer sporadisk under last, redirect-kjeder i flere ledd, og 404-feil på URL-er som fortsatt lenkes til fra andre nettsteder.

Trege svar på bestemte sidetyper. Søkeresultater og tunge filtersider svarer ofte mye tregere enn resten. Det påvirker hvor mye Google velger å crawle totalt.

Når det er verdt innsatsen

Her må jeg være ærlig om nytteverdien, for dette er et verktøy som ofte anbefales bredere enn det fortjener.

Loggfilanalyse gir mest når nettstedet har mange tusen URL-er, når det genereres URL-er automatisk, når det er internasjonalt med flere språkversjoner, eller når du har et indekseringsproblem du ikke klarer å forklare på annen måte. Det er også nyttig før og etter en større migrering, der du vil se hvor raskt de nye URL-ene blir plukket opp.

For et nettsted med 40 sider er det bortkastet tid. Crawl-budsjett er ikke en begrensning der, og Search Console forteller deg alt du trenger å vite. Se heller på crawlability og indeksering.

Slik kommer du i gang praktisk

Du trenger ikke dyre verktøy for å begynne. Har du loggfilene og litt tålmodighet, kan du komme langt med et regneark: filtrer på verifiserte Googlebot-treff, grupper etter URL og tell.

Skal du gjøre dette jevnlig, finnes det spesialiserte verktøy som Screaming Frog Log File Analyser og lignende, som håndterer store filer og kobler loggdata mot en crawl av nettstedet. Den koblingen er der verdien ligger: når du kan sammenligne hvilke sider som finnes med hvilke som besøkes, ser du hullene med en gang.

Slik leser du funnene

Et tall alene betyr lite. Det er forholdene som er interessante:

  • Andel crawl som går til sider du vil ha indeksert, mot resten.
  • Andel av de viktige sidene dine som er besøkt siste måned.
  • Andel svar som ikke er 200, fordelt på sidetype.
  • Utvikling over tid, ikke et øyeblikksbilde.

Og et forbehold til slutt: mye crawl er ikke det samme som god SEO. Google kan gjerne besøke en side ofte uten å rangere den. Loggen forteller deg hva som blir sett, ikke hva som blir verdsatt. Den løser diagnoseproblemer, ikke innholdsproblemer.