Metodguider
Vilka felkällor påverkar marknadsstatistik mest?
Siffervärden i tabeller är skattningar, inte exakta svar – även registerstatistik. SCB definierar kvalitet här som användbarhet för ett visst syfte.
Varför felkällor är avgörande i marknadsstatistik
Siffervärden i tabeller är skattningar, inte exakta svar – även registerstatistik. SCB definierar kvalitet här som användbarhet för ett visst syfte. För marknadsstatistik – till exempel statistik om näringsverksamhet och utrikeshandel, priser och ekonomiska tendenser, finansmarknad eller nationalräkenskaper – innebär det att en publicerad nivå eller förändring måste läsas med kunskap om hur den tagits fram.
SCB anger sex källor till osäkerhet eller bristande tillförlitlighet: bortfall (saknade värden), ramtäckning (brister i registrets täckning av avsedd population), mätning, bearbetning, modeller (antaganden som inte är perfekt uppfyllda) och urval. Avvikelserna delas in i systematiska (bias, snedvridning) och slumpmässiga (variation). En våg som alltid visar för låg vikt ger bias; en våg som visar olika varje gång ger stor variation. Båda kan försämra möjligheten att följa nivå och förändring, men på olika sätt.
Felkällor påverkar tre saker som marknadsstatistik ofta används till: nivån (hur stor marknaden är), förändringen (växer eller krymper den?) och jämförbarheten över tid eller mellan grupper. Ett systematiskt fel kan ge fel nivå men ändå rätt riktning om felet är konstant; ett föränderligt fel kan slå sönder både nivå och förändring. Frågan är därför inte om siffran är exakt, utan vilken osäkerhet som är störst för användningsområdet.
Bortfall och ramtäckning – när populationen inte fångas
Bortfall uppstår när värden saknas för enheter som borde ingå – företag som inte svarar på en enkät, eller uppgifter som inte kan hämtas från register. Ramtäckning handlar om att ramen (registret eller förteckningen som populationen dras från) inte motsvarar den population statistiken ska beskriva. SCB listar båda som osäkerhetskällor. Slumpmässigt bortfall eller täckningsfel påverkar främst osäkerheten; systematiskt bortfall eller täckningsfel – vissa företag, branscher eller storleksklasser saknas oftare – ger bias.
I praktiken: Vilken population ska statistiken beskriva, och vilka enheter finns i ramen? Hur stor är svarsfrekvensen, och skiljer sig de svarande från de icke-svarande i de variabler som mäts? Registertäckning kan ge undertäckning (enheter som borde ingå men saknas) och övertäckning (enheter som inte borde ingå, till exempel nedlagda företag eller felaktiga dubbletter). SCB beskriver ramtäckning som en av de svårbedömda delarna, så användaren får ofta nöja sig med en kvalitativ bedömning av hur väl ramen matchar målgruppen.
Mätfel och definitionsfel – rätt siffra men fel innebörd
SCB skiljer på uppenbara och misstänkta fel. Uppenbara fel är logiska fel, som ogiltiga eller motsägelsefulla värden, och kan ofta rättas automatiskt enligt fastställda regler. Misstänkta fel kräver mer arbete. Ett slag är definitionsfel, så kallade inliers: till exempel när belopp anges inklusive moms trots att detta inte efterfrågas. Det är svårt att upptäcka eftersom värdet kan verka rimligt men beskriver något annat än det efterfrågade.
Ett annat slag är misstänkt avvikande värden – värden så stora eller små att de förmodas felaktiga; SCB nämner påfallande höga månadslöner i en viss yrkesgrupp. Sådana avvikelser kan utredas via återkontakter med uppgiftslämnaren, främst i företagsundersökningar, eller genom skrivbordsutredning mot andra datakällor. Återkontakter har också ett lärande värde: uppgiftslämnare som gör fel i återkommande undersökningar uppmärksammas inför framtiden.
Mätfel i vidare mening uppstår när det som mäts inte är målstorheten, eller när mätinstrumentet fungerar olika för olika enheter. Definitionsfel är ett specialfall: siffran kan vara korrekt registrerad men betyda något annat än variabeln statistiken avser. Den som använder marknadsstatistik behöver därför kontrollera variabeldefinitioner, enheter och avgränsningar – särskilt vid jämförelser mellan källor.
Bearbetnings- och insamlingsfel – från svar till statistik
Insamlings- och bearbetningsfel uppstår mellan svar och färdig statistik. SCB beskriver granskning i flera faser: vid webbinsamling kan uppgiftslämnaren själv kontrollera indata i SIV, SCB:s webbinsamlingsverktyg; vid enkätdata kontrolleras att skanningen blivit korrekt; därefter följer produktionsgranskning av registrerade mikrodata, med modulen Edit i Triton som stöd vid återkontakter och åtgärder. När tabeller tagits fram görs outputgranskning (makrogranskning) för att hitta kvarstående fel i indata eller räknefel, och slutligen granskas publicerade tabeller, diagram, kartor och text för samstämmighet.
AKU visar hur fel i insamling och bearbetning kan slå igenom utan att först upptäckas. Enligt Aftonbladet identifierade SCB en brist i arbetskraftsundersökningen som gick tillbaka till 2018; felet låg i bearbetningen av datasvaren och hos SCB:s samarbetspartner, som hade hand om halva undersökningen. Sysselsättningen var överskattad under 2018 men underskattad under 2019, medan arbetslösheten underskattades 2018 och överskattades 2019. Epoch Times rapporterade att felaktigheterna berodde på kvalitetsbrister i underlag som samlats in av en underleverantör, och att SCB i november korrigerade arbetslöshetsstatistiken för juli 2018–september 2019.
Följden blev inte bara en felaktig nivå för enskilda månader. Eftersom felet skiftade riktning över tid blev det svårt att följa hur arbetslösheten utvecklats sedan felet uppstod, enligt Aftonbladet. Det illustrerar en allmän princip: bearbetningsfel kan vara osynliga i den löpande produktionen men förstöra jämförbarheten över tid – särskilt allvarligt i marknads- och konjunkturstatistik, där användaren ofta är intresserad av förändring, inte bara nivå.
Urvals- och modellosäkerhet – slump eller snedvridning
Urvalsosäkerhet uppstår när slutsatser dras från ett urval i stället för en totalundersökning. SCB beskriver urvalsosäkerheten som ganska lätt att skatta, medan övriga osäkerhetskällor ofta är svåra att bedöma. En rapport kan därför ha ett prydligt konfidensintervall kring en skattning utan att den totala osäkerheten är liten: intervallet fångar bara den slumpmässiga urvalsvariationen, inte systematiska fel i täckning, mätning eller bearbetning.
Modellosäkerhet handlar om att modeller bygger på antaganden som inte är perfekt uppfyllda. Ett antagande kan vara att bortfallet är slumpmässigt, att en registervariabel mäter samma sak som målstorheten eller att en relation är stabil över tid. Brister antagandet uppstår bias, och den försvinner inte med ett större urval. Ett större urval minskar slumpmässig variation men inte systematiska avvikelser; en mycket stor undersökning kan därför fortfarande ge en snedvriden bild av marknaden. För marknadsstatistik kan det till exempel gälla antagandet att företag som inte svarar liknar dem som svarar.
Preliminära beräkningar och revideringar – systematiska fel över konjunkturen
Riksrevisionens granskning 2019 riktade kritik mot systematiska fel i SCB:s statistik. Enligt Riksrevisionen hade SCB i konjunkturuppgångar systematiskt underskattat styrkan i svenska offentliga finanser, och BNP-utfall hade underskattats systematiskt i SCB:s preliminära beräkningar i nationalräkenskaperna. Riksrevisor Helena Lindberg skriver: "Systematiska fel i statistiken riskerar att leda till systematiska fel i finanspolitiken."
Riksrevisionen pekade också på att SCB behöver ta ett större ansvar för statistik som inhämtas från andra aktörer, till exempel beräkningar av statens skatteinkomster från Ekonomistyrningsverket (ESV). Projektledaren Tomas Forsfält beskrev ett konjunkturmönster i SCB:s första beräkningar av statens skatteinkomster jämfört med de faktiska skatteinkomsterna: i konjunkturuppgångar har det flödat in mer skatteinkomster till staten än vad SCB räknat med i tidigare beräkningar. Han menade att mönstret borde kunna utnyttjas i prognoserna.
Preliminära beräkningar är särskilt känsliga eftersom de görs innan alla uppgifter är inrapporterade och ofta bygger på modeller, tidiga indikatorer och underleverantörsdata. Revideringar är därför normala, men problemet uppstår när de är systematiska över konjunkturcykeln i stället för slumpmässiga. SCB:s Helena Kaplan beskrev granskningen som väl genomarbetad och sade att SCB arbetar med ständiga kvalitetsförbättringar; Riksrevisionens slutsats var samtidigt att nationalräkenskaperna är tillräckligt goda för att användas som underlag för finanspolitiska beslut.
Granskning och kvalitetsarbete – så fångas felen
Granskning, eller datagranskning, är enligt SCB en kvalitetskontroll av statistiska uppgifter – inte att förväxla med granskning av frågeformulär, dataprogram eller statistiksekretess. Metodstatistikern Karin Lindgren säger att SCB behöver granska för att hitta och hantera fel i data, men också för att hitta felkällor och försöka åtgärda dem med förbättrade mätinstrument.
Granskningen sker i olika faser genom statistikframställningen, från insamling och mikrodata till färdiga tabeller och publicerad statistik. Ett fel som passerar en tidig fas kan förstärkas senare, medan en sen outputgranskning kan fånga fel som uppstått tidigare.
SCB betonar en helhetssyn på kvalitet: man ska inte fixera sig vid en enskild kvalitetskomponent utan se till den förväntade totala osäkerheten i en skattning. De sju kvalitetsdimensionerna i lagen om officiell statistik – relevans, noggrannhet, aktualitet, punktlighet, tillgänglighet och tydlighet, jämförbarhet samt samstämmighet – ger ett ramverk. Ju högre tillförlitlighet, desto mindre risk för missvisande skattningar i det enskilda fallet, men i det enskilda fallet vet man inte hur stort felet är utan får förlita sig på en uppskattning av tillförlitligheten.
Kvalitetsdimensioner i officiell svensk statistik
- Relevans
- Statistiken ska passa användarnas behov.
- Noggrannhet
- Låg felrisk i skattningar och mätningar.
- Jämförbarhet
- Gör det möjligt att jämföra data över tid och mellan regioner.
- Samstämmighet
- Data ska vara konsekvent över olika produkter och källor.
Systematiska fel – vad som framstår som särskilt problematiskt
Källorna här rangordnar inte felkällorna efter påverkan på marknadsstatistik. Däremot framstår systematiska fel i bearbetning, insamling, täckning och modeller som särskilt problematiska i exemplen: de är svåra att upptäcka eftersom de inte nödvändigtvis ger orimliga värden, och de snedvrider både nivåer och förändringar. Riksrevisionens exempel med underskattade offentliga finanser och BNP i konjunkturuppgångar visar hur sådana fel kan leda till systematiska fel i finanspolitiken. AKU-exemplet visar hur bearbetnings- och underleverantörsproblem kan gå obemärkta och försämra jämförbarheten över tid.
För marknadsstatistik bör användaren granska hur producenten hanterar dessa delar: dokumenterade granskningsrutiner, återkontakter, uppföljning av underleverantörer och analys av revideringar över konjunkturen. Ett stort urval eller ett smalt konfidensintervall kompenserar inte för systematiska fel.
SCB uppger att man löpande informerar om brister upptäcks. I AKU-fallet gick SCB ut med att siffrorna var felaktiga och att det fanns risk för kompletterande information. SCB:s utgångspunkt är att statistikvärdena inte ger exakta svar utan skattningar.
Systematiska vs slumpmässiga fel – påverkan på marknadsstatistik
- Systematiska fel (bias)Förvrider både nivå och förändring. Svåra att upptäcka eftersom värden kan verka rimliga. Exempel: underskattade BNP-värden i konjunkturuppgångar, felaktig bearbetning i arbetslöshetsstatistik.
- Slumpmässiga fel (variation)Ökar osäkerheten men inte snedvridningen. Kan minska med större urval. Exempel: variation i vågens mätning, bortfall som sker slumpmässigt.