Skip to main content

Utdrag Innføring i statistikk og dataanalyse

Page 1

Jon Ingulf Medbø

Innføring i statistikk og dataanalyse for studenter i idretts- og helsefag


Innhold Forord................................................................................................................................. 15 Kapittel 1 Innledning – hva er statistikk? .................................................................................... 17 Innledende eksempler .................................................................................................... 17 Hva er statistikk? ............................................................................................................. 20 «Lov og tilfeldighet» ................................................................................................ 21 «Do you speak statistics?» ..................................................................................... 21 Hvordan lærer en statistikk? .................................................................................. 22 Statistikk er et middel i data-analyse ................................................................... 23 Misbruk av statistikk ............................................................................................... 23 Oversikt over bokas innhold og oppbygninga av kapitlene ...................................... 25 Sammenfatning av data – deskriptiv statistikk .......................................................... 27 Praktiske eksempler og oppgaver ......................................................................... 27 Oppgaver og kontrollspørsmål ...................................................................................... 28 Merknader ................................................................................................................. 29 Kapittel 2 Innføring i kvantitative metoder ................................................................................. 32 Hva er kvantitative metoder? ........................................................................................ 32 Forskningsprosessen ....................................................................................................... 32 Første trinn: problemstilling, hypotese og utvalg ............................................... 33 Andre trinn: valg av framgangsmåte eller metode for datainnsamlinga ....... 35 Tredje trinn: innsamling av resultater, bearbeiding og framstilling av dem ... 42 Fjerde trinn: tolking av resultatene, å sette dem inn i en større sammenheng ............................................................................................................ 42 Klassifisering av data – typer måleskalaer .................................................................. 43 Nominelle skalaer, kategoriske variabler ............................................................. 43 Ordinalskalaer, rangskalaer .................................................................................... 44


6  innhold Intervallskalaer ......................................................................................................... 44 Forholdsskalaer, ratioskalaer ................................................................................. 45 Sammenfatning om måleskalaer ........................................................................... 46 Diskrete og kontinuerlige målinger ....................................................................... 46 Mål på lokalisering og spredning .................................................................................. 49 Sentralmål – mål på lokalisering ............................................................................ 49 Spredningsmål .......................................................................................................... 49 Standardiserte størrelser ................................................................................................ 51 Normalskårer, z-skårer ............................................................................................ 51 Stanineskårer ............................................................................................................ 51 Handtering av tall ............................................................................................................ 52 Tall med siffer eller bokstaver? .............................................................................. 53 Måltall ........................................................................................................................ 54 Skriving av tall ........................................................................................................... 54 Brøk, prosent og desimaltall .......................................................................................... 56 Bruk og misbruk av prosenter ....................................................................................... 57 Prosenter og prosentpoeng .................................................................................... 57 Bruk av forkortinger i faglige sammenhenger ............................................................ 58 Handtering av (fysiske) størrelser med målenheter ................................................. 60 Skriving av statistiske størrelser ............................................................................ 63 Tolking av intervaller. Overganger mellom diskrete og kontinuerlige skalaer ...... 63 Diskrete og kontinuerlige størrelser og skalaer .................................................. 63 Lengden av diskrete intervall ................................................................................. 64 Halvkorreksjon .......................................................................................................... 64 Hvor mange siffer i svaret? Om å unngå desimalsjuken .......................................... 65 Regler for avrunding av tall ..................................................................................... 65 Desimalsjuken ........................................................................................................... 66 Størrelsesorden ................................................................................................................ 69 Bruk av måleskalaer ........................................................................................................ 70 Null er et viktig tall ................................................................................................... 70 Titallsystemet ........................................................................................................... 72 VAS-skalaer ............................................................................................................... 73 Likertskalaer .............................................................................................................. 73 Gagges subjektive temperaturskala ..................................................................... 74 Borg-skalaer .............................................................................................................. 75 Klassifisering av kurver ................................................................................................... 78 Oppgaver og kontrollspørsmål ...................................................................................... 80 Vedlegg til kapittel 2 ....................................................................................................... 81 Mer om mål på lokalisering .................................................................................... 81 Mer om spredningsmål ........................................................................................... 84


innhold  7

Lokaliseringsmål, spredningsmål og måleskalanivå .......................................... 88 Skeivhet ...................................................................................................................... 88 Kurtose ....................................................................................................................... 90 Kapittel 3 Innføring i tilfeldige prosesser og sannsynlighetsfordelinger ............................ 94 Tilfeldige (stokastiske) prosesser ................................................................................. 94 Den diskrete uniforme fordelinga ................................................................................. 94 Normalfordelinga ............................................................................................................. 96 Kumulative fordelinger ................................................................................................... 98 Eksempel på normalfordelte størrelser: kroppshøyden hos norske menn ............ 99 Eksempel med tilfeldige fordelinger ............................................................................. 101 Utfallsrom – definisjon .................................................................................................... 104 Oppgaver og kontrollspørsmål ...................................................................................... 105 Kapittel 4 Innføring i sannsynlighetsregning ............................................................................. 106 Bakgrunn ........................................................................................................................... 106 Gunstige og mulige utfall ........................................................................................ 107 Kombinatorikk og permutasjoner ................................................................................. 109 Utvelging med eller uten tilbakelegging ............................................................... 109 Ordna og ikke-ordna utvalg .................................................................................... 109 Ikke-ordna utvalg uten tilbakelegging .................................................................. 111 Avsluttende merknader om kombinatorikk og sannsynligheter ..................... 115 von Mises’ og Kolmogorovs sannsynlighetsbegrep .................................................. 115 von Mises’ sannsynlighetsbegrep ......................................................................... 115 Kolmogorovs sannsynlighetsbegrep ..................................................................... 117 Subjektiv sannsynlighet .......................................................................................... 119 Punktsannsynligheter og sannsynlighetstettheter .................................................... 120 Punktsannsynligheter .............................................................................................. 121 Kontinuerlige sannsynlighetsfunksjoner. Sannsynlighetstettheter ................. 121 Kumulative fordelinger ............................................................................................ 123 Kontinuerlige og diskrete fordelinger – hvor går skillet? ................................... 127 Betinga sannsynligheter ................................................................................................. 128 Marginale sannsynlighetsfordelinger .......................................................................... 131 Uavhengighet ................................................................................................................... 132 Statistiske fordelinger ..................................................................................................... 133 Forventning og varians ............................................................................................ 134 Viktige diskrete statistiske fordelinger ........................................................................ 137 Den diskrete uniforme fordelinga .......................................................................... 137


8  innhold Binomialfordelinga ................................................................................................... 137 Poissonfordelinga ..................................................................................................... 140 Viktige kontinuerlige statistiske fordelinger ............................................................... 143 Den uniforme fordelinga (rektangulærfordelinga) ............................................ 143 Normalfordelinga ..................................................................................................... 144 Gossets («Students») t-fordeling ......................................................................... 145 Sentralgrenseteoremet ........................................................................................... 149 Oppgaver og kontrollspørsmål ...................................................................................... 155 Vedlegg .............................................................................................................................. 156 Viktige regler utleda fra Kolmogorovs aksiom .................................................... 156 Formler for betinga sannsynligheter. Bayes teorem .......................................... 158 Stirlings formel i enkel form ................................................................................... 158 Den multinomiske fordelinga ................................................................................. 160 Den hypergeometriske fordelinga ......................................................................... 161 Kjikvadratfordelinga ................................................................................................. 162 Den eksponensielle fordelinga ............................................................................... 163 Fisher-fordelinga ....................................................................................................... 164 Student-Fishers setning .......................................................................................... 165 Kapittel 5 Estimering og hypotesetesting ................................................................................... 166 Innledning ......................................................................................................................... 166 Estimering ......................................................................................................................... 168 Estimering av forventning og varians for (tilnærma) normalfordelte størrelser .................................................................................................................... 168 Medianen ................................................................................................................... 170 Hodges-Lehman-Sen-estimatoren (HLS-estimatoren) .................................... 171 Estimering av den binomiske suksess-sannsynligheten ................................... 173 Avsluttende merknader om estimering ............................................................... 175 Hypotesetesting ............................................................................................................... 175 Formelle prinsipp for hypotesetesting ................................................................. 176 Hypotesetesting i praksis ....................................................................................... 181 Teststyrke – styrkefunksjonen ................................................................................ 181 Avsluttende merknader om hypotesetesting ..................................................... 183 Konfidensintervall ............................................................................................................ 184 Teststyrke og konfidensintervall ................................................................................... 188 Konfidensintervall og hypotesetesting ................................................................. 191 Suffisiens ........................................................................................................................... 191 Suffisiens og sentralgrenseteoremet .................................................................... 192 Oppgaver og kontrollspørsmål ...................................................................................... 193


innhold  9

Vedlegg .............................................................................................................................. 194 Konfidenskurver ....................................................................................................... 194 Kapittel 6 Toutvalgstester ............................................................................................................... 196 Bakgrunn med et eksempel ........................................................................................... 196 Gossets (Students) toutvalgs t-test ............................................................................. 199 Estimering .................................................................................................................. 200 Hypotesetesting ....................................................................................................... 202 Forutsetninger for Gossets toutvalgs t-test ........................................................ 204 Wilcoxon og Mann-Whitneys ikke-parametriske toutvalgstest ............................. 204 Wilcoxons tilnærming ............................................................................................. 205 Mann-Whitneys tilnærming .................................................................................. 205 Sammenfallende verdier ......................................................................................... 208 Estimering .................................................................................................................. 210 Forutsetninger for Wilcoxon Mann-Whitneys toutvalgs test. Hva måler egentlig testen? ............................................................................................. 211 Regnetekniske krav til Wilcoxon Mann-Whitney-testen .................................. 212 Behrens-Fishers problem. Heteroskedastiske data ................................................... 213 Welchs tilnærming ................................................................................................... 215 Estimering .................................................................................................................. 216 Avsluttende merknad om antall frihetsgrader .................................................... 217 Råd for valg av test og testopplegg – effisiens ........................................................... 217 Effisiens ...................................................................................................................... 218 Tester på lik varians ......................................................................................................... 219 Fishers F-test ............................................................................................................. 219 Sammenfatning ........................................................................................................ 221 Oppgaver og kontrollspørsmål ...................................................................................... 222 Vedlegg. Andre foreslåtte tester ................................................................................... 226 Kolmogorov-Smirnovs test ..................................................................................... 227 Wald-Wolfowitz’ følgetest ..................................................................................... 229 Siegel-Tukeys varianstest ........................................................................................ 230 Mer om Behrens-Fishers problem og Welchs tilnærming ............................... 232 Kapittel 7 Ettutvalgstester, para tester ........................................................................................ 234 Bakgrunn ........................................................................................................................... 234 Et innledende eksempel .......................................................................................... 235 Annen bruk av partester – grunnprinsippet bak testene .................................. 237 Gossets («Students») ettutvalgs t-test ....................................................................... 237


10  innhold Estimering .................................................................................................................. 239 Enkel hypotesetesting ............................................................................................. 239 Forutsetninger for Gossets ettutvalgs t-test ....................................................... 240 Wilcoxons ettutvalgs rangtest ...................................................................................... 241 Forutsetninger for Wilcoxons ettutvalgstest ...................................................... 242 Hva måler egentlig Wilcoxons ettutvalgstest? ................................................... 242 Estimering .................................................................................................................. 243 Sammenlikning av testene ............................................................................................. 243 Toutvalgstest på para data ............................................................................................. 244 Toutvalgs t-test ......................................................................................................... 245 Wilcoxon Mann-Whitney-test .............................................................................. 245 *Kolmogorov-Smirnov-test .................................................................................... 246 *Wald-Wolfowitz’ følgetest .................................................................................... 246 Sammenfatning om bruk av toutvalgstester på para data ............................... 246 Sammenlikning av endringer for to utvalg .................................................................. 247 Vanlige feil ................................................................................................................. 247 Oppgaver og kontrollspørsmål ...................................................................................... 248 Vedlegg. Fortegnstesten ................................................................................................. 249 Utregninger ............................................................................................................... 249 Matematiske sider ved partester .......................................................................... 250 Kapittel 8 Sammenlikning av mer enn to grupper. Innføring i variansanalyse ................... 252 Innledning ......................................................................................................................... 252 Faktorer og nivåer ............................................................................................................ 257 Forventningskomponenter og varianskomponenter. Blanda modeller ........... 257 Variansanalysens grunnprinsipp ................................................................................... 259 Variansanalysens to trinn ....................................................................................... 260 Sammenfatning ........................................................................................................ 260 Enveis variansanalyse ..................................................................................................... 261 Trinn to i en variansanalyse ........................................................................................... 262 Scheffés metode ....................................................................................................... 262 Fishers minste signifikante skilnad (LSD) ............................................................ 263 Studentiserte variasjonsbredder ........................................................................... 265 Dunnetts test ............................................................................................................ 266 Pre hoc-analyser ....................................................................................................... 266 Mer om variansanalyse .................................................................................................. 266 Randomiserte blokker ............................................................................................. 266 Varianskomponentmodeller ................................................................................... 267 Toveis og flerveis variansanalyse .......................................................................... 270


innhold  11

Avsluttende merknader om variansanalyse ............................................................... 275 Variansanalyse er en omnibustest ........................................................................ 276 Oppgaver og kontrollspørsmål ...................................................................................... 278 Vedlegg .............................................................................................................................. 280 Kruskal-Wallis’ test. En ikke-parametrisk enveis variansanalyse .................... 280 Friedmans test – en ikke-parametrisk test for blokkdelte forsøk .................... 285 Kapittel 9 Sammenhenger mellom to eller flere variabler ....................................................... 286 Regresjon ........................................................................................................................... 286 Ei presisering ............................................................................................................. 289 Viktige egenskaper ved en regresjonsmodell ..................................................... 291 Viktige parametere i lineærregresjon ................................................................... 292 Estimering og statistisk testing i lineærregresjon .............................................. 294 Lineærregresjon når X blir Y og Y blir X ............................................................... 295 Geometrisk middel .................................................................................................. 297 Interpolering. Ekstrapolering .................................................................................. 298 Kalibrering ................................................................................................................. 299 Bland-Altmans metode og B-A-plottet ................................................................ 302 Multippel regresjon .................................................................................................. 305 Ikke-lineær regresjon ............................................................................................... 306 Ikke-parametriske metoder. Medianregresjon og kvantilregresjon ................ 309 Kovariansanalyse ..................................................................................................... 310 Korrelasjon ........................................................................................................................ 312 Pearsons produktmoment koeffisient .................................................................. 314 Spearmans rangkorrelasjonskoeffisient ............................................................... 317 Kendalls korrelasjonskoeffisient ............................................................................ 318 Multippel korrelasjon .............................................................................................. 319 Partiell korrelasjon ................................................................................................... 320 Avsluttende merknader om korrelasjon .............................................................. 321 Oppgaver og kontrollspørsmål ...................................................................................... 321 Kapittel 10 Binomiske forsøk. Poissonprosesser ......................................................................... 324 Forsøk med binomisk utfall ............................................................................................ 324 Usikkerhet for ekstreme binomiske utfall. Treerregelen ................................... 327 Sammenlikning av punktsannsynligheter for to binomiske forsøksrekker .... 328 Utfall av poissonprosesser ............................................................................................. 333 Enkle poissonprosesser ........................................................................................... 333 Sammenlikning av to poissonprosesser ............................................................... 337


12  innhold Logistisk regresjon ........................................................................................................... 338 Oppgaver og kontrollspørsmål ...................................................................................... 340 Vedlegg .............................................................................................................................. 340 Mer nøyaktig formel for konfidensintervall for binomisk punktsannsynlighet .................................................................................................. 340 Utledning av treerregelen ....................................................................................... 341 Mer nøyaktig formel for konfidensintervall for intensiteten til poissonske punktprosesser .................................................................................... 343 Kapittel 11 Multinomiske forsøksrekker. Analyse av kategoriske data ................................. 344 Bakgrunn ........................................................................................................................... 345 Tre ulike modeller ............................................................................................................ 347 Kjikvadrattilnærminga .................................................................................................... 348 Yates’ korreksjon for kontinuitet ............................................................................ 351 Irwin-Fishers eksakte test for 2×2-tabeller ................................................................. 352 Konfidensintervall for 2×2-modeller ............................................................................ 354 Nyere tester for 2×2-modeller ...................................................................................... 356 Para sammenlikninger: McNemars test ...................................................................... 357 Estimering med konfidensintervall ....................................................................... 359 Nyere forskning på para sammenlikninger .......................................................... 360 Analyse av utfallet av multinomiske forsøk mot fastsatte fordelinger .................. 360 Analyse av tabeller med rangerte verdier ................................................................... 362 Enveis rangstruktur .................................................................................................. 363 Toveis rangstruktur .................................................................................................. 364 Hva taper en ved å kategorisere data? ........................................................................ 368 Videre lesing ..................................................................................................................... 369 Oppgaver og kontrollspørsmål ...................................................................................... 370 Vedlegg .............................................................................................................................. 371 Matematikken bak analyser av multinomiske forsøksrekker med kjikvadrattesten ........................................................................................................ 371 Kapittel 12 Data-analyse. Avsluttende merknader ..................................................................... 375 Følger av variasjoner i tyngdekrafta ............................................................................. 375 Metningstrykket for vanndamptrykket avhenger av temperaturen ....................... 377 Skøyteløp ........................................................................................................................... 378 Holde svingen ........................................................................................................... 378 Kutte svingen ............................................................................................................ 379 Tidsforsinking på grunn av lydfarten .................................................................... 380


innhold  13

Varmere klima – følger for skiføret ............................................................................... 380 Norsk toppfotball gjennom femti år ............................................................................. 381 Analyse av en sammensatt idrett – skiskyting ........................................................... 384 Presentasjon av resultat ................................................................................................. 388 Standardavvik eller standardfeil. Konfidensintervall og yttergrenser for samsvar ................................................................................................................ 388 Bruk og misbruk av P-verdier ......................................................................................... 391 P-fisking ..................................................................................................................... 391 Publiseringsskeivheit ....................................................................................................... 392 Hypotesetesting eller estimering? P-verdier eller konfidensintervall? .................. 392 Matematiske snarveier, fallgruver og vrakgods ......................................................... 393 «Do you speak statistics?» ............................................................................................ 396 Statistiske moteretninger ....................................................................................... 397 Statistikkens tre? ............................................................................................................. 398 Data-analyse uten statistikk .......................................................................................... 399 Vedlegg ............................................................................................................................. 400 Videregående matematikk ............................................................................................. 400 Integrering ................................................................................................................. 400 Logaritmer og eksponentialfunksjoner ................................................................. 406 Stikkordregister .............................................................................................................. 409


Forord Innføring i statistikk og dataanalyse for studenter i idretts- og helsefag er ei brukerretta lærebok for studenter som jobber med praktisk statistikk. Tidligere måtte krevende regnearbeid av denne typen gjøres for hand, og å lære seg å bruke de rette formlene sto derfor sentralt i opplæringa i praktisk statistikk. I dag har vi dataprogram som utfører regnearbeidet for oss. Da er det viktigere at brukeren veit hvilket verktøy som skal brukes, enn å kjenne til de regnetekniske detaljene. Boka er skrevet som ei vanlig lærebok med tekst, figurer og tabeller, og etter hvert kapittel gis det oppgaver (noen kapitler har også oppgaver underveis). Det er utarbeida et hefte med løsningsforslag til alle oppgavene. Dette heftet gir også en kort innføring i bruk av regnearket Excel og statistikkprogrammet SPSS. Studentene kan også søke opp hovedbokens ISBN 9788202516888 på www.cappelendammundervisning.no, gå til fanen Tilleggsmateriell og laste ned inngangsdata og andre talldata tilhørende bokens oppgaver, dette for å slippe tidkrevende inntastinger. Regelmessig fysisk aktivitet er viktig for helsa, og her kommer tilknytninga mellom idrettsfag og helsefag til syne. Med den nye femårige mastergraden ved lærerutdanninga bør boka også være aktuell i masterarbeidet for mange av disse studentene. Jeg takker Asgeir Mamen og Boye Welde som har kommet med nyttige innspill og gode kritiske tilbakemeldinger underveis i arbeidet. Jeg retter en like stor takk til forlagets anonyme fagkonsulenter for de mange gode forslaga og innspillene de har kommet med. Det har resultert i ei bedre bok. Takk til Nils Lid Hjort, Terje Myklebust og Futoshi Ogita for data og innspill. Jeg takker videre redaktør Bjørn Olav Aas Hansen hos Cappelen Damm Akademisk for svært godt samarbeid og Marius Hjeldnes for godt redaksjonelt arbeid. En stor takk også til språkvasker Siv Rekve for tålmodig arbeid og for tallrike gode innspill som har forbedra den språklige framstillinga. Jon Ingulf Medbø, Sogndal, oktober 2017


Kapittel 1

Innledning – hva er statistikk? Innhold og læringsmål Målet med dette kapitlet er å gi noe av grunntanken bak statistiske analyser av data. Det sier også noe om hvordan en bør gå fram for å lære å bruke og tolke statistiske data. Leseren skal også få litt kjennskap til mulig misbruk av statistikk. Kapitlet gir til slutt en oversikt over innholdet i resten av boka.

Innledende eksempler Statistikk blir stadig mer brukt, ikke minst i forskning og når en tolker data i forskningsliknende oppgaver. Det gjelder også for idretts- og helsefag. Noen eksempler kan vise det: • Ei gruppe amerikanske forskere under ledelse av Jonas E. Salk utvikla i 1950åra en vaksine mot sjukdommen poliomyelitt som ubehandla fører til muskellammelser og i noen tilfeller død. Denne sjukdommen ramma mange, blant annet den amerikanske presidenten Franklin D. Roosevelt (president 1933–1945) som var lamma i underkroppen etter poliosjukdom i 1921.1 For å undersøke om vaksinen virkelig hadde noen virkning, blei nesten én million barn vaksinert i 1954, mens mer enn én million barn ikke blei vaksinert og tjente som kontroller. Så fulgte Salk og medarbeidere alle barna og registrerte forekomster av poliomyelitt i hver av de to gruppene de følgende månedene. De fant langt færre tilfeller av poliomyelitt blant de vak1

https://en.wikipedia.org/wiki/Franklin_D._Roosevelt#Paralytic_illness_.281921.29. Lest 26.9.2017.


18  kapittel 1 innledning – hva er statistikk? sinerte barna sammenlikna med i den ubehandla gruppa. Forskerne viste i 1955 at skilnaden var så stor at den ikke kunne forklares med statistiske tilfeldigheter. Det er slikt arbeid som har ført til at sjukdommen poliomyelitt for lengst er så godt som utrydda i industrialiserte land.2 • Redaksjonen i det medisinske tidsskriftet New England Journal of Medicine valgte i januar 2000 å starte det nye tusenåret med å sammenfatte den medisinske utviklinga i det tusenåret som nettopp var avslutta.3 Den pekte ut elleve hovedemner som den mente hadde vært særlig viktige for utviklinga. Det at legevitenskapen bygger på kunnskap i anatomi og fysiologi, på kunnskap om celler og oppbygninga av dem, og på de biokjemiske prosessene i dem, er åpenbart. Det samme gjelder at kunnskap om bakterier og det å kunne bekjempe dem, enten gjennom kroppens eget immunsystem eller ved hjelp av antibiotika, er viktig for å unngå infeksjonssjukdommer. Ett av de elleve fagfeltene som blei framheva, var statistisk bearbeiding av innsamla materiale. Bruk av statistikk i medisinsk sammenheng blei altså framheva på linje med bruk av kunnskaper i anatomi og fysiologi, kunnskap om celler og bakterier, om anestesi, farmakologi og medisiner og så videre. • Hurtigløp på skøyter er en tradisjonell norsk idrett. I mesterskap på skøytesprint går en i dag to 500-meterløp, den ene gangen med start i indre bane, og den andre gangen med start i ytre bane. Det har lenge vært diskutert om det er en fordel med «første indre». Nils L. Hjort ved Universitetet i Oslo undersøkte spørsmålet statistisk ved å gå gjennom resultatlister fra ti verdensmesterskap i skøytesprint. Ut fra de beregningene viste han at en gjennomsnittlig sprinter tjente 0,05 s på å starte i første indre sammenlikna med start i første ytre. Videre viste han at selv om det var variasjoner mellom løpere og fra stevne til stevne, var det en gjennomgående skilnad: Den var statistisk utsagnskraftig («signifikant») og kunne ikke bare forklares med tilfeldigheter.4 • Ordninga med én førstedivisjon/toppdivisjon i norsk fotball (nå tippeligaen) blei oppretta forut for sesongen 1963. Etter at sesongen 2016 er fullført, er det i løpet av 54 sesonger5 gjennomført 8314 kamper der det er registrert 3935 hjemmeseiere (47,3) %, 2007 uavgjorte kamper (24,1 %) og 2 https://en.wikipedia.org/wiki/Jonas_Salk. Lest 26.9.2017. 3 Editorial. New England J. Med. 2000; 342(1): 42–49. 4 http://www.uio.no/studier/emner/matnat/math/STK4160/v11/olympic_partone.pdf, http://www.uio. no/studier/emner/matnat/math/STK4160/v11/olympic_parttwo.pdf 5 Regelverket for sesongen 1987 var avvikende med straffesparkkonkurranse etter en uavgjort kamp ved full tid. Det er i statistikken her brukt resultatet ved full tid, uten å ta med resultatet av straffesparkkonkurransen.


Innledende eksempler  19

•

•

•

•

6 7 8 9

2372 (28,5 %) borteseiere.6 Denne statistikken for norske toppseriekamper gjennom mer enn femti år sett under ett viser at nesten annenhver kamp ender med hjemmeseier, i underkant av hver fjerde kamp ender uavgjort, mens det blir borteseier i opp mot 30 % av alle kampene. Disse talla understreker blant annet den store fordelen det er med kamp på hjemmebane. Ifølge en artikkel på Wikipedia er antall mål i britiske fotballkamper poissonfordelt med intensitetsparameter 2,5 mål per kamp.7 Hva har det å si for fordelinga av antall mål per kamp? Hvor sannsynlig er det med en mållaus kamp? Hvor sannsynlig er det med mer enn fire mål i en kamp? Slike spørsmål kan en belyse med statistiske metoder. I norsk toppfotball for menn er det fra og med 1963 til og med 2016 skåra til sammen 25 093 mål på 8314 kamper.8 Det gir en midlere skåringsintensitet på 3,02 mål/kamp. Hva slags videre statistiske vurderinger kan en bruke slike tall til? Mange land, også Norge, har egne kreftregistre. Her blir alle nye forekomster av kreft registrert sammen med andre opplysninger om pasientene. Så kan en seinere hente fram opplysninger og undersøke hva slags systematiske skilnader det er mellom de som har fått en kreftsjukdom, og de som ikke er ramma. Det var slike tilnærminger som gjorde at en i 1950 kunne slå fast at røyking var en svært viktig årsak til lungekreft.9 Allerede før det hadde en klare, statistiske holdepunkter for at det var en klar sammenheng mellom røyking og lungekreft. Seinere har en påvist at røyking også er en viktig årsak til mange andre former for kreft og videre til hjerte-karlidelser og alvorlige luftveislidelser. Det er videre vist at mer enn annenhver vanerøyker (en som røyker daglig over lengre tid) dør for tidlig og av følger av røykinga. Disse slutningene bygger i første rekke på statistisk analyse av livslengde og dødsårsaker. Idretten har mange uløste spørsmål av statistisk art. En del idretter består av sammensatte øvelser, der kombinert skirenn kan være et eksempel. Det består av en hoppkonkurranse og et langrenn. Denne idrettens idé er at begge øvelsene skal være (omtrent) like utslagsgivende. Det skal ikke være slik at bare en er god til å hoppe, er det ikke så farlig med egenskapene som langrennsløper, eller omvendt. Skihopping består igjen av det å hoppe Resultatene er tatt fra nettsida Alt om fotball: http://www.altomfotball.no/element.do?useFullUrl=false høsten 2016 og med løyve fra TV 2. https://en.wikipedia.org/wiki/Poisson_distribution. Lest 26.9.2017. Mål i straffesparkkonkurranser som avslutta og avgjorde uavgjorte kamper i 1987-sesongen er ikke tatt med. https://en.wikipedia.org/wiki/Health_effects_of_tobacco. Lest 26.9.2017.


20  kapittel 1 innledning – hva er statistikk? langt og å gjøre det stilfullt. Igjen bør begge krava telle omtrent like mye. Det er ikke kjent om det er tilfellet: Her ligger det altså uløste statistiske forskningsoppgaver. • Det ligger i navnet skiskyting at idretten kombinerer skyteferdigheter med det å kunne gå fort på ski. Feil i skytinga fører til tillegg i sluttida. Også her er den underliggende idéen at de to ferdighetene bør vektes omtrent like mye. • Friidrett har mange enkeltøvelser, og noen av dem er satt sammen til mange­ kamp: sjukamp for kvinner og tikamp for menn. Det bør være slik at hver øvelse teller tilnærma like mye. En bruker også ordet statistikk på andre, men beslekta områder, blant annet i idrett. For eksempel fører en i fotball oversikter over hvor mange kamper en gitt spiller har på landslaget eller i eliteserien, hvor ofte lag A har slått lag B i eliteserien, oversikt over hvilket lag som har spilt lengst uten å skåre mål eller å få baklengsmål, og så videre. Dette er konkrete eksempler på behandling av foreliggende tallmateriale som kan ha stor praktisk interesse, men det faller utafor faget statistikk som en vitenskapelig disiplin og som et verktøy i forskningssammenheng. Slik ikke-vitenskapelig bruk av statistikk blir bare i liten grad tatt opp i denne boka.

Hva er statistikk? Statistikk er ei grein av matematikken. Det folk flest gjerne forbinder med tradisjonell matematikk, er utregninger av et sikkert svar. Statistikk er ei retning i matematikken der en regner på usikre verdier. Det vil si at også resultatet av beregningene blir usikkert.

Eksempler • Tar en for seg ei trapp med 17 trinn, har den 17 trinn hver gang en teller, og alle som teller trinna, skal komme fram til tallet 17: Dette er et sikkert resultat. • Om en kaster en vanlig terning, er de mulige utfalla {1, 2, …, 6}. Om en på det første kastet får {4}, kan en på det neste kastet få {2}. Gjentar en forsøket, vil gjerne utfallet blir et annet. • Om en i et rom med tjue voksne menn plukker ut en tilfeldig mann og måler høyden, kan utfallet bli 182 cm. Gjentar en forsøket, kan utfallet bli et annet, for eksempel 177 cm.


Hva er statistikk?  21

I begge disse siste to tilfellene er utfallet tilfeldig, og det er en vesentlig egenskap ved statistiske modeller. «Tilfeldig» har en noe annen fortolking i statistikk enn i dagligtale, der ordet ofte blir tolka som «hva som helst». I statistikk er det klare føringer på mulige utfall selv om utfallet er tilfeldig. I det første eksemplet med terningkast kan en bare få heltallsverdier mellom {1} og {6}. I det andre eksemplet veit en fra både erfaringer og omfattende målinger at den mest typiske verdien er om lag 180 cm, at avvik hver vei på inntil 10 cm er ganske vanlig, og at noe større avvik forekommer. Ei amerikansk lærebok sier dette om hva statistikk er (mi oversetting):10 «Faget tar for seg innsamling, klassifisering, presentasjon og tolking av data.» Det er ei kort og grei sammenfatning av hva statistisk bearbeiding av tallmateriale dreier seg om for brukere uten godt grunnlag i matematikk.

«Lov og tilfeldighet» Erling Sverdrup, tidligere professor i statistikk ved Universitetet i Oslo, skreiv i 1960-åra et tobinds læreverk kalt Lov og tilfeldighet. Denne tittelen sammenfatter noe helt grunnleggende med faget statistikk. For det første, når en måler på eller registrerer fra grunnleggende «lovmessige» forhold, vil resultatene være påvirka av tilfeldigheter, gjerne kalt målefeil. Videre er det bak ei tilsynelatende rekke av tilfeldige funn ofte en underliggende lovmessighet. Forskningas mål er å avdekke denne lovmessigheten. Det vil igjen si at undersøkinga må legges opp slik at den underliggende lovmessigheten kommer fram til tross for tilfeldigheter i enkeltresultatene.

«Do you speak statistics?» Dette spørsmålet har vel knapt nok noen gang vært stilt. Det har rett nok vært formulert som «Do you speak mathematics?» Den vanlige bruken av denne typen spørsmål gjelder språkkunnskaper. Det grunnleggende i et språk er ord og bruken av dem, og i formell sammenheng også rettskriving og grammatikk. Skal en lære et språk ut over det grunnleggende, må en lære det i en kulturell sammenheng. Det tilsvarende gjelder også det å forstå statistikk. Meningsfull bruk av statistikk krever mer enn å lære formler og å kunne regne på tall. Det

10

Johnson R.R. Elementary Statistics. Duxbury Press, Belmont, California. 6. utgave 1992. ISBN 0-53492980-X, s. 4.


22  kapittel 1 innledning – hva er statistikk? er viktig å skjønne noen av ideene bak statistiske prinsipp og metoder. Den tankegangen er forsøkt lagt til grunn for utforminga av boka. Flere eldre, enkle statistiske metoder som har vært foreslått og noe brukt, men som seinere har vist seg ikke å være særlig godt egna, blir likevel presentert i vedlegg i boka. Målet med det er ikke å prøve å gjenopplive metoder som har blitt skjøvet til side fordi det har vist seg at metodene ikke er særlig følsomme. De blir presentert fordi tankegangen bak disse metodene er enkel og intuitivt rimelig, og altså viser noe av det å tenke statistisk.

Hvordan lærer en statistikk? Statistikk er et matematisk fag. Statistikk og statistiske metoder er samtidig viktige verktøy som blir brukt i mange andre fag til å behandle kvantitative data. Denne vekselvirkninga mellom på den ene sida å være et matematisk fag og på den andre sida å være et hjelpemiddel for andre fag som ellers ikke krever god matematisk skolering, har skapt pedagogiske problemer og ført til at mange brukere sliter med å forstå statistikk. Ei tilnærming har vært å gi det matematiske grunnlaget og deretter omsette det i praksis. Denne tilnærminga virker godt bare for de som har gode kunnskaper i matematikk. Det vil for det første si «full pakke» med matematikk fra videregående skole, og i tillegg bør en gjerne ha minst ett år med matematikk på universitets- eller høgskolenivå. Det kravet går langt ut over det en kan vente av mange brukere. Ei anna tilnærming som har vært mye brukt, har vært å hoppe over det matematiske grunnlaget og gå rett på bruken. Problemet med dette er at en da trener opp brukere til å utføre praktiske oppgaver uten at de skjønner hva de gjør. Det kan føre til misbruk av statistikk og feiltolking av resultatene. Denne boka prøver å gi et tilstrekkelig matematisk grunnlag til å forstå det mest grunnleggende for praktisk bruk. Statistiske utregninger forutsetter ofte bruk av krevende matematisk formler og blir i tillegg ofte krevende også når det gjelder utregninger. Tidligere måtte en regne for hand eller bare med hjelp av en lommeregner. Selv en moderat jobb kunne kreve mange timer eller flere dagers arbeid. Videre kunne én eneste inntastingsfeil føre til feil i sluttsvaret. Det førte igjen til krav om tidkrevende kontrollarbeid. I dag kan tilsvarende utregninger gjøres på sekunder eller noen få minutter med en vanlig PC etter at rådataene er lagt inn i programmets dataark. Det viser flere viktige sider ved det å bruke datakraft til statistiske


Hva er statistikk?  23

utregninger. Ikke bare kan et godt dataprogram spare brukeren for mye tidkrevende regnearbeid, men arbeidet med å finne de rette formlene kan i stor grad overlates til programmerere. Når arbeidsmengden nå er redusert så mye, kan en lett analysere de samme dataene med ulike metoder for så å sammenlikne resultatene. Skal en lære statistikk, holder det ikke å lese teori. En viktig del av læringa er å regne på aktuelle data. Det vil si at brukeren må sette av tid til å øve seg med å regne på virkelige resultater. For å slippe tidkrevende manuelt arbeid med tunge, men trivielle utregninger, bør en lære seg høvelige dataprogram. Mange enklere beregninger kan gjøres i et regneark som Excel, et program som fins på nesten alle PC-er, og som norske utdanningsmyndigheter i dag forutsetter at alle studenter har skaffa seg.

Statistikk er et middel i data-analyse Det å bruke statistiske metoder på innsamla data er ikke noe mål i seg selv. Målet er å analysere dataene for å trekke ut vesentlige opplysninger. Til det er ofte statistikk ett av flere gode hjelpemidler. I tråd med dette kalles det aktuelle hovedfaget (nå master) ved Matematisk institutt ved Universitetet i Oslo for «statistikk og data-analyse». Johnsons ord gjengitt foran kunne like gjerne ha vært knytta til begrepet data-analyse. Hovedmålet med denne boka er å gi leseren hjelp til å forstå hvordan data kan analyseres med statistiske metoder, enten en skal analysere egne data eller lese forskningslitteratur. Det er derfor boka er kalt Innføring i statistikk og data-analyse for studenter i idretts- og helsefag. Det blir i tillegg gitt råd og retningslinjer for hvordan en skal behandle tall, og det blir gitt eksempler på hvordan resultater kan framstilles.

Misbruk av statistikk I dagens samfunn øker bruken av statistikk og statistiske analyser stadig. Noen lar seg imponere av at andre bruker statistiske analyser. Det kan føre til misbruk. Et klassisk eksempel er (politiske) meningsmålinger. I dag er det vel kjent at utfallet av enkeltundersøkinger har klare feil, gjerne 2–3 prosentenheter for undersøkinger av vanlig omfang. Før det blei allment kjent, kunne en oppleve at politikere jubla over tilsynelatende framganger på noen tidels prosentenheter, mens andre fortvila over tilsvarende «tilbakeganger»; disse små endringene fra gang til gang kunne like gjerne komme av tilfeldigheter.


24  kapittel 1 innledning – hva er statistikk? En mye brukt og enda mer misbrukt statistisk metode er å korrelere to størrelser med hverandre. Resultatet blir gjerne uttrykt som en korrelasjonskoeffisient. Det å tolke et slikt tall på en meningsfull måte uten hjelp av datakraft og godt analyseverktøy er krevende selv for matematikere. Likevel legger mange brukere stor vekt på korrelasjoner som gjerne kan skyldes tilfeldigheter, og der det iallfall er igjen en stor, uforklart variasjon. Misbruken har vært så stor at en ledende britisk statistiker i ei lærebok skreiv (mi oversetting): «Misbruk av korrelasjon er så vanlig at noen statistikere har ønska at metoden aldri hadde blitt tenkt ut.»11 Statistisk fortolking av materiale har i flere tilfeller vært misbrukt i rettslig sammenheng. En vanlig feil er at en bare har trukket inn de opplysningene som taler for et bestemt syn, mens forhold som taler imot, har blitt utelatt. En annen vanlig feil er å tillegge særskilte hendinger presise sannsynligheter uten saklig grunnlag, men bygd på (dårlig) skjønn. Datamaskiner med høvelige program har gjort det mulig å regne ut mange resultater svært fort. I det ligger det ikke bare muligheter, men også en stor fare. Om en må bruke mange timer eller flere dager på å regne ut et resultat, gjør en ikke det uten å være trygg på at arbeidet har verdi. Om det samme kan gjøres på noen få minutter, kan det være fristende å gjøre mange utregninger uten nærmere plan bak for å se om noen av dem kan gi et budskap som kan selges. Denne utviklinga har ført til at forfatterne av ei amerikansk lærebok har uttalt (mi oversetting): «Aldri noen gang tidligere i menneskehetens historie har det vært mulig å komme fram til så mange feilaktige svar så fort.»12 Dette utsagnet er en klar advarsel mot å la datamaskinen regne uten at en skjønner hva den gjør. Det vil igjen si at de som bruker slike program, må kunne noe av grunnlaget for beregningene selv om detaljer kan overlates til matematikere og programmerere. Bruken av statistikk vokser, ikke minst som følge av stadig økende tilgang til datakraft og analysemetoder. Ei innføringsbok kan bare ta opp et lite antall emner. Et tilleggsmål med denne boka er å gi leseren ei innføring i hva statistisk tankegang er, med håp om at leseren lettere skal kunne skjønne tankegangen bak metoder som ikke blir tatt opp i boka.

11 12

Altman D.G. Practical Statistics for Medical Research. Chapman & Hall/CRC 1999, Boca Raton, USA. ISBN 0-412-27630-5. Se s. 278. Cheney W., Kinkaid D. Numerical Mathematics and Computing. Brooks/Cole Publ. co., Monterey, CA, USA. ISBN 0-8185-0357-2. Se s. 2


Oversikt over bokas innhold og oppbygninga av kapitlene  25

Oversikt over bokas innhold og oppbygninga av kapitlene 1. Dette innledningskapitlet starta med noen eksempler på hva statistisk analyse kan gi oss. Det fortsatte med å si noe om hva statistikk er. Det avsluttes med noen enkle eksempler på sammenfatning av datasett, sammenfatninger som så seinere kan bli brukt i videre statistiske analyser. 2. I noen fagtradisjoner, blant annet idrettsfag, samfunnsfag og til dels helsefag, skiller en mellom kvalitative og kvantitative metoder. Statistikk er et viktig verktøy for å analysere kvantitative data. Dette kapitlet gir også en kort oversikt over forskningsprosessen. Det gir videre en oversikt over to viktige sett av verktøy for å sammenfatte data. Videre gir det retningslinjer for handtering og bruk av tall. 3. Kapittel 3 gir ei kort innføring med konkrete eksempler på hva som ligger i begrepet tilfeldige prosesser og sannsynlighetsregning. 4. Statistikk bygger på sannsynlighetsregning, et reint matematisk fag. I kapittel 4 blir det gitt ei innføring i sannsynlighetsregning. 5. Et viktig mål med statistikk er å kunne si noe vesentlig om en større helhet ut fra et avgrensa materiale. Da er det å estimere sentrale størrelser et viktig verktøy. Ofte har en hypoteser som at det er systematiske forskjeller mellom gruppe A og gruppe B, eller at et gitt behandlingsopplegg har ei klar virkning, eller at det er en klar, underliggende sammenheng mellom X og Y. Til det trenger en verktøy for å kunne estimere og vite hvor pålitelige disse estimatene er. Videre trenger en verktøy for formell hypotesetesting. Det blir tatt opp i kapittel 5. 6. Fra kapittel 6 og utover kommer innføring i konkrete statistiske metoder. I kapittel 6 blir det forklart hvordan en går fram når en skal sammenlikne resultatene fra to ulike, uavhengige utvalg. Det kan være om en vil sammenlikne kvinner med menn, et utvalg av personer som trener, med et utvalg som ikke trener, ei gruppe sjuke personer med friske, to grupper elever som har gjennomført hvert sitt undervisningsopplegg, eller to grupper idrettsutøvere som har gjennomført hvert sitt treningsopplegg. 7. Ofte har en markerte forskjeller mellom personer, og det gjør at ulike resultater mellom to grupper noen ganger godt kan forklares med tilfeldige variasjoner. Om hver person kan tjene som sin egen referanse, kan en redusere disse tilfeldige variasjonene mye. Det gjør at bruk av parvise sammenlikninger ofte er gunstig. Slike sammenlikninger har en når resultatene for en person sammenliknes før og etter ei «behandling». I idrett kan behand-


26  kapittel 1 innledning – hva er statistikk? linga være et treningsopplegg. I skolesammenheng kan behandlinga være et undervisningsopplegg. I helsesammenheng kan det noen ganger være tale om medisinsk behandling. Det kan også være at det å bli sjuk kan regnes som ei «behandling» der en kan ønske å måle virkninga av sjukdommen. Slike spørsmål blir tatt opp i kapittel 7. 8. I enkle tilfeller sammenlikner en bare to grupper eller bare ett sett av målinger på personer før og etter ei behandling. I større undersøkinger og opplegg vil en ofte undersøke mer enn to grupper, eller en måler mer enn én størrelse, og en ønsker å analysere resultatene under ett. Kapittel 8 gir ei innføring i hvordan en bør gjøre det, og verktøyet kalles variansanalyse. 9. Ofte vil en se på sammenhenger mellom to variabler (regresjonsanalyse). Det kan for eksempel være at størrelsen Y øker eller faller (rettlinja) med en annen størrelse X, eller det kan være å se hvordan det maksimale O2-opptaket påvirker resultatet på en Cooper-test der de med et høyt maksimalt O2-opptak yter bedre, og derfor greier å løpe lenger på de 12 min som testen varer (en positiv sammenheng). Det kan også være å se på sammenhengen mellom melkesyreterskelen og prestasjonen på et langdistanseløp der de med en høy terskelverdi løper fortere og derfor bruker mindre tid (en negativ sammenheng). Det fins gode statistiske verktøy for å undersøke dette, og det blir tatt opp i kapittel 9. 10. De statistiske analysene som har vært tatt opp i kapitlene foran, er i første rekke av kontinuerlige størrelser. En annen viktig type utfall er der en registrerer antall hendinger, altså heltallige størrelser. Kapittel 10 tar opp to ulike typer modeller: Det er for det første binomiske forsøk der utfallet av hvert enkelt forsøk kan være «suksess» eller «fiasko» ut fra et gitt kriterium. Det andre som blir tatt opp, er såkalte poissonprosesser der det er en underliggende grunnrate som forårsaker et særskilt utfall, et «uhell». I fysikk kan det for eksempel være radioaktive reaksjoner, i helsesammenheng kan det være ulykker eller sjukdom. Nyere undersøkinger har vist at slike modeller er godt egna til å si noe om forekomsten av skåra mål i fotballkamper. 11. Resultater kan ofte plasseres i ulike kategorier («båser»), gjerne oppstilt i tabeller. Det har gjort at en har utvikla statistiske metoder for å analysere slike data. Kapittel 11 gir ei innføring i analyse av kategoriske data, eller det som mer konkret kan kalles analyser av multinomiske forsøk. 12. Boka blir avslutta med et kapittel med noen praktiske eksempler på bruk av statistikk og på data-analyse som går ut over vanlige statistiske analyser. I tillegg tar dette kapitlet opp noen prinsipielle sider ved bruk av statistikk.


Sammenfatning av data – deskriptiv statistikk  27

Statistikk er et matematisk fag, mens boka er skrevet for lesere og brukere uten gode kunnskaper i matematikk. Det er nevnt foran at det i det ligger en mulig konflikt. Den er forsøkt løst ved at hvert emne først blir gitt ei forklaring uten mye bruk av matematikk. I flere av kapitlene blir så deler av den underliggende matematikken tatt opp i et vedlegg til kapitlet kalt «Matematikken bak …».

Sammenfatning av data – deskriptiv statistikk I enkelte sammenhenger kan en oppgi alle resultatene. Det er typisk tilfellet i idrettskonkurranser der en oppgir alle resultatene for alle deltakerne. Det er også tilfellet for en analyse på et moderne apparat av en blodprøve tatt fra en pasient. Det kan også være aktuelt i svært små undersøkinger der en får bare noen få resultater. I de aller fleste tilfeller ønsker en å sammenfatte resultatene på en enkel måte, da slik at en med noen få, enkle tall sitter igjen med det vesentlige. Det er vanlig selv om en bare har 3–4 enkeltresultater. Det er da gjerne to størrelser som går igjen. Det er for det første et mål for den typiske størrelsen, en eller annen form for en sentraltendens (et midtmål). En ønsker ofte i tillegg også å si noe om variasjonen mellom de ulike størrelsene, og til det trengs et spredningsmål.

Praktiske eksempler og oppgaver Det blir her gitt to eksempler med oppgaver. Formålet er for det første å vise noe om enkle og mye brukte sammenfatninger av data. Et annet mål er å gi enkle, gode kontroller på om det kan være alvorlige feil i dataene. Så bør leseren gjøre tilsvarende beregninger på egne data.

Eksempel med oppgave Evertsen og medarbeidere lot gode junior langrennsløpere av begge kjønn gjennomføre et fem måneder langt treningsopplegg.13 Før og etter treningsperioden gjennomførte løperne ei rekke tester. Det blei blant annet undersøkt hvor langt de greide å løpe på tredemølle i løpet av 20 min både før og etter treningsperioden, se tabell 1.1. Resultatene er sammenfatta ved å regne ut gjennomsnittet, medianen, antall verdier (her ni), standardavviket og den største og minste verdien i datasettet. 13

Se f.eks. Evertsen F. mfl. Hard endurance-training increases Na+-K+ pump concentration in skeletal muscle of elite cross-country skiers. Am J Physiol Regulatory Integrative Comp Physiol 1997; 272: R1417–R1424.


28  kapittel 1 innledning – hva er statistikk? Tabell 1.1 Tilbakelagt distanse under 20 min løp på tredemølle før og etter en fem måneder lang treningsperiode på barmark. Løper

Før

Etter

Endringer

A

3842

4022

180

B

3808

3976

168

C

3925

4032

107

D

3882

3969

87

E

3777

3930

153

F

3711

3752

41

G

3539

3692

153

H

3642

3632

–10

I

3420

3442

22

Middel

3727

3827

100

= GJENNOMSNITT(…)

Median

3777

3930

107

= MEDIAN(…)

9

9

9

= ANTALL(…)

167

207

69

= STDAV.S(…)

Største verdi

3925

4032

180

= STØRST(…)

Minste verdi

3420

3442

–10

= MIN(…)

Antall Standardavvik.s

Excel-formel

Verdiene er tilbakelagt distanse i meter og er fra ni gode kvinnelige junior langrennsløpere. Verdien for endringa for hver enkelt løper er tatt som verdien etter minus verdien før. De formlene i Excel som er brukt for å regne ut sammenfattende verdier nederst i tabellen, står til høyre. I parameterfeltet (…) må en sette inn det aktuelle dataområdet.

Det å framstille resultater grafisk er ofte en grei måte å legge dem fram på. Resultatene i tabell 1.1 er sammenfatta i figur 1.1.

Oppgaver og kontrollspørsmål 1. I tabell 1.1 over er resultater fra ei treningsundersøking med ni deltakere gitt, og resultatene er sammenfatta nederst i tabellen. Gjenta utregningene, enten ved hjelp av papir, blyant og en lommeregner, eller ved å legge dataene inn i et regneark. For standardavviket fins det gjerne to ulike formler, en populasjonsvariant som enten er merka .p eller med n, og en utvalgsvariant som enten er merka med .s eller med (n – 1). Bruk den siste (utvalgsvarianten), for populasjonsvarianten er bare for særskilte høve. 2. Bruk resultatene til å tegne en figur tilsvarende den i figur 1.1. Velg selv om du vil gjøre det med papir, blyant og linjal, eller ved å legge dataene inn i


Oppgaver og kontrollspørsmål  29 4100

Tilbakelagt distanse / m

4000 3900 3800 3700 3600 3500 0

Før

Etter

Figur 1.1 Tilbakelagt distanse under et 20 min langt løp på tredemølle før og etter en fem måneder lang treningsperiode. Verdiene er gjennomsnitt ± standardavvik for ni gode kvinnelige junior langrennsløpere som gjennomførte et fem måneder langt treningsopplegg på barmark. Y-aksen er kutta ved 3450 m.

et egna plotteprogram. Merk at et program som Excel egner seg godt til å plotte data, men det har ikke mulighet for å legge inn brudd på en akse. Da bør en heller la y-aksen gå fra en verdi mellom 3000 og 3400.

Merknader Middelverdien eller gjennomsnittet bør være en kjent størrelse fra grunnskole­ matematikken, og også medianen skal være det. Medianen er den midtre verdien, og den finner en formelt ved først å rangere verdiene etter økende verdi. Så stryker en parvis den minste og den største, den nest minste og den nest største og så videre til en sitter igjen med én verdi: medianen.14 Antallet er selvforklarende, og det er også den største og den minste verdien. Standardavviket er et mye brukt statistisk spredningsmål som blir forklart nærmere i et seinere kapittel i boka (se s. 50). Som en tommelfingerregel kan en si at om lag to av tre verdier ligger inntil ett standardavvik fra gjennomsnittet. Sjekk om den grovregelen stemmer for dette tilfellet. Det å telle opp antallet kan synes å være unødvendig for dette vesle datasettet, for det er lett å gjøre manuelt. Det samme kan en si om det å finne den minste

14

Eventuelt gjennomsnittet av to om antall verdier er et partall.


30  kapittel 1 innledning – hva er statistikk? og den største verdien. Om det er store, åpenbare feil i enkeltverdier, vil det slå ut på enten den største eller den minste verdien. For dette vesle datasettet kan en enkelt undersøke mulige store avvik bare ved å se gjennom dataene. Med tanke på arbeid med større datasett er det en enkel og god regel at en i eget arbeid alltid bruker både opptellingsfunksjonen og finner den minste og den største verdien i datasettet. I utregningene er det lagt vekt på å få med rett antall desimaler. Mange dataprogram og lommeregnere gir svaret med svært mange desimaler. Det å oppgi overflødige desimaler forstyrrer lesinga og er i tillegg et tegn på at den som har oppgitt svaret, ikke har god tallforståelse. 3. Gjenta oppgave 1 og 2 foran med dataene i tabell 1.2 under. Svaret på utregningene med et passende antall desimaler er gitt til slutt som hjelp og for kontroll. Tabell 1.2 Høyde og vekt for seks sprintere som har deltatt i et arbeidsfysiologisk forsøk. Person

Høyde/cm

Vekt/kg

A

173

73

B

173

65

C

180

75,5

D

186

77

E

184

73,5

F

191

88

Middel

181,2

75,3

Median

182,0

74,5

Antall

6

6

Standardavvik.s

7,3

7,5

Minste

173

65

Største

191

88

4. Forklar kort med egne ord hva som skiller statistikk med tilfeldige prosesser fra «vanlig» matematikk. 5. Ta utgangspunkt i resultatene for en av personene i tabell 1.2 foran, for eksempel høyden for den første av dem. Er dette en tilfeldig størrelse? Grunngi svaret.


Oppgaver og kontrollspørsmål  31

De seks personene i denne undersøkinga er et tilfeldig utvalg av langt større populasjoner av sprintere. Det blei tatt et nytt utvalg fra denne populasjonen, og høyden og vekta for de utvalgte blei målt. Er verdiene for den første av de utvalgte da å regne som tilfeldig? 6. Gi noen eksempler der statistisk analyse av data kan være et nyttig verktøy. Gi noen eksempler på misbruk av statistikk.


Turn static files into dynamic content formats.

Create a flipbook
Utdrag Innføring i statistikk og dataanalyse by Cappelen Damm - Issuu