Regresjon bruker data til å bygge matematiske modeller. Du lærer å velge, kontrollere og tolke lineære, eksponentielle, potens- og polynommodeller med GeoGebra, regneark og Python.
Faglig kvalitetssikret av lærere og toppstudenter · Følger læreplanen (LK20) · Sist oppdatert 2026-09-03
Matematikk 2P · kapittel 5
Regresjon er ikke bare å trykke på en knapp og få en formel. Du skal forstå datasettet, velge en modell, tolke parameterne, undersøke residualene og vurdere om modellen er faglig troverdig. Kapittelet samler hele arbeidsprosessen fra rådata til en begrunnet konklusjon.
Spredningsdiagram Regresjonsmodeller Residualer og R² GeoGebra, regneark og PythonDu bør kunne lese koordinatsystemer, tolke funksjonsuttrykk, bruke prosent og vekstfaktor og skille lineær fra eksponentiell utvikling. Kapittelet repeterer det viktigste når metodene brukes.
Bruk figurene og datatabellene aktivt. Gjør en visuell vurdering før du velger regresjonstype, og kontroller alltid modellen med residualer, enheter og praktisk mening.
Regresjon er en metode for å finne en matematisk funksjon som beskriver et mønster i observerte data. Metoden brukes når punktene ikke ligger perfekt på én kjent graf, men likevel viser en retning eller form. Datamaskinen beregner parameterne, men det er eleven som må avgjøre hvilken modelltype som er relevant, hva parameterne betyr og om modellen kan brukes i situasjonen.
Et regresjonsresultat består av mer enn et funksjonsuttrykk. En full analyse inneholder forskningsspørsmål, forklaring av variablene, spredningsdiagram, valgt modell, parameterfortolkning, residualkontroll, vurdering av gyldighetsområde og en praktisk konklusjon. Hvis ett av disse leddene mangler, blir modellen vanskelig å kontrollere.
Matematisk modellering er en sirkel, ikke en rett linje. Når residualene viser et mønster eller modellen gir urimelige prognoser, må du gå tilbake og endre datagrunnlaget, velge en annen modell eller begrense gyldighetsområdet. En modell er derfor et begrunnet forslag til sammenheng, ikke en endelig sannhet.
| Ledd | Hovedspørsmål | Dokumentasjon |
|---|---|---|
| Problem | Hva skal undersøkes? | Presist spørsmål og målgruppe |
| Data | Hva er målt, og hvordan? | Tabell, enheter og kilde |
| Modell | Hvilken funksjon passer? | Formel, graf og parametere |
| Kontroll | Hvor godt passer den? | Residualer, R² og testdata |
| Tolkning | Hva betyr resultatet? | Konklusjon og begrensninger |
Sensorblikk
Vis hele kjeden fra data til konklusjon. Et regresjonsuttrykk uten parameterfortolkning og modellkritikk er ikke en fullstendig løsning.
Før du åpner GeoGebra eller regnearket, må du formulere hva du vil undersøke. Et godt spørsmål avgrenser hvilke enheter som observeres, hvilke to størrelser som sammenliknes og hvilket tidsrom eller område dataene gjelder. «Er det en sammenheng mellom øvingstid og prøveresultat blant elevene i gruppen?» er mer presist enn «Påvirker øving karakteren?» fordi det siste allerede antyder årsak.
Den uavhengige variabelen plasseres vanligvis på x-aksen, mens responsvariabelen plasseres på y-aksen. Dette er et modellvalg, ikke en naturlov. I noen datasett kan begge variabler være observerte størrelser uten at den ene styrer den andre. Da må språket være nøytralt: modellen beskriver hvordan y samvarierer med x, men beviser ikke at x forårsaker y.
Enheter er en del av matematikken. Hvis x måles i år og y i tusen personer, får stigningstallet enheten tusen personer per år. Bytter du fra år til måneder eller fra personer til tusen personer, endres parameterverdiene selv om datamønsteret er det samme. Derfor skal variabler og enheter alltid stå i tabell, aksetekst og konklusjon.
| Kontrollpunkt | Eksempel | Hvorfor viktig |
|---|---|---|
| Observasjonsenhet | én kommune | Avklarer hva hvert punkt representerer |
| x-variabel | år etter 2020 | Bestemmer forklaringsakse |
| y-variabel | innbyggere i tusen | Bestemmer respons og enhet |
| Intervall | 2020–2026 | Avgrenser gyldighetsområdet |
| Datakilde | samme målemetode hvert år | Reduserer systematiske brudd |
Sensorblikk
Definer variablene med enhet og forklar hva ett datapunkt representerer. Det gjør parameterfortolkningen etterpå presis.
Regresjon kan ikke reparere svake data. Før analysen må du kontrollere om verdiene er registrert med samme enhet, om desimalskilletegn er tolket riktig, om noen rader er duplikater og om manglende verdier er markert på en konsekvent måte. En tom celle skal ikke automatisk behandles som tallet null; null er en faktisk observasjon og kan endre modellen kraftig.
Avvikende verdier kan skyldes tastefeil, målefeil eller et ekte, interessant fenomen. Det er faglig uheldig å fjerne et punkt bare fordi modellen får høyere R² uten punktet. Først må du undersøke kilden, dokumentere hva du gjør og gjerne vise analysen både med og uten punktet hvis valget påvirker konklusjonen.
Data kan også være skjeve fordi utvalget ikke representerer gruppen du vil uttale deg om. Hvis en undersøkelse om reisevaner bare deles i én klasse eller én kanal, kan regresjonen være matematisk korrekt for datasettet, men lite relevant for hele skolen eller kommunen. Modellkritikk begynner derfor allerede ved datainnsamlingen.
| Problem | Konsekvens | God praksis |
|---|---|---|
| Ulike enheter | parameterne blir meningsløse | konverter før analyse |
| Tom celle behandles som 0 | kunstig lav verdi | bruk manglende-verdi-markering |
| Duplikat | observasjonen får dobbel vekt | fjern bare etter kontroll |
| Tastefeil | kan dominere regresjonen | kontroller mot originalkilde |
| Endret målemetode | strukturbrudd i serien | merk tidspunktet og vurder stykkevis modell |
Sensorblikk
Forklar hvilke kontroller som er gjort. Datavask er en del av løsningen når feil eller manglende verdier kan påvirke modellen.
Et spredningsdiagram viser parvise observasjoner som punkter i et koordinatsystem. Hvert punkt kobler en x-verdi til en y-verdi. Diagrammet brukes før regresjon for å undersøke form, retning, styrke og avvik. Du bør ikke velge modelltype bare ved å trykke på en regresjonsknapp; datamønsteret må først vurderes visuelt og faglig.
En positiv sammenheng betyr at y ofte øker når x øker, mens en negativ sammenheng betyr at y ofte avtar. Punktene kan ligge tett rundt en trend eller være spredt. En enkelt observasjon langt fra resten kan være et avvik. Avviket kan skyldes målefeil, registreringsfeil eller en reell spesiell situasjon, og det skal undersøkes før du eventuelt fjerner punktet.
Sammenheng er ikke det samme som årsak. To størrelser kan variere sammen fordi en tredje faktor påvirker begge. Et spredningsdiagram kan støtte en prediktiv modell, men beviser ikke at x forårsaker y. I samfunnsdata er dette særlig viktig, og modellteksten bør skille observasjon, statistisk sammenheng og årsaksforklaring. …