Vraag 4: Interpretatie modellen en diagnostisch rapport
Open het diagnostisch rapport voor het model met alle onafhankelijke variabelen behalve Dew Point Temperature door op het vergrootglas te klikken bij de Linear Regression Diagnostics node. Bekijk de ANOVA tabel. Wat vertelt de p-waarde over de significantie van het geschatte regressiemodel?
Antwoord:
Open het coëfficiënten overzicht door op het vergrootglas van de Linear Regression node te klikken. Van welke variabelen wijkt de regressiecoëfficiënt niet significant van nul af bij alpha = 0,05?
Antwoord:
Gebruik de zogeheten step-down procedure (dit is een vereenvoudigde manier van modelselectie) om onafhankelijke variabelen met niet-significante regressiecoëfficiënten weg te laten uit het model:
Laat de variabele met de hoogste p-waarde > 0,05 weg en schat het model opnieuw
Bekijk de nieuwe p-waarden voor de coëfficiënten
Zijn er p-waarden > 0,05, ga dan weer naar stap 1; anders einde
Wat is de regressievergelijking van het uiteindelijke model? (rond coëfficiënten af op gehele getallen)
Antwoord:
De effectgrootte van het model beoordelen we via R-squared (determinatiecoëfficiënt). Deze vind je bij het overzicht dat je krijgt door op het vergrootglas bij de Linear Regression Learner node te klikken. Wat is de waarde van R-squared? Wat vertelt dit?
Antwoord:
Run de Linear Regression Diagnostics node nogmaals met het uiteindelijke model en open het diagnostics rapport.
De significantietoetsing bij lineaire regressie stemt ook voort uit de centrale limietstelling. De residuen zullen dan ook bij kleine datasets bij benadering normaal verdeeld moeten zijn. Bekijk het histogram van de residuen in het diagnostics rapport. Zijn de residuen normaal verdeeld?
Antwoord:
Een andere aanname die we moeten checken is die van lineariteit. Als de lineaire regressievergelijking Total Rentals goed voorspelt en er dus voldaan wordt aan de aanname van lineariteit zullen de residuen in de Error vs predicted values plot willekeurig verspreid rondom de nul-lijn moeten liggen. Is dit het geval?
Antwoord:
De laatste aanname die we checken is die van homoscedasticiteit. Dit houdt in dat de variantie van de residuen constant is voor alle waarden van de voorspelde waarden. Dit kunnen we in dezelfde plot checken. Is de spreiding in de residuen hetzelfde voor alle predicted values?
Antwoord: