Coefficienti e ipotesi della regressione OLS
Comprendi l'obiettivo dei minimi quadrati, l'interpretazione condizionata dei coefficienti, i residui, l'esogeneità, la multicollinearità, l'omoschedasticità e un'analisi responsabile della regressione finanziaria
Risposta diretta
I minimi quadrati ordinari scelgono i coefficienti che minimizzano la somma delle differenze al quadrato tra risultati osservati e valori adattati lineari. Un coefficiente descrive la differenza lineare media nel risultato associata a una differenza di un'unità nel suo regressore, mantenendo fissi gli altri regressori inclusi. Trasformare questa proiezione descrittiva in un effetto causale richiede ipotesi aggiuntive come un errore a media condizionata nulla; un R² elevato o residui piccoli non possono dimostrarle
OLS minimizza i residui al quadrato
Nel modello y=Xβ+u, OLS sceglie β per rendere il più piccola possibile la somma delle differenze al quadrato tra osservazioni e valori adattati Xβ
Quando le colonne della matrice di progetto hanno rango pieno, la soluzione viene comunemente scritta β̂=(X′X)⁻¹X′y
Elevare al quadrato crea un obiettivo trattabile e penalizza fortemente gli errori grandi, quindi errori nei dati e outlier influenti possono avere una leva sostanziale
Un coefficiente è un confronto lineare condizionato
Il coefficiente βj è la differenza adattata in y per una differenza di un'unità in xj quando le altre variabili incluse sono mantenute agli stessi valori
Il risultato di Frisch–Waugh–Lovell dà lo stesso coefficiente dopo aver rimosso separatamente il contributo lineare degli altri controlli da y e xj, quindi aver regredito i due residui
Il suo significato dipende quindi da controlli, forma funzionale, unità e campione; non è semplicemente la correlazione tra due variabili grezze
La linearità riguarda i parametri
Una regressione lineare deve essere lineare nei coefficienti, ma i regressori possono includere logaritmi, quadrati, spline, indicatori e interazioni
Con un'interazione, la relazione marginale per una variabile cambia con il valore di un'altra, quindi un coefficiente principale non può essere letto isolatamente
L'estrapolazione estende la forma funzionale scelta oltre il supporto osservato ed è un'affermazione molto più forte rispetto all'adattare bene il campione
Ipotesi diverse forniscono garanzie diverse
Una media condizionata nulla dice che le componenti omesse del risultato non siano sistematicamente prevedibili dai regressori inclusi ed è centrale per la consistenza o l'interpretazione strutturale
L'omoschedasticità richiede una varianza condizionata dell'errore uguale tra i valori dei regressori; riguarda più la formula classica della varianza e l'efficienza che l'assenza di bias dei coefficienti
Gli errori normali non sono necessari per calcolare OLS, anche se la normalità può sostenere inferenza esatta t e F in piccoli campioni nel modello classico
Un residuo non è l'errore non osservato della popolazione
Un residuo e=y−Xβ̂ è la differenza osservata da un valore adattato stimato sullo stesso campione, mentre la perturbazione di popolazione u resta non osservata
Con un'intercetta, OLS costruisce residui ortogonali ai regressori campionari, quindi una correlazione campionaria nulla tra loro non è un'evidenza indipendente di esogeneità
I grafici dei residui possono rivelare non linearità, varianza variabile, clustering, dipendenza seriale e outlier, ma non possono certificare il modello corretto
I dati finanziari mettono sotto pressione le ipotesi da manuale
I rendimenti mostrano clustering della volatilità ed eventi di coda, mentre i rendimenti su periodi di detenzione sovrapposti creano correlazione seriale per costruzione
I panel societari possono contenere persistenza all'interno di ogni impresa e shock comuni tra imprese nella stessa data, violando la semplice indipendenza delle osservazioni
Trend nelle serie dei livelli, survivorship, price discovery simultanea ed errori di misurazione possono far apparire un coefficiente significativo più strutturale di quanto sia
Riporta stima e incertezza insieme
Dichiara estimand, campione, unità, trasformazioni, controlli, effetti fissi, regole sui dati mancanti e stimatore della covarianza prima di interpretare il numero
Abbina ai coefficienti errori standard o intervalli, traducili in variazioni realistiche e testa la sensibilità a osservazioni influenti e specifiche difendibili
Valuta identificazione e stabilità nel tempo o fuori campione separatamente da R², segno e significatività statistica
Domande frequenti
Cosa significa un coefficiente di regressione OLS?
È la differenza lineare media adattata nel risultato associata a un'unità del regressore, mantenendo fissi gli altri regressori inclusi
Una regressione lineare può rappresentare una relazione curva?
Sì. Può usare logaritmi, potenze, spline e interazioni finché il modello resta lineare nei coefficienti
La multicollinearità distorce i coefficienti?
La multicollinearità imperfetta non crea di per sé bias, ma può aumentare gli errori standard e rendere i coefficienti molto sensibili al campione
Gli errori standard robusti risolvono le ipotesi OLS violate?
No. Rilassano alcune ipotesi selezionate sulla covarianza, ma non correggono endogeneità, forma funzionale errata o bias di selezione nel coefficiente